AI热点 6月前 • 154 阅读 • 0 评论

超越 GPT-5 Nano，阿里通义 Qwen3-VL 系列全新成员 4B 与 8B 模型开源上线

作者头像

AI中国

AI技术专栏作家 | 发布了 246 篇文章

IT之家 10 月 15 日消息，阿里通义今日官宣 Qwen3-VL 系列再添新成员 ——Dense 架构的 Qwen3-VL-8B、Qwen3-VL-4B 模型开源上线。

Qwen3-VL-4B / 8B 是密集（Dense）视觉理解模型，显存占用更低，拥有 Qwen3-VL 的全部能力项，每个尺寸都有 Instruct 和 Thinking 两大版本。

Qwen3-VL-8B 在 STEM、VQA、OCR、视频理解和 Agent 任务等公开评测上表现优异，不仅超越 Gemini 2.5 Flash Lite 和 GPT-5 Nano，甚至可以媲美上一代超大尺寸模型 Qwen2.5-VL-72B。

而 4B 版本则在端侧展现更高的性价比，适合在需要 AI 视觉理解的智能终端部署。

值得一提的是，这两款视觉理解模型实现了「视觉精准」与「文本稳健」的协同突破：针对小模型常见的“跷跷板”问题（提升视觉能力往往牺牲文本性能，反之亦然），阿里通过架构创新和技术优化，让模型在保持文本理解能力的同时，增强多模态感知与视觉理解能力，小身板里塞进了更强的视觉和文本能力。

新模型现已上线魔搭社区、Hugging Face，也提供 FP8 版本，IT之家附开源地址如下：

https://modelscope.cn/collections/Qwen3-VL-5c7a94c8cb144b
https://huggingface.co/collections/Qwen/qwen3-vl-68d2a7c1b8a8afce4ebd2dbe

广告声明：文内含有的对外跳转链接（包括不限于超链接、二维码、口令等形式），用于传递更多信息，节省甄选时间，结果仅供参考，IT之家所有文章均包含本声明。

作者头像

AI前线

专注人工智能前沿技术报道，深入解析AI发展趋势与应用场景

246篇文章 1.2M阅读 56.3k粉丝

评论 (128)

用户头像

AI爱好者

2小时前

这个更新太令人期待了！视频分析功能将极大扩展AI的应用场景，特别是在教育和内容创作领域。

用户头像

开发者小明

昨天

有没有人测试过新的API响应速度？我们正在开发一个实时视频分析应用，非常关注性能表现。

作者头像

AI前线作者

12小时前

我们测试的平均响应时间在300ms左右，比上一代快了很多，适合实时应用场景。

用户头像

科技观察家

3天前

GPT-4的视频处理能力已经接近专业级水平，这可能会对内容审核、视频编辑等行业产生颠覆性影响。期待看到更多创新应用！

文章章节

1. GPT-4简介与注册指南

1.1 账号注册步骤

推荐文章

何必DiT！字节首次拿着自回归，单GPU一分钟生成5秒720p视频

何必DiT！字节首次拿着自回归，单GPU一分钟生成5秒720p视频

5月前 • AI热点

用户破8亿！GPT-5.1来了，表情包含量可自定义

用户破8亿！GPT-5.1来了，表情包含量可自定义

5月前 • AI热点

发布即开放：百度猎户座葫芦里卖的什么药？

发布即开放：百度猎户座葫芦里卖的什么药？

5月前 • AI热点

李飞飞的世界模型来了！一句话生成3D世界，AI 真的开始理解现实了

李飞飞的世界模型来了！一句话生成3D世界，AI 真的开始理解现实了

5月前 • AI热点

科技巨头「偷偷借钱」搞AI，次贷危机魅影重现？

科技巨头「偷偷借钱」搞AI，次贷危机魅影重现？

5月前 • AI热点

腾讯总裁剧透微信搭载智能体！阿里和谷歌也都开始互相伤害了

腾讯总裁剧透微信搭载智能体！阿里和谷歌也都开始互相伤害了

5月前 • AI热点

速抢（2核2G）77元/年香港免备案服务器

速抢（2核2G）77元/年香港免备案服务器

0秒前 • AI热点

小鹏物理AI的尽头，是马斯克的现金流

小鹏物理AI的尽头，是马斯克的现金流

5月前 • AI热点

热门标签

数字科技起点读书开源图像生成模型 AI视觉生成新海诚 meta开发者大会音频变声软件 Claude企业版 AI镜像平台百度财报

热门作者

作者头像

AI前沿

2.4k 粉丝

作者头像

机器学习实验室

1.8k 粉丝

作者头像

AI创业圈

3.1k 粉丝