AI热点 3小时前 117 阅读 0 评论

超越 GPT-5 Nano,阿里通义 Qwen3-VL 系列全新成员 4B 与 8B 模型开源上线

作者头像
AI中国

AI技术专栏作家 | 发布了 246 篇文章

IT之家 10 月 15 日消息,阿里通义今日官宣 Qwen3-VL 系列再添新成员 ——Dense 架构的 Qwen3-VL-8B、Qwen3-VL-4B 模型开源上线。

Qwen3-VL-4B / 8B 是密集(Dense)视觉理解模型,显存占用更低,拥有 Qwen3-VL 的全部能力项,每个尺寸都有 Instruct 和 Thinking 两大版本。

Qwen3-VL-8B 在 STEM、VQA、OCR、视频理解和 Agent 任务等公开评测上表现优异,不仅超越 Gemini 2.5 Flash Lite 和 GPT-5 Nano,甚至可以媲美上一代超大尺寸模型 Qwen2.5-VL-72B

而 4B 版本则在端侧展现更高的性价比,适合在需要 AI 视觉理解的智能终端部署。

值得一提的是,这两款视觉理解模型实现了「视觉精准」与「文本稳健」的协同突破:针对小模型常见的“跷跷板”问题(提升视觉能力往往牺牲文本性能,反之亦然),阿里通过架构创新和技术优化,让模型在保持文本理解能力的同时,增强多模态感知与视觉理解能力,小身板里塞进了更强的视觉和文本能力

新模型现已上线魔搭社区、Hugging Face,也提供 FP8 版本,IT之家附开源地址如下:

  • https://modelscope.cn/collections/Qwen3-VL-5c7a94c8cb144b

  • https://huggingface.co/collections/Qwen/qwen3-vl-68d2a7c1b8a8afce4ebd2dbe

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

作者头像

AI前线

专注人工智能前沿技术报道,深入解析AI发展趋势与应用场景

246篇文章 1.2M阅读 56.3k粉丝

评论 (128)

用户头像

AI爱好者

2小时前

这个更新太令人期待了!视频分析功能将极大扩展AI的应用场景,特别是在教育和内容创作领域。

用户头像

开发者小明

昨天

有没有人测试过新的API响应速度?我们正在开发一个实时视频分析应用,非常关注性能表现。

作者头像

AI前线 作者

12小时前

我们测试的平均响应时间在300ms左右,比上一代快了很多,适合实时应用场景。

用户头像

科技观察家

3天前

GPT-4的视频处理能力已经接近专业级水平,这可能会对内容审核、视频编辑等行业产生颠覆性影响。期待看到更多创新应用!