蚂蚁开源百灵视觉大模型:图片转网页得分超 GPT-5.4

9 月 9 日,蚂蚁集团宣布推出并开源百灵(Ling)系列首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE(混合专家)架构扩展而来,总参数量为 124B,单次推理仅激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256K Token。

与常见的”语言模型外挂视觉模块”方案不同,Ling-3.0-flash-VL 从训练阶段就采用图文视频联合训练。模型引入任意分辨率视觉编码器与 VideoRoPE,语言主干沿用 42 层混合架构,KDA 与 Gated MLA 按 5:1 比例交替排列。在保持单次激活 5.5B 参数的小算力开销的同时,模型可在实时视频对话、多轮视觉交互和长时任务中保持低延迟响应。

视觉能力加入后,文本智能不降反升

业界长期存在一个担忧:给大模型加上视觉能力,会稀释甚至拉低它的文本智能。蚂蚁集团的训练实践给出了相反的结论——原生多模态联合训练不仅拓展了应用边界,还拉升了文本表现。

在 Artificial Analysis Intelligence Index v4.1.1 评估中,Ling-3.0-flash-VL 较纯文本版本 Ling-3.0-Flash 提升了 4 分。官方解释称,来自图像和视频的信息帮助模型建立了对概念、空间和现实世界更完整的理解,视觉并不只是一种新的输入模态。

视觉反馈闭环:从”看图说话”到”看结果干活”

Ling-3.0-flash-VL 的核心亮点是引入了视觉反馈闭环机制。传统多模态模型的任务执行是一次性的”生成”,而该机制将任务推进为”观察 → 行动 → 验证 → 修正”的持续闭环:模型执行操作后观察结果,与目标对比,发现偏差并持续修正。

这一机制在三个场景中体现出价值。在前端开发场景,模型可根据网页截图理解布局、配色和组件关系,生成前端代码后查看浏览器渲染结果,与参考图对比后再修改代码,形成由视觉反馈驱动的开发闭环。在 Image-to-WebDev Arena 官方评测中,该模型以代号 linthium 参赛,在”图片转网页”任务中的评测得分高于 GPT-5.4。在 GUI 自动化场景,模型可识别页面结构和应用状态,拆解操作步骤,完成点击、输入、滚动和应用切换,支撑”查找网页数据、整理到表格、再生成图表”这类跨工具任务。在医疗报告解读场景,模型可将跨页、跨时期的血常规、生化、影像等多类数据整合为完整的健康图景,以”红黄绿灯”直观展示健康风险。

已可在灵光应用中实际使用

目前,Ling-3.0-flash-VL 的部分能力已接入蚂蚁旗下灵光 App。用户借助手机摄像头可实现”一拍即答”:识别动植物种类、食材、建筑地标和车型,连续描述眼前场景,并实时识别与翻译外语标识。在学习场景,模型可结合课程画面识别公式、示意图和板书内容,围绕知识点持续答疑。针对小时级的长视频,模型可通过视觉反馈闭环完成高光剪辑,依靠 256K 上下文窗口持续追踪任务状态。

蚂蚁集团同时公布了模型的局限性:在长尾场景感知推理、长链路 Agent 执行及长程全栈编码等任务上,与最佳模型仍有差距。下一步将重点强化复杂图表与跨图片内容的理解验证能力,并提升真实工作流中的执行稳定性。

开源信息

Ling-3.0-flash-VL 现已在 Ling Studio(chat.ant-ling.com)上线,免费体验开放中。模型的 BF16 和 FP8 版本已在 Hugging Face 与 ModelScope 平台开源,FP4 和 INT4 版本计划近期发布。对开发者而言,在 124B 总参数下仅需激活 5.5B 参数即可推理,部署成本明显低于同规模稠密模型,适合用于构建视觉 Agent 工作流和多模态应用。