让 AI 处理一份扫描文档,或照着网页截图找到按钮并完成操作,光会读文字还不够。Ling-3.0-flash-VL 是建立在 Ling-3.0-flash 上的视觉语言模型(VLM)——它能同时处理图像和文字,让 Agent 看懂页面、图表与界面状态,并据此回答或行动。相比本刊 8 月报道的 Ling 3.0 基础训练检查点,这次的新意是给 Flash 分支补上视觉理解和视觉操作能力。
据蚂蚁百灵开发者文档,Ling-3.0-flash-VL 已被列入可调用模型;AI Stack Current 也将其标为托管的视觉语言 API 模型。API 就是软件之间按约定调用能力的接口,开发者无需自行部署模型,也能把它接进应用。发布者称,该模型覆盖视觉感知、理工推理、文档理解、多模态 Agent、前端编码和医疗报告解读。不过现有材料没有给出测试数字或对比结果,实际水平仍难判断;它眼下更值得关注的,是为同时处理文档、界面操作与代码生成的视觉 Agent 增加了一个候选底座。