你交给 AI 一项要做两周的软件工程,它写完第一批代码并不算难。难的是第二天还能记住目标,遇到报错会自己检查,改完继续测试,十几天后交出真正能运行的项目。8 月 3 日正式发布的 Qwen3.8,想把重点从“会生成代码”推到“能持续把事情做完”。更值得留意的是,阿里同时开放了 API,并让模型进入企业办公产品:这不只是一轮模型升级,也是在争夺开发和工作的入口。
Qwen 是阿里巴巴的通义千问模型家族,也是开放权重生态中的重要中国供应方。本刊 7 月 20 日报道的还只是 Qwen3.8-Max 预览版;这一次,旗舰正式发布,但 API 已经可用不等于模型权重已经开放。阿里表示,Qwen3.8-Max 与 Qwen3.8-27B 预计下周开源。
以下参数、基准成绩和长任务案例主要来自阿里披露。部分内容虽经多家媒体刊载,仍没有第三方复现;量子位另有一次实际开发体验,但单次体验不能代表普遍表现。
2.4T,不等于每次都用上2.4T
旗舰版本 Qwen3.8-Max 总参数量为 2.4T,也就是 2.4 万亿。它采用稀疏 MoE——模型内部有许多“专家”子网络,每次只调用当前问题最需要的一部分。因此,模型虽然很大,单次运行实际激活的参数是 95B,即 950 亿,而不是把 2.4 万亿参数全部算一遍。
模型还使用混合注意力,即组合不同的注意力计算方式,在长内容理解、运行速度和显存占用之间做取舍。它支持视觉理解,上下文长度达到 1M Tokens。Token 是模型切分文字和代码后的基本单位;上下文长度则是一次请求最多能读入多少 Token。更大的窗口适合装进大型代码库、长文档或视频信息,但窗口装得下,不代表每处细节都能同样准确地被利用。
官方公布了一组覆盖面很广的成绩。Qwen3.8-Max 在科研复现类编程智能体评测 PaperBench 中得到 93.0 分,比上代高 28.2 分;在电脑操作评测 OSWorld-Verified 中得到 86.1 分。Qwen3.8 在 CodeArena 排名全球第四,Qwen3.8-Max 在 Vision Arena 排名第二;Arena 综合表现仅次于 Anthropic 的 Claude 系列。问题在于,材料没有提供完整榜单截图、测试时间和统一推理配置,而榜单也会更新,所以这些名次更适合视为发布时的坐标,不是稳定结论。
真正的赌注是“连续做事”
这次最醒目的案例不是一道编程题,而是一场约 16 天的自主编程实验。所谓自主编程,是让 Agent——能读取代码、调用工具、执行修改和测试的 AI 系统——在较少人工干预下反复工作。
据阿里披露,Qwen3.8 从空文件夹开始,搭建了名为“oh-my-cli”的自进化智能体框架。它会安排智能体领取任务,经过“执行—反馈—迭代”的循环持续修改项目。代码和过程已放到 GitHub 公开。
这件事的意义不在于“AI 连续开机 16 天”,而在于模型是否能跨越大量中间步骤:先拆需求,再写代码,运行后识别错误,修复、测试,并在很久之后仍围绕原目标推进。两年前式的代码补全更像有人递工具;这种实验想证明的,则是 AI 可以接下一段相对完整的工程流程。
不过,材料同时出现了“全程无需人干预”和“人类工程师可通过钉钉提出新要求”两种说法,两者存在张力。最终成果究竟接受了多少人工指令、工具权限如何设置、失败和回退发生过多少次,目前没有完整说明。模型表现也不能与执行框架、工具和算力条件分开计算。
量子位的一次实测提供了较小但更直观的样本。记者给出一页产品需求,Qwen3.8-Max 约 5 分钟做出一个可运行的 AI 资讯网页,包含布局、分类、搜索、排序和收藏,并完成启动与构建检查。这个结果说明端到端开发至少在该任务上能够成立,但它只是一次媒体体验,不能推出所有项目都能以同样速度和质量交付。
模型之外,阿里在铺入口
如果说 16 天实验展示的是能力上限,那么同期上线的产品决定了这些能力能否进入日常工作。
Qwen3.8 API 已上线千问 AI 平台。国内每百万 Tokens 的输入价格为 12 元、输出为 36 元,隐式缓存命中为 1.5 元。缓存可以理解为复用模型已经处理过的内容,避免重复计算。阿里给出的国际价格比较是:输入和输出分别为 Opus 5 的 40%与 24%。不过,材料没有提供不同服务在速度、推理设置和上下文用量上的统一比较,价格比例不能直接等同于完整使用成本。
企业级 Agent 产品“千问办公”(QwenWork)也在同日公测,并直接接入 Qwen3.8。网页版和独立 PC 客户端已经开放;据 InfoQ 报道,钉钉 PC 端与手机端入口近期开放。它瞄准的不只是个人写文档,而是把任务流程沉淀为团队可复用的 Skill——也就是一套可重复调用的操作步骤,并进一步连接企业协作、数据库和工作流。
阿里还披露了一批办公案例:一小时内标注数百份法律文档中的上千条款;数十分钟分析 160 小时以上的篮球录像,拆解 8400 多个攻防回合;处理 200 页财报 PDF 和超过 100 小时的视频。这些数字展示了产品方向:让模型直接处理大批材料并交付结果,而不只是陪用户聊天。但它们缺少统一测试条件和第三方复现,现阶段应视为官方案例,而非普遍效率承诺。
为什么值得关注
Qwen3.8 的关键不只是把模型做得更大。阿里把三件事放在同一天:发布 2.4T 旗舰、展示长周期自主编程、开放 API 与办公产品。它试图形成一条完整路径:底层模型负责理解和推理,Agent 负责调用工具与持续执行,千问 AI 平台和千问办公负责把能力送到开发者与企业用户面前。
这也是标题里“把编程押到新旗舰”的真正含义。编程在这里不再只是给程序员补几行代码,而是训练模型如何规划、操作工具、检查结果和长期推进。掌握这套能力后,同一种执行框架才有机会迁移到法务、视频分析和企业协作。
局限与未知
- 16 天自主编程、法律文档和长视频案例高度依赖官方披露,尚缺完整环境说明与第三方复现。
- Arena 等排名缺少统一配置与评测快照,且可能随榜单更新;“第一梯队”更适合作为发布时判断。
- Qwen3.8-Max 目前是 API 可用,权重开放仍是“预计下周”的未来承诺,许可证也未在材料中披露。