智能体榜首易主:Qwen3.8 以 55.4 分掀翻 Claude

你还在以为 AI 智能体的天下只有 Claude 和 GPT 吗?8 月 6 日,独立评测机构 Artificial Analysis 公布了新一期 Agentic Index(智能体能力指数)榜单,阿里通义千问 Qwen3.8-Max 以 55.4 分拿下全球第一,超过 Claude Opus 5 和 GPT-5.6。这是该指数发布以来,首次由中国模型登顶。

Agentic Index 衡量的是 AI 调用工具、规划多步任务、在真实工作场景中交付结果的能力——简单说就是”能不能当助手干活”。它由两项核心测试等权平均组成:GDPval-AA v2(模拟 44 种职业的知识工作完成度)和 τ³-Banking(金融客服多轮对话与知识检索)。两项都是实打实的工具调用测试,不是做选择题。

说白了,这个榜单一向被美国闭源模型垄断。此前中国模型最好的成绩是 Kimi K3 的 50.1 分,而这次 Qwen3.8-Max 直接把纪录拉高了 5 分以上。这意味着在”让 AI 真正动手做事”这条赛道上,中美差距正在快速收窄。

从模型规格看,Qwen3.8-Max 总参数量达 2.4 万亿(采用稀疏 MoE 架构),激活参数约 950 亿,上下文窗口支持 100 万 Token。它在多项子测试中表现突出:PaperBench(论文复现)93.0 分、OSWorld-Verified(电脑操作)86.1 分、Terminal-Bench 2.1(终端命令行操作)86.6 分——后两项均超过了 Claude Fable 5 和 GPT-5.6 Sol。

价格方面也有明显优势。Qwen3.8-Max 的 API 定价约为 Claude Opus 5 输入价格的 40%、输出价格的 24%。阿里还宣布将于下周开源 Qwen3.8-Max 权重,如果兑现承诺,这将是迄今公开的最大规模模型之一。

对开发者来说,这个排名传递了一个信号:选模型不必只盯美国闭源方案。如果你的应用涉及多模态操作、长程任务调度或成本敏感部署,Qwen3.8-Max 值得放进对比清单。

来源:Artificial Analysis / MarkTechPost / 量子位 / 上海证券报