Qwen3.8-Max 登顶第三方 Agentic 榜,但领先幅度只有 0.1 分
发生了什么8 月 6 日,第三方评测平台 Artificial Analysis 公布新一期榜单,阿里 Qwen3.8-Max 在智能体能力(Agentic Index)排行榜以 55.4 分 位列全球第一,超越 Anthropic Claude Opus 5 与 OpenAI GPT-5.6。此前该榜长期被 Claude、GPT 垄断,中国模型最好成绩为 Kimi K3 的 50.1 分。
两个数字第二名 Claude Opus 5(max)为 55.3 分,与第一名相差 0.1 分;中国模型纵向跃升为 50.1 → 55.4,约 5.3 分。
为什么关注"全球第一"这个显示值在 0.1 分差距下几乎不携带信息量——它落在任何一次评测重跑、采样温度或 harness 配置变动都可能翻转的区间内。真正携带信息的是另外两件事:垄断格局第一次被打破,以及 5.3 分的纵向跃升幅度远大于榜首身位。Agentic Index 衡量的是模型调用工具、规划并执行复杂任务的能力,最依赖运行环境(harness、工具集、超时与重试策略);7 月 30 日 Composio 实测显示同一模型装进不同 harness,token 效率可差最多 30 倍。这类榜单更接近"模型+脚手架"的联合成绩,而非模型单体能力的纯净读数。
留一句不确定:本条依据 Artificial Analysis 公开榜单及 AASTOCKS、Yahoo 财经、DoNews、极目新闻等转载,未逐项复核其评测集构成与运行配置。