判定者 外部 harness
千问发布 Qwen3.7-Plus:把「跨框架还稳不稳」写进发布稿
7 月 31 日,阿里千问大模型正式发布 Qwen3.7-Plus,官方定位为「将视觉与语言统一为一体化智能体基座」的多模态模型。它在 Qwen3.7 文本能力基础上全面升级视觉—语言能力,同时保持编码、工具使用与生产力工作流方面的完整智能体能力。官方强调的核心特色是跨框架泛化:无论通过 Claude Code、OpenClaw、Qwen Code 还是其他框架部署,均能保持稳定表现。
过去发布一个模型,比的是基准分数;这次官方把「装进别人家的 harness 里还稳不稳」当成卖点单独列出来,这是评价维度的迁移。
它和 7 月 30 日 Composio 的实测互为两面——同一个模型放进三个 harness,成功率相近但 token 效率相差最多 30 倍。也就是说,模型的真实表现并不由模型单方面决定,而由「模型 × 运行时」这一对组合决定。厂商开始承认这件事,意味着模型侧的判定权,正在部分让渡给它无法控制的外部框架。