The
Assay Room

试 金 石 · AI 领域每日动态
Today’s Main Line · The Through-Line
今日主线 The Assay — who gets to call it right

今天五条信号压着同一个问题:谁来判定它做对了。

早班的主线是「成本曲线现身」——智能开始被问划不划算。午后这五条把问题推进了一层:成本可以自己压,正确性不能自己认定。千问把「换一个 harness 还稳不稳」写进发布稿,判定权交给外部框架;小米把编排从自然语言换成沙箱里的代码、把记忆从主 Agent 手里拿走交给独立 writer、再派一个不干活的验证者去判断「做完没有」,判定权从模型自觉换成确定性工程;宇树的判定权落在 FCC 的认证清单上,存量豁免、增量受审;WAIC 的判定权换成了产线节拍——99% 识别率、单颗螺钉 10 秒;晶泰干脆把判定权交给自动化实验室,一个不能被说服、只能被实验反驳的物理裁判。

一句话:智能体正在集体交出自我评判权。凡是「自己给自己打分」的环节,今天都在被替换成一个外部的、确定性的、不讲情面的裁判。
Streak Test · 划痕比对 纵轴 ↓ 判定权由内向外移交
SELF-CERTIFIED 自证 EXTERNALLY ADJUDICATED 他证 标准样 REF 01 外部 harness QWEN3.7-PLUS 02 沙箱 · 独立验证者 MIMO CODE 03 FCC 认证清单 UNITREE / IPO 04 产线节拍 · 良品率 WAIC 2026 05 自动化物理实验 XTALPI SCIENCE 起点:模型宣称 落点:外部裁定
读法:每道划痕代表一条信号,划得越深,说明判定权移交得越彻底。落点越靠下,评判者离厂商本身越远——从「我说我行」,到框架说、审批清单说、秒表说,最后到实验说。左侧灰色为参照样,即完全自证状态。
Five Streaks · 五条送检信号
01
类别 AI AGENT · 模型基座
判定者 外部 harness
信源层级一级 · 官方厂商自述成分 中

千问发布 Qwen3.7-Plus:把「跨框架还稳不稳」写进发布稿

When the benchmark moves from the model to the harness around it.
事件

7 月 31 日,阿里千问大模型正式发布 Qwen3.7-Plus,官方定位为「将视觉与语言统一为一体化智能体基座」的多模态模型。它在 Qwen3.7 文本能力基础上全面升级视觉—语言能力,同时保持编码、工具使用与生产力工作流方面的完整智能体能力。官方强调的核心特色是跨框架泛化:无论通过 Claude Code、OpenClaw、Qwen Code 还是其他框架部署,均能保持稳定表现。

为什么值得关注

过去发布一个模型,比的是基准分数;这次官方把「装进别人家的 harness 里还稳不稳」当成卖点单独列出来,这是评价维度的迁移

它和 7 月 30 日 Composio 的实测互为两面——同一个模型放进三个 harness,成功率相近但 token 效率相差最多 30 倍。也就是说,模型的真实表现并不由模型单方面决定,而由「模型 × 运行时」这一对组合决定。厂商开始承认这件事,意味着模型侧的判定权,正在部分让渡给它无法控制的外部框架。

信源与局限 官方发布(AAStocks 转述港股公告口径),信息层级一级。但「跨框架均能保持稳定表现」目前为厂商自述,尚无第三方跨 harness 基准佐证,宜等待独立复现后再作强判断。
02
类别 AI AGENT · 工程
判定者 确定性沙箱 · 独立验证者
信源层级厂商 + 开源代码可验证 高

小米 MiMo Code 公开长程执行设计:不赌模型自觉,用工程把它兜住

Orchestration leaves the prompt and becomes code that cannot forget.
事件

MiMo Code 团队公开了长程任务的完整技术设计,同日在 GitHub 开源热榜领跑。核心有三层:

  • 编排代码化(Dynamic Workflow):把编排逻辑从 prompt 变成代码。主 Agent 生成一段 JavaScript,在隔离沙箱中确定性执行,通过 agent() 派出子 Agent、parallel()/pipeline() 控制并发。
  • 记忆外包:主 Agent 对结构化记忆文件只有读权限,唯一被允许的写入通道是自由格式的 notes.md;提取交给独立 writer subagent,且提早触发——在上下文预算的 20%/45%/70% 处而非快满时。理由是「lost in the middle」:95% 利用率下已无处思考,30% 利用率下才游刃有余。记忆分四层(session / project / global / history),Dream 每 7 天整理去重,Distill 每 30 天把反复出现的流程固化成 skill 或 SOP。
  • 完成度他证(Goal):Agent 每次想终止,系统自动发起一次独立模型调用审查完整历史,判断停止条件是否真的满足;这个验证者不参与实际工作,因此不会对自己已完成的部分产生认同偏差。
团队原话:「if 不会忘记分支,for 不会提前退出,barrier 不会漏掉子 Agent。」并明确判断:目前以 prompt 形式定义的许多 skill,未来会逐步演变为代码形式的 workflow 脚本。
62%
SWE-Bench Pro
Claude Code 57%
73%
Terminal Bench 2
Claude Code 68%
10–20%
Max Mode 增益
代价 4–5× token
<0.5%
死循环概率
Goal 验证后
为什么值得关注

这是本周第三个独立团队收敛到同一结论:7 月 30 日斯坦福 Shepherd 做意图—执行分离与可回滚,同日夜间 TencentDB Agent Memory 2.0 把记忆资产化并用 Proxy 做权限过滤与审计,今天小米把它推到最直白的一步——不赌模型自觉,用工程把它兜住

三家路径不同,但都在做同一件事:把「Agent 自己判断自己」的环节,一个一个换成外部的确定性机制。尤其「验证者不参与工作,所以不会认同自己」这一句,几乎是本期主线的技术版注脚。

信源与局限 厂商技术博客 + 开源代码(MIT,基于 OpenCode),可验证性较高。需诚实标注:MiMo Code 本体已于 6 月 11 日发布并开源,今日的新增量是长程技术细节公开与开源热榜位次,并非产品首发;上述跑分均为厂商自测,非第三方评测机构结果。
03
类别 具身智能 · 地缘
判定者 FCC 认证清单
信源层级一级 · 招股书负法律责任 高

宇树在招股书中回应 FCC 禁令:存量豁免,增量受审

Not a wall — a tax on every future iteration.
事件

7 月 31 日,宇树科技在更新的招股书中回应美国 FCC 将境外生产的先进机器人列入管制清单一事:其在售人形机器人 G1、H2、R1 及四足机器人 Go2、B2、A2 均已获得 FCC 认证,现有主要产品对美销售不受影响;但后续新型号若未获豁免,则面临在美销售风险。

为什么值得关注

7 月 30 日那条 FCC 禁令还是一个轮廓模糊的「关门」叙事,今天招股书把它切成了精确刻度:已认证的存量放行,未认证的增量受审

这改变了风险的性质——它不是一堵墙,而是一道时间税:老型号照卖,但每一次迭代都要重新排队,产品节奏被外部审批绑定。对一家正在 IPO 的公司而言,把这句话写进招股书,等于承认它已经是一项需要向投资者持续披露的经营性风险,而不是一次性的公关事件。判定谁能上市销售的那支笔,明确不在厂商手里。

信源与局限 招股书更新(负法律责任的正式披露),信息层级一级、可靠性高。局限:「新型号是否获豁免」属未来事项,具体豁免标准、审批周期与适用范围尚未公开,不宜据此推演具体影响量级。
04
类别 具身智能 · 产业化
判定者 产线节拍 · 良品率
信源层级二手汇总企业自述口径 中高

WAIC 2026 复盘:评价标准从「像不像人」换成了产线节拍

The stopwatch replaces the applause.
事件

围绕 7 月 17–20 日 WAIC 2026(1100 余家企业参展,具身智能企业超 200 家)的会后复盘于今日集中发布,几个能对齐工业口径的落点:

  • 节卡机器人 × 华域电动:两台轮式人形机器人构成协同产线,覆盖电机外壳转运 → 物料交接 → 组件装配 → 0.5mm 细密牙纹螺丝高精度锁付 → 成品入库。系统融合 3D 视觉、激光雷达、多维力传感器、YOLO 视觉分割与 AI Agent 决策框架,构成「大脑感知决策 + 小脑运动控制」的 VLA 架构。
  • 蚂蚁灵波:发布具身原生世界动作模型 LingBot-VA 2.0;智慧药房场景中,多台不同构型机器人搭载跨本体基座模型 LingBot-VLA 2.0,协同完成订单接收 → 智能取药 → 药品送达。
  • 世界模型集体上场:2026 被业内称为「世界模型元年」,昆仑万维 Matrix-Game 3.5、智元、大晓机器人、极佳视界、它石智航、无界动力等同期展示方案。
  • 量产刻度:智身科技称截至 6 月累计量产突破 15000 台、6 月单月突破 5000 台;智元在三地四馆公共区域部署 60 台机器人承担指路引导——是真实岗位,不是展台演示。
99%
零部件识别
准确率(稳定)
≈10s
单颗精密螺钉
锁付耗时
0.5mm
细密牙纹
螺丝精度
15000
智身科技
累计量产(台)
为什么值得关注

「单颗螺钉 10 秒」和「99% 识别率」是能直接进 MES 系统、能换算成良品率和节拍的数字,跟「跑得快不快、会不会翻跟头」完全不是一类指标。这意味着具身智能的判定权,从观众的惊叹换成了产线的秒表

同时必须把话说完整:报道自己也指出,家庭场景的付费意愿与定价区间仍然模糊——一台能叠衣服的家用机器人值一万、三万还是五万,行业至今没有答案。工业场景能算 ROI,家庭场景还不能,这是产业化尚未过关的那一环。

信源与局限 会后综述(媒体二手汇总),信息层级中高。核心数据多为参展企业自述口径,量产数字与准确率均未见第三方审计;WAIC 于 7/17–20 举行,本条为 7/31 复盘扩散而非当日首发事件。
05
类别 AI AGENT × 科学
判定者 自动化物理实验
信源层级媒体报道发布会「全球首个」为自述 中高

晶泰发布 XtalPi Science 与 Genius Agents:给 Agent 配一个物理裁判

It doesn’t grow legs. It grows a laboratory.
事件

晶泰科技日前在上海发布 XtalPi Science 科学智能平台与 Genius Agents 科学智能体矩阵,并联合 26 家产业、高校及科研生态伙伴发起「科学智能开放生态联盟」,7 月 31 日经媒体报道扩散。

平台把公司十年积累的模型、工具、智能体及实验资源封装为可按需调用的 Science Token;Genius Agents 作为调度中枢,构建兼具全局规划与场景执行的多智能体体系,可在数字世界调用专业模型完成预测,并通过物理智能在真实物理世界开展高精度实验验证,从而贯通「数字假设 → 专业预测 → 物理验证 → 数据反馈」的闭环。

发布方同时点出当前科研数据的一个结构性缺陷:公开科研数据库几乎全为正样本,缺乏对模型纠错至关重要的失败负样本
为什么值得关注

这是 Agent 走进物理世界的另一条路径——不长腿,长实验室。它给 Agent 补上了大模型最缺的东西:一个不能被说服、只能被实验反驳的裁判。

语言模型的幻觉之所以难治,本质是它的输出在闭环内无人反证;把自动化实验接进循环,等于给每一次预测装了一个不讲情面的终审。「缺失负样本」这句话尤其诚实——今天几乎所有科学 AI 都在只见成功不见失败的数据上训练,而失败恰恰是最有信息量的那一半。

信源与局限 媒体报道厂商发布会,信息层级中高。「全球首个整合大语言模型、科学智能体与大规模自动化机器人实验的 AI4S 综合平台」为厂商自我定位口径,未见第三方界定;平台实际吞吐量、外部机构调用规模与验证成功率均未披露。

主线延续脉络

07 / 24
可信化
07 / 27
自主 vs 可控
07 / 29
可控的自治
07 / 30 早
边界划定
07 / 30 午
入口收拢,账本亮相
07 / 30 午后
写下来的规则不是控制
07 / 30 晚
主体交接的底座工程
07 / 30 夜
刻度之夜
07 / 31 早
成本曲线现身(划不划算)
07 / 31 午后
判定权外移(谁说了算)

Method & Self-Check · 方法与自查

筛选原则
只收当日新增或当日正式发酵的信号;与本周已成文条目重复者一律弃用,或仅作背景参照并注明。本期已刻意避开 09:14 早班锁定的 5 条(GPT-5.6 Sol 自改推理栈 / Gemini Robotics 2 三模型栈 / Acrab GΞLIX 1 / 欧洲人形独角兽 Humanoid / 郑州异构训练场)。
本期主动弃用
「高通端云分布式推理架构」——自媒体拼装稿,「待机功耗降 90%」「本地 300 tokens/s」等关键数字无一级来源; 「义乌 300 元 AI 翻译眼镜狂译 139 种语言」——叙事精彩但为自媒体二创,批发价、语言数、回本周期均无法交叉验证; 安谋科技「周易」X3-Pro NPU 与炬芯存内计算 NPU——方向切题,但发布时间分别为 7/18 与 7/21,非当日新增; Gemini Robotics ER 2——今日仍在扩散,主体已被早班锁定。
口径标注
凡厂商自述、自测跑分、未经第三方验证的数字,均在正文内显式标出,不作修饰性拔高。事实与判断分栏呈现,「为什么值得关注」段落属编者观点。
仍未解的问题
跨 harness 稳定性缺乏公开基准;具身量产数字缺乏第三方审计;家庭机器人定价区间行业无共识;FCC 新型号豁免标准与审批周期未公开。