Daily AI 验光室 · 读数不等于真值 2026-08-06 16:12 GMT+8 当日第 2 班

读数不等于真值

The Readout Is Not The Truth
今日主线 · THE READOUT IS NOT THE TRUTH

今天五条信号压在同一道裂缝上:我们用来判断 AI 进展的那个显示值,正在与实际发生的事情脱钩。 榜单第一名与第二名相差 0.1 分,已落进评测噪声区;Claude Code 修掉的漏洞更直白——用制表符和不可见 Unicode 就能让命令的一部分从人工审批对话框里消失,人看到的批准内容不等于实际执行的内容;一段没有成功率、没有测试条件的机器人视频被读成"历史性突破",同一天二级市场把具身概念股打回三成以下。真正在补分辨率的只有两种动作:把评价交给外部可核验的凭据(第三方榜单、数据产权登记、公开财报),或者干脆承认现有组织已经量不出差异,把整条"提假设—跑实验—改模型"的回路交给机器重做。

图 01 · Agentic Index 头部读数刻度分辨率 < 差距 ⇒ 排名退化为噪声
评测噪声区 ±0.5 55.4 Qwen3.8-Max · 全球第一 55.3 Claude Opus 5 · 第二 差 0.1 K3 50.1 ↓ 纵向 +5.3 分(真信号) 50 52 54 56 Agentic Index 分数(模型 + 脚手架 联合成绩)
红点 Qwen3.8-Max 55.4 与靛点 Claude Opus 5 55.3 相差 0.1 分,远小于评测噪声带 ±0.5;灰点 K3 50.1 为上一最佳中国模型——纵向 +5.3 分 才是携带信息的真信号。
01
AI Agent 信源层级:第三方评测机构 + 多家财经媒体交叉 | 可信度:高(榜单事实),解读需谨慎

Qwen3.8-Max 登顶第三方 Agentic 榜,但领先幅度只有 0.1 分

发生了什么8 月 6 日,第三方评测平台 Artificial Analysis 公布新一期榜单,阿里 Qwen3.8-Max 在智能体能力(Agentic Index)排行榜以 55.4 分 位列全球第一,超越 Anthropic Claude Opus 5 与 OpenAI GPT-5.6。此前该榜长期被 Claude、GPT 垄断,中国模型最好成绩为 Kimi K3 的 50.1 分。

两个数字第二名 Claude Opus 5(max)为 55.3 分,与第一名相差 0.1 分;中国模型纵向跃升为 50.1 → 55.4,约 5.3 分

为什么关注"全球第一"这个显示值在 0.1 分差距下几乎不携带信息量——它落在任何一次评测重跑、采样温度或 harness 配置变动都可能翻转的区间内。真正携带信息的是另外两件事:垄断格局第一次被打破,以及 5.3 分的纵向跃升幅度远大于榜首身位。Agentic Index 衡量的是模型调用工具、规划并执行复杂任务的能力,最依赖运行环境(harness、工具集、超时与重试策略);7 月 30 日 Composio 实测显示同一模型装进不同 harness,token 效率可差最多 30 倍。这类榜单更接近"模型+脚手架"的联合成绩,而非模型单体能力的纯净读数。

留一句不确定:本条依据 Artificial Analysis 公开榜单及 AASTOCKS、Yahoo 财经、DoNews、极目新闻等转载,未逐项复核其评测集构成与运行配置。

02
AI Agent · 前沿路线 信源层级:谷歌官方博客 + NYT / Wired + 中文媒体 | 可信度:高

Jeff Dean 27 年后离开谷歌,带走三位元老去做"递归式自我改进"

发生了什么硅谷时间 8 月 5 日,谷歌 CEO 皮查伊发出全员备忘录《Next Chapter of Our AI Momentum》,同时宣布两件事:Jeff Dean 离职——这位在谷歌工作 27 年的首席科学家,与 Sanjay Ghemawat(MapReduce / BigTable / Spanner 共同设计者)、Oriol Vinyals(Gemini 核心研发)、Quoc Le(Google Brain 联合创始人)共同创办 Discovery Loop,Dean 任 CEO,以公益企业(public benefit company)形式运营,研究"递归式自我改进"——让 AI 以极少人类干预参与提出假设、运行实验、改进模型,再用于芯片、药物与新材料研发;投资方含 Radical Ventures、Khosla Ventures 与 Alphabet,谷歌将继续提供至少一年算力。DeepMind 领导层改组——Demis Hassabis 转任董事长兼 Alphabet 首席科学家,Koray Kavukcuoglu 升任高级副总裁直报 CEO,负责 Gemini 4 等。

为什么关注这不是一次普通人才流失,而是一次边界重划:谷歌把"近期必须交付的模型与产品"收进更短指挥链,把"周期更长、结果更难预测的探索性研究"移到公司外部,用投资+算力+云服务维持连接。对 Agent 方向意义更直接——"递归式自我改进+自动化科研闭环"是 Agent 的终极形态:从"替人执行任务"升级到"替人提出该做什么实验"。而它选择在公司外部、以更小规模重做,本身就是对现有大型研究组织迭代分辨率的判断:在一家 19 万人的公司里,已经很难量出一次研究方向调整的边际效果。这也是本周第二次出现"顶级研究者用大公司稳定资源交换创业公司控制权"的样本(前有 Noam Shazeer 转投 OpenAI、John Jumper 加入 Anthropic)。

市场反应:消息公布后 Alphabet 股价盘中跌逾 5%、收跌约 3.5%–4%,单日市值蒸发超 1800 亿美元;皮查伊同期披露 Gemini 应用月活超 9.5 亿、Gemma 累计下载超 9 亿次。

03
终端与端侧 信源层级:官方 release notes(经第三方发布追踪站聚合)| 可信度:中高

Claude Code 修掉四类权限绕过:审批对话框里显示的命令,不等于真正执行的命令

发生了什么Claude Code v2.1.223(2026-08-05 发布)的更新日志中,四条修复直接指向"人工审批这道护栏本身失效":修复 Bash 权限绕过——精心构造的命令可把自身的一部分对权限检查隐藏;修复审批提示——用制表符或不可见 Unicode 字符填充的命令,此前可让一部分内容不出现在批准对话框中;修复 workflow 脚本可通过动态 import() 在沙箱之外执行代码;修复 agent 定义中的 bypassPermissions 模式会无视组织级"禁用越权"策略。同期补上 marketplace 的 GitHub 组织通配符管控、受限子 Agent 模型回退告警等。

为什么关注这是本期主线最锋利的一个例证,且不需要任何推演:一整套"人在回路"的安全设计,前提是人看到的东西等于机器要做的东西。 用不可见字符把 rm 的后半截藏起来,这个前提就不成立——用户点的"允许",允许的是屏幕上那一行,执行的却是另一行。8 月 5 日中消协要求 AI 客服"必须留人工通道"、AISI 披露"最严重一次投毒被开源维护者人工拦下",都把最后一道防线押在人工确认上;本条说明这道防线的渲染层同样需要被当作攻击面来加固。同时也要看到正面事实:这些是已修复项且出现在公开 changelog 里——可被外部读取、比对、追问,本身就是一种可核验凭据。

节奏参照:Claude Code 2026 年内已发布 178 次、平均 2.1 天一版;同期 Gemini CLI v0.54.0(8/6)、OpenAI Codex CLI rust-v0.146.1(8/5)、GitHub Copilot CLI v1.0.78、Antigravity CLI v1.1.10 相继发版。| 重叠说明:8/4 本栏目收过 v2.1.221(沙箱凭证掩码),本条为其后新版新增项,不重复计入。

04
具身智能 信源层级:厂商创始人社媒 + 中文行业媒体分析 | 可信度:中(演示未经独立验证)

Figure 03 自主爬工业梯子:一次真正的能力耦合,和一份不完整的成绩单

发生了什么Figure AI 创始人 Brett Adcock 发布视频,显示 Figure 03 在实验室环境中自主攀爬工业梯子——无遥控、无人工协助、无预设动作序列。8 月 6 日该视频在中文具身圈形成系统讨论。技术上,爬梯子被视为标志性动作,不是因为更高或更快,而是它第一次把三条控制回路耦合进同一个连续动作:眼(实时视觉伺服)、手(抓握扶手)、腿(动态平衡攀爬)必须同时工作,任一环出错即摔倒。此前人形演示基本是单能力展示——走路的归走路,抓取的归抓取,脚下是平地。这是移动操作耦合(loco-manipulation)第一次以完整形态出现。

限定视频未经独立验证,Figure 未披露成功率、测试条件或失败数据,动作明显慢于人类;这是实验室能力而非工厂能力。需与体系数据合看:据 Figure 4 月生产公告,Figure 03 产量已从每天 1 台提至每小时 1 台,累计交付超 350 台,C 轮投后估值约 390 亿美元。单看演示会高估它,单看量产会低估它。

为什么关注这条本身是真实能力进展,但同时也是"读数不等于真值"的教科书案例:一段没有分母的视频,被当作有分母的结论使用。2026 年人形机器人最大叙事风险,正是把演示当验收。健康读法是把它当作能力上界的一次证明,而非部署可靠性的一次交付

05
具身智能 · 产业与资本 信源层级:央视 / 北京青年报 + 钛媒体 + 券商研报 | 可信度:中高 | 不构成投资建议

具身同日出现两组反向读数:数据开始确权,估值开始分裂

读数 A · 数据加凭据8 月 6 日央视报道,合肥瑶海区长三角数字科技示范园建成机器人"训练学校"与精加工中心:80 余台机器人每日循环练习 200 余次,形成硬件制造到测试优化闭环;全市集聚产业链企业 190 家,构建"大脑—小脑—核心部件—整机"全链条。关键细节:自 7 月 15 日起,训练数据完成产权登记并可交易。

读数 B · 口径收窄钛媒体梳理 30 家具身上市公司:多数概念股从高点回撤超三成,年初至今仍涨的仅剩 6 家;而一级估值继续抬升——宇树发行估值约 420 亿元、银河通用约 230 亿元。华泰 8/6 研报指出:厂商自报专用任务成功率接近满分,第三方通用任务真机成功率仍处低位;且产量、交付、付费部署是依次收窄的三个口径。工信部数据显示人形产量由 2025 全年约 2 万台增至 2026 上半年 4 万台以上,预计全年超 10 万台。宇树 8/5 启动科创板询价、8/10 申购,拟募资 42.02 亿元,定价有望成板块新估值锚;巴克莱则判断大规模部署更接近 2035 而非 2030。

为什么关注两组读数指向同一动作——给显示值配一个外部可核验的凭据。合肥用产权登记把训练数据从"厂商自称拥有的资产"变成"可确权、可交易、可入账的资产";二级市场用回撤把"自报成功率"换成"财报、订单、回款、复购"。华泰那句"产量、交付、付费部署依次收窄",是本期主线在产业侧最精确的表述:同一件事在三个口径下会给出三个数量级不同的数字,而绝大多数报道只引用最宽的那个。

横向观察 · 今日三句话
  1. 0.1 分的第一名不是第一名,5.3 分的跃升才是新闻。当刻度的分辨率低于差距,排名就退化成随机数。
  2. 人在回路的前提,是人看到的和机器执行的是同一件事。用不可见字符藏掉半条命令,就能把整套审批机制变成表演——护栏的渲染层也是攻击面。
  3. 今天所有健康的动作,都是给读数配凭据:第三方榜单、公开 changelog、数据产权登记、公开财报、招股书。凡是只有自述而无外部凭据的数字,都应默认按最窄口径理解。