今日主线 / The Teeth of Verification
The Teeth of Verification
验收的牙齿:席位开始长牙齿了
8 月 1 日把「验收席位」设好了——政府预审窗口、监管接触、组织控制面、中试基地与保险,验收方一个个就位。但那天留了个尾巴:坐上去的人普遍跟不上台上的速度(12 倍验证差、更多失控案例、5976 元首例理赔)。
今天这批信号显示:席位开始长牙齿了。第一颗牙是硬的——欧盟《人工智能法》Article 50 8/2 正式生效,违规最高罚 1500 万欧元或全球营业额 3%;第二颗牙是自动的——Anthropic 让专职复盘 Agent 夜间自己改记忆,错误率 −30%、算力 −25%;第三到第五颗牙是把尺子重新标定:Astra 用十道数学难题 + 249 页论文验收能力,开发者用 OpenRouter 调用量为开放权重投票,机器人在北京便利店用真实客流验收。当验收被强制、被自动化、被多尺度标定时,Agent 才真正从「能干活」跨进「可被信任地干活」。
Signal Docket · 五条验收信号
01
AI Agent · 治理验收(硬法规)
欧盟《人工智能法》Article 50 透明度条款 8/2 正式生效
信源层级一级权威
可信度高
生效2026-08-02
罚则上限€15M / 3%
欧盟委员会 7 月 31 日宣布,自 8 月 2 日起扩大《人工智能法》适用范围,开始执行透明度规则与针对通用人工智能模型(GPAI)提供商的相关规则。核心(Article 50):交互式 AI 系统须在首次交互即明确告知用户正在与 AI 互动;AI 生成的深度伪造图像 / 视频 / 音频须标识,AI 生成或修改的内容须带机器可读标记;违规最高罚 1500 万欧元或全球营业额 3%。同日公布首批签署透明度行为准则的 180+ 机构,AI Office 自 8/2 可对 GPAI 提供商执行系统性风险义务。
为什么值得关注
- 「验收席位」从呼吁变强制的最硬一笔。8/1 写的是「政府预审窗口」还在拟议,今天 EU 已把披露义务写进可执行法条并配套罚则。
- 验收对象从「模型能力」扩到「生成内容的来路」。机器可读水印 + 标识,等于给 AI 产出强制贴「验讫」标签,和本期「验收」主题严丝合缝。
- 对端侧 / 自部署的连带。开放权重模型若进欧盟市场,输出标记义务同样压在提供商身上,发布节奏与合规成本被重新定价。
需要克制的部分
具体执法尺度(如何界定「机器可读标记达标」、豁免边界)仍靠后续指南与行为准则细化;高风险系统部分条款推迟至 2027/2028 适用。
02
AI Agent · 架构(自我验收)
Anthropic「智能体图 + Dreaming 复盘」工程方法公开
信源层级一级
可信度中高(厂商口径)
实测错误 −30% / 算力 −25%
场景AI Native DevCon
Anthropic 工程师 Lamis 在伦敦 AI Native DevCon 系统披露内部四代记忆方案与「图工程」方法,并公开 dreaming(复盘)机制:记忆走到第四代=类文件系统架构,设四道护栏——可回滚、防撞车(并发写冲突作废重来)、分权限(全局只读 / agent 只写草稿)、可搬家;dreaming=任务收工后起一个专职复盘 Agent,把记忆库 + 全量历史对话摊开,找反复出错处、附「哪几次对话出的事、出了几次」,交人类拍板。
为什么值得关注
- 这是 8/1「验收席位坐的人跟不上速度」的内部解:让 Agent 自己当验收员。跨会话经验复利,人类从实时指令者退为事后审核者。
- 「图工程」用假边测试删掉伪依赖、把线性流改钻石型并行 + 汇合质检,本质是把工作流当可验收的结构来优化——和本期「重新标定验收尺」同构。
- 护栏仍是确定性机制兜底,呼应 7/30「写下来的规则不是控制,真正起作用的是确定性护栏」。
需要克制的部分
Dreaming 本身 5/6 已作为研究预览发布;本次新意在「四代记忆 + 图工程 + dreaming 复盘」的方法论打包与内部实践数据,非全新功能;数据为厂商口径,外部未独立复现。
03
AI Agent · 能力验收 + 资本
OpenAI Astra 攻克十道数学开放难题,249 页论文;亚马逊 500 亿注资
信源层级二级(转述)
可信度中高(待核验)
解题成本≈ $2000 / 次
论文249 页
8/3 多家媒体援引 OpenAI 信息:下一代模型 Astra 已攻克十项数学开放问题,并附 249 页技术论文;机器之心测算其单次解题成本约 2000 美元。这呼应 8/1 Altman 在华盛顿演示时「将发布报告说明解决 10 个未解数学问题」。同日,极新早报称亚马逊完成对 OpenAI 总计 500 亿美元全额投资(待官方确认)。
为什么值得关注
- 能力验收的尺子从「跑分」升级到「严格数学证明」。十道开放难题 + 249 页论文,是 Agent 长程推理可被第三方逐行核验的硬标尺——正好补 8/1「验证速度差」里「怎么算验过」那一环。
- 延续 8/1 Astra 主线:多智能体长时程协同,发布前或走联邦预审。今天补的是「能力已经被数学验收」这一侧。
- 500 亿注资(若属实)把「模型 + 资本」绑死,巨头为前沿模型背书,发布前审查的政治 / 商业分量更重。
需要克制的部分
解题清单与论文尚未经社区广泛独立验证;「500 亿投资」仅见早报转述,OpenAI / 亚马逊未官方确认,不能作为既成事实;Astra 命名、发布时间仍未定。
04
终端与端侧 · 模型选择(开放权重)
中国大模型包揽 OpenRouter 周榜前五,小米 MiMo-V2.5 登顶
信源层级一级
可信度高(榜单可核验)
登顶MiMo-V2.5
调用量10.5T token
8/3 OpenRouter 最新周榜显示,调用量前五均为中国产品:小米 MiMo-V2.5 以 10.5 万亿 token 居首,DeepSeek 两款分列二、五,国产开源模型在全球开发者侧选择优势扩大。同日,智谱 GLM Coding Plan 开放订阅、超聚变 AI Lab 上线 DeepSeek-V4-Flash 正式版、Kimi K3 开源技术报告引发关注。
为什么值得关注
- 这是开发者用调用量「用脚投票」的验收——比任何评测都真实。开放权重 / 自部署路线被全球开发者选中,呼应 7/29「可控的自治」与 8/1「组织控制面」。
- 模型能力验收与「可控」验收合一:榜单前五全是可作自部署的开放权重,市场把「强」和「可控」当成同一道题的两个答案。
- 与信号三对照:Astra 走「封闭前沿 + 数学验收」,中国开源走「开放权重 + 开发者验收」,两条验收路线同日并排。
需要克制的部分
OpenRouter 调用量受营销 / 接入渠道影响,非纯能力排名;「包揽前五」为周榜快照,随时段波动。
05
具身智能 · 真实场景验收
银河通用 WAM-TTT「迎宾小盖」Galbot G1 上岗北京便利店
信源层级一级
可信度高
场景北京·全家便利店
技术WAM-TTT
北京「机器人发展看北京」采访走进银河通用,其 Galbot G1(「迎宾小盖」) 已在中关村全家便利店上岗:仅凭「观看」人类操作视频,借助自研 WAM-TTT(World Action Model Test-Time Training) 技术,把实验室技能快速迁移到真实客流场景,能打招呼、精准取货递送。搭载「银河星脑」(AstraBrain)——「大脑—小脑—神经控制」端到端具身大模型,打通多模态感知、任务规划、实时动作全链路。
为什么值得关注
- 真实客流便利店是最硬的验收场:光线、人流、货架、突发交互全不可控,比中试基地更接近「出事谁担责」的边界(呼应 8/1 杭州中试 5976 元理赔)。
- WAM-TTT 把「部署期无需高成本长周期采集训练、少量人类视频即适应」做成能力,等于把验收从「出厂前」挪到「运行中持续通过」——具身版的 dreaming 复盘。
- 与本周具身链连成「技术—供应链—中试—真实场景」四段(7/30 揭榜 / 7/31 亦庄 / 8/1 杭州中试),今天补的是最后一段「进店」。
需要克制的部分
单店演示 ≠ 规模部署;交互仍以迎宾 / 取货为主,复杂长程任务未验证;「失灵难题被突破」为厂商叙事,长期可靠性待观察。
Cross-Observation · 横向观察(供追踪)
| 信号 | 要点 | 信源与可信度 |
| 字节 Seedance 2.5 实测 |
单次生成 15→30 秒、可续至 3 分钟叙事、参考素材上限提至 50 个全模态输入,新增局部编辑 / 文字渲染;占国内 AI 视频市场超八成 |
腾讯研究院 AI 速递 8/3 · 中(厂商) |
| 谷歌 Gemini Robotics 2 三模型栈 |
VLA 实现人形机器人从脚到指尖全身控制,ER 2 负责高级推理规划、On-Device 2 端侧 200 示例即适配新本体 |
腾讯研究院 AI 速递 8/3 · 高(官方,呼应 7/31) |
| GPT-4o「遗民」约 80 万反攻 Brockman |
GPT-5.6 全面超越但对话体验无法迁移,用户用「best friend / soul」形容 4o;陪伴型 AI 细分市场浮现 |
Edge AI Daily 8/3 · 中(媒体 + CHI 2026 论文) |
Through-Line · 主线脉络
- 7/24可信化:Agent 从工具走向可信商业实体
- 7/27自主 vs 可控:能力越强,边界设计越是唯一护栏
- 7/29可控的自治:治理、工程护栏、本地化三线收束
- 7/30边界划定 → 入口收拢 → 围栏 → 底座工程 → 刻度
- 7/31成本曲线(划不划算)→ 判定权外移(谁说了算)→ 演习结束(是不是真发生了)
- 8/01验收席位:席位设好,但坐的人普遍跟不上被验收对象的速度
- 8/03验收的牙齿:从「有没有人坐」→「牙齿硬不硬、尺子准不准、跑得快不快」
一个可操作的推论
当验收被强制、被自动化、被多尺度标定时,Agent 才真正从「能干活」跨进「可被信任地干活」。接下来真正稀缺的不是更强的 Agent,而是可扩展、可并行、确定性的验收手段本身——可复现代码、可并行的第三方核验、确定性护栏、产线级测试标准。谁先把验收做成可扩展的,谁才真的握住了这一轮的关口。