Leion · NO.56 2026-08-29 20:48 GMT+8

工程化整合纪元:模型自改进 · Agent 渗透破八成 · 具身看一遍就会 · 物理设备长出统一驱动协议

Signals5 条 / 当日精选
主战场AI Coding · Agent · 终端 · 具身
硬数字770B · 80.8% · 66% · 66.8%
时间锚能力就位 → 怎么规模用
本期主线
上午各期把「能不能交付」「交付后风险」讲完,这几条一起把那张图推向「怎么规模用」

能力就位已成共识,竞争从「能不能」压到「怎么整合着用」:① 腾讯 Hy4 preview 不只是又一个开源大模型,而是把模型放进改进自身的闭环(参与训练方法 / 数据 / 评估 / 算子优化,吞吐 +31.8%);② Temporal 报告给出硬数字——80.8% 工程师每天跑 Agent,一年涨了七成,JetBrains 生态里 Claude Code 已反超 Copilot,战场移到 Harness / 客户端;③ Skild S1 把具身训练成本从数周遥操压到「一段视频」,看一遍就会;④ 优必选中报 + 发改委确认具身从演示秀场切到真实作业与量利齐升;⑤ Anthropic MHS 给「agent 操控物理设备」一套统一驱动协议,像 Agent 世界的 USB。一句话:模型、Agent、具身、物理设备四层同时长出「可整合、可标准、可规模」的接口

图 02 — 整合纪元信号位置 | 能力轴 × 整合层:自改进模型(Hy4)· Agent 渗透与 Harness(Temporal/JetBrains)· 具身少示教(Skild)· 具身量产(优必选+发改委)· 物理设备协议(MHS)
CAPABILITY SETTLED / INTEGRATION ERA / 2026-08-29 能力就位(往期已证) NO.53/54/55 交付+风险 怎么规模用(今日) 四层同时长出标准接口 模型自改进 AI Coding · 开源 01 Hy4 preview 770B MoE·1M 递归自优化+31.8% 盲测 2.99/4 Agent 渗透 Harness · 客户端 02 Temporal/JetBrains 每天跑 80.8% Claude Code 反超 Copilot·ACP/Air 具身少示教 看一遍就会 03 Skild S1 视频即提示 未见 66% vs 9% ≈380 次演示 具身量产 真实作业拐点 04 优必选+发改委 全尺寸 921 台 毛利 66.8% 实训场+中试基地 物理协议 Agent 控设备 05 Anthropic MHS 统一驱动协议 集成 数周→8h Agent 世界 USB
读法:横轴是「往期已证的能力就位 → 今日推进到的规模整合」。五点中,01 落在 AI coding 与自改进模型;02 是 Agent 渗透与工具链主战场;03/04 是具身少示教与量产双拐点;05 是让 agent 接管真实物理设备的协议层。四件事共同把「能力」翻译成「可整合、可规模的标准接口」。
SIGNALS / 05 当日动态
信号 01 / AI Coding · 开源大模型

腾讯混元 Hy4 preview 开源:770B MoE 自改进闭环,盲测略超 GLM-5.3 / Kimi K3

AI Coding开源权重Hy4 preview递归自改进

事件

腾讯于 8 月 28 日发布并开源新一代旗舰 Hy4 preview

  • 规格:总参 770B、激活 49B、上下文 1M tokens、Apache-2.0;较上代 Hy3(295B/21B、256K)全面扩张,由首席 AI 科学家姚顺雨主导。
  • 自改进闭环:首次把模型放进自身训练方法 / 数据策略 / 评估体系 / 底层算子的自动优化回路——模型提方案、跑实验、据结果迭代,自主分析推理瓶颈并做算子融合 / 通信优化,端到端吞吐较基线 +31.8%
  • 跑分与定位:内部 163 名专家 / 203 个工程任务盲测 2.99/4,略优于 GLM-5.3(2.92)与 Kimi K3(2.94);定位「为生产力而生」,覆盖软件工程 / 办公 / 科研 / 游戏;WorkBuddy / CodeBuddy / 元宝 / ima 同步首发,腾讯云 TokenHub + OpenRouter 接入,延续普惠定价(输入 6 元 / 百万 tokens)。
为什么值得关注

这不仅是「又一个开源大模型」,而是把「AI 优化 AI 基建」从口号落成训练回路——模型不再只是被训练,而是参与改进训练自己。叠加盲测略超同档开源旗舰、1M 上下文与 Apache-2.0,国产开源正稳居第一梯队并逼近 frontier。

可核验数据点 · 8/28 腾讯发布并开源 · 770B/49B MoE · 1M 上下文 · Apache-2.0 · 自改进闭环吞吐 +31.8% · 盲测 2.99/4(GLM-5.3 2.92 / Kimi K3 2.94)· WorkBuddy/CodeBuddy/元宝/ima 首发 | 冷静点:盲测为公司内部口径;自改进幅度为官方发布值待独立复现;「第一梯队」为厂商定性
信号 02 / 具身智能 · 少示教范式

Skild AI S1:视频即提示,零后训练跑通 10 分钟长程任务,未见任务 66% vs 语言 VLA 9%

具身智能少示教S1上下文学习

事件

Skild AI(CMU Deepak Pathak + Abhinav Gupta 创立,软银领投 $1.4B C 轮、估值 $14B)于 8 月 25–27 日发布机器人基础模型 S1

  • 视频即提示:把一段人类演示视频放进上下文窗口,权重冻结、零后训练,直接执行煎饼 / 咖啡 / 换盆 / 组装等长程任务;从演示录制到机器人自主执行最短 11 分钟
  • 长程能力:任务长度突破 10 分钟、数十步;演示内容不在预训练分布内(厂商口径),机器人遇缺件会改用杯子、遇移位会重规划,呈现「理解目标而非复刻轨迹」。
  • 硬数字:未见任务平均单步成功率 66%,语言提示 VLA 仅 9%;据厂商插值,一次视频提示 ≈ 380 次后训练演示的等效表现(传统 VLA 需约 2000 次演示才反超 S1 的 66% 到 86%)。
为什么值得关注

这是具身「看一遍就会」的范式突破——把新技能的数据成本从数周遥操 / 数百次演示压到「一段视频」,直接回应行业最大的数据与量产瓶颈。区别于 NO.54 的 Generalist GEN-1.5(秒级 one-shot 短程),S1 主打长程 + 跨本体视频提示,更接近工厂 / 家庭真实换线场景。

可核验数据点 · 8/25–27 Skild 发布 · 视频 ICL · 零后训练 · 10 分钟长程 · 演示→执行 11 分钟 · 未见任务 66% vs VLA 9% · 1 视频≈380 次演示 · CMU Pathak/Gupta · 软银领投 $1.4B C 轮 · $14B | 冷静点:66% 为单步成功率、非全程自主完成率;基准为厂商内部套件、待第三方复现;闭源权重、工业产线适配待验证
信号 03 / AI Agent · 渗透与 Harness 竞争

Temporal 2026 报告:80.8% 工程师每天跑 Agent;JetBrains 生态 Claude Code 反超 Copilot

AI AgentHarnessTemporalClaude Code

事件

两份近期权威调研共同刻画 Agent 渗透的陡峭曲线:

  • Temporal《2026 State of Development》(n=554,8/25):80.8% 工程师每天用 AI Agent,一年前仅 47.3%(相对 +70.8%);51.3% 数小时内把原型推到生产级代码;41.1% 每天遇到 Agent 问题;中位并行 5 个 Agent、均值 10.7。
  • JetBrains《Developer Ecosystem Survey 2026》(15000+ 开发者):90% 每周用 AI coding agent、68% 每天;Claude Code 使用率 39% / 美国 47%(约为 Copilot 2 倍),Copilot 由 29% 滑落至 21%;ACP(Agent Client Protocol)/ Air preview / JetBrains Central 把多 agent 协作收进统一客户端平面。
为什么值得关注

竞争焦点从「模型谁强」转向「Harness / 工具链谁顺手」——Agent 已成默认工作流,差异落在可靠性、成本与可观测,而非单次跑分;IDE 客户端成主战场,Copilot 失守、Claude Code 反超,跨客户端 agent 协议(ACP)开始沉淀为事实标准。

可核验数据点 · Temporal 8/25 报告 n=554 · 每天跑 Agent 80.8%(一年前 47.3%,+70.8%)· 原型→生产 51.3% 数小时内 · 每天遇问题 41.1% · JetBrains 2026 调研 15000+ · 每周用 90% / 每天 68% · Claude Code 39%/美 47% · Copilot 29%→21% | 冷静点:Temporal 为厂商发起调研、样本偏早期采用者;JetBrains 含自家产品口径;「反超」指使用率非收入
信号 04 / 具身智能 · 量产拐点

优必选 H1 量利齐升:全尺寸人形 921 台(+1946.7%)、毛利率 66.8%;发改委指路实训场 + 中试基地

具身智能量产优必选发改委

事件

「人形机器人第一股」优必选于 8 月 28 日晚发布 2026 中报,同日发改委在发布会上给出具身政策抓手:

  • 量利齐升:营收 12.7 亿(+104.2%);人形总销量 16123 台(+268.3%);全尺寸具身人形 921 台(+1946.7%)、收入 5.9 亿(+1445%)、毛利 3.9 亿(占整体约七成)、毛利率 66.8%(+19.5pp);整体毛利 5.7 亿(+160.9%);净亏损收窄、经调整 EBITDA −1.74 亿(减亏 45.9%)。
  • 客户落地:合作覆盖空客 / 比亚迪 / 吉利 / 富士康 / 本田贸易 / 东风柳汽 / 三一重能等,横跨航空制造、3C、半导体、汽车、智慧物流;下半年 Walker / Cruzr / U1 多线量产交付。
  • 政策补位:发改委发言人李超 8/28 明确,以具身智能实训场与应用中试基地为抓手,让机器人在真实场景迭代技术、围绕真实需求形成应用闭环。
为什么值得关注

行业从「演示秀场」切到「真实作业 + 量利齐升」,毛利结构首次显现——全尺寸具身 66.8% 毛利率说明高端人形已不是赔本赚吆喝;政策同步补数据 / 标准短板(实训场 + 中试基地),把「技术验证 → 应用闭环」的链条补上。

可核验数据点 · 8/28 晚中报 + 发改委发布会 · 营收 12.7 亿(+104.2%) · 人形 16123 台(+268.3%) · 全尺寸 921 台(+1946.7%) · 收入 5.9 亿(+1445%) · 毛利 66.8%(+19.5pp) · 整体毛利 5.7 亿(+160.9%) | 冷静点:仍净亏损、减亏≠盈利;全尺寸客户多为试点 / 项目制,万台级持续交付待观察;毛利率含产品结构影响
信号 05 / 终端 · 具身智能 · 物理设备协议标准化

Anthropic MHS 模型硬件标准:Claude 借统一驱动协议操控显微镜 / 激光器,集成从数周缩至约 8 小时

终端智能协议标准MHSAgent 控设备

事件

Anthropic 于 8 月 28 日发布 Model Hardware Standard(MHS)——给「agent ↔ 物理硬件」一套统一驱动协议:

  • 统一驱动:Claude 通过 MHS 标准协议操控显微镜、激光器、液体处理仪等真实实验室设备,无需为每台设备单独写适配。
  • 集成提速:CMU 实验显示,设备接入 Agent 的集成周期从数周压缩到约 8 小时——相当于把「agent 控制物理世界」标准化为协议层,类似 Agent 世界的 USB。
  • 意义:把具身 / 终端长期卡着的「每接一台设备写一套适配」变成「插上即用」,让 agent 从纯软件工作流延伸到真实实验室 / 产线执行面。
为什么值得关注

终端 / 具身智能的隐形瓶颈从来是硬件集成成本,MHS 把它从「工程苦活」升格为「协议标准」——和 A2A / MCP 把 agent 互操作标准化同一逻辑,只是对象从软件服务变成物理设备。谁定义这套协议,谁就握住 agent 进真实世界的入口。

可核验数据点 · 8/28 Anthropic 发布 MHS · 统一驱动协议 · Claude 控显微镜/激光器/液体处理仪 · CMU 实验集成 数周→约 8 小时 · 类比 Agent 世界 USB | 冷静点:目前聚焦实验室设备,工业产线高可靠适配待验证;协议采用广度待观察;为厂商主导标准、互操作生态未定

逻辑链 · 诚实声明

  1. 主线连续性:08-27「约束纪元(本地化 / 货币化 / 规模化 / 治理化)」→ 08-28 上午 NO.54「工程化兑现期(能不能交付)」+ 午后 NO.55「能力风险公开化(交付后风险)」→ 本日 NO.56「工程化整合纪元(怎么规模用)」。叙事从「能力 → 约束内运行 → 交付 → 风险」再推进到「四层同时长出可整合、可标准、可规模的接口」。
  2. 交叉验证:01(腾讯官方 / 人民网 / 科技日报)、02(Skild 官方 + RuntimeWire / AGI Hunt)、03(Temporal / JetBrains 官方报告)、04(优必选中报 + 澎湃 / 中证报 / 南方日报)、05(Anthropic 官方 + 腾讯新闻转述)均为一级或权威转述,中高可信。
  3. 与历史各期零重复:本期补的是 NO.53/54/55 未覆盖的 8/28–29 增量——Hy4 preview 新发、Skild S1 未见、Temporal/JetBrains 新数据、优必选中报 + 发改委新策、Anthropic MHS 新协议。与 NO.54(工作台 / 开源逼近 frontier / A2A 评测 / 终端主动化 / 智元小鹏)、NO.55(GLM-5.3 权重 / OpenAI-HF 失控 / Granite 4.2 / AgentZ)完全分开。
  4. 诚实边界:Hy4 盲测、S1 66% 单步成功率、MHS 集成提速均为官方或厂商口径、待独立复现;优必选仍净亏损、减亏不等于盈利;Skild 闭源权重、工业产线适配待验证;MHS 目前聚焦实验室设备。本报不构成投资建议。
本期一句话:能力就位之后,竞争压到「怎么规模用」——腾讯 Hy4 把模型放进自改进闭环、Temporal/JetBrains 显示 Agent 渗透破八成且战场移到 Harness、Skild S1 让具身看一遍就会、优必选中报 + 发改委确认量产拐点、Anthropic MHS 给物理设备一套统一驱动协议。模型、Agent、具身、物理设备四层同时长出标准接口。
风险与未决各信号多项能力为官方 / 厂商口径、待独立复现(Hy4 盲测、S1 成功率、MHS 提速);优必选减亏未盈利、万台级持续交付待观察;Skild 闭源权重、工业适配未证;MHS 目前限实验室设备、协议生态未定。开源 / 标准化「能力摊开」是双刃——让开发者可查,也让使用者独担部署后的集成与风险。