本期主线
重心从「能力演示」移到了四件工程实事上
能力就位已是共识,竞争焦点迁移到「谁来建、怎么管、在哪跑、拿什么训」:① McKinsey《State of AI 2026》显示 32% 组织因 AI coding agents 放弃外购软件转自研(科技业 41%)——coding agent 从提效工具晋升为技术主权变量;② GitHub Copilot 8/28 更新(思考强度档 + 组织级自定义 agent + Git 内联评审)与 OpenAI Codex CLI v0.151(扩展可在 MCP 工具结果到达模型前 inspect/replace)把战场压到 harness / 客户端控制面,Perplexity Portable Computer 则把整套 agent 运行时压到本地 DGX Spark;③ Uber 称 >70% PR 已归属本地/云端 AI agents,Hyr 上线 agent 雇 agent 的市场,SKILL.state 把长会话 token 降 ~94%——agent 进入真实吞吐并长出承包商经济;④ SAP LeanIX 调研 98% 企业已部署/计划部署 agent,仅不到一半能说清自己有哪些,Gartner 预测 Fortune 500 到 2028 年有 15 万+ agent、仅 13% 治理就绪——agent 泛滥成董事会级议题;⑤ 独立变量 WALL-SS 世界模型实现 60 秒连续推理、虚实成功率相关性 0.926,大晓×港大 StreamPI 给 VLA 加时间维度——仿真到落地的训练基建在补。一句话:稀缺资源从「能力」换成了「建 / 管 / 跑 / 训」。
SIGNALS / 05
当日动态
信号 01 / AI Coding · 战略自建
McKinsey《State of AI 2026》:32% 组织因 AI coding agents 放弃外购软件转自研,科技业达 41%
AI Coding战略自建能力Build-vs-Buy
事件
McKinsey《The state of AI in 2026》于 8 月 30 日发布,给出 coding agent 改写软件采购的判断:
- Build-vs-Buy 被改写:近 32% 受访组织表示已因「可用 agentic coding 工具内部构建」而放弃购买一个或多个软件产品或功能;分行业看,科技业最高 41%,医疗支付方/提供方 39%,专业服务与能源材料各 38%,金融 36%。
- 采用度扩散:近九成受访者在至少一项业务职能常规使用 AI;44% 报告 AI 在全组织规模化(去年 38%);部署在 3+ 职能的比例 51%→56%;年营收 ≥10 亿美元企业中,规模化 agent 的占比 27%→40%,小企业持平 22%。
为什么值得关注
这把 coding agent 从「提效工具」晋升为「技术主权 / 自建能力」的战略变量——企业不再默认外购行业软件,而是用 agent 自建。稀缺资源从「买不买得起某款软件」转向「自己能不能用 agent 建出来」。
可核验数据点 · 8/30 McKinsey《State of AI 2026》(ANI/LiveMint) · 32% 组织放弃外购转自研 · 科技业 41% / 医疗 39% / 专业服务·能源 38% / 金融 36% · 89% 常规用 AI · 44% 全组织规模化(vs 38%) · ≥$1B 企业 agent 规模化 27%→40% | 冷静点:样本为企业受访者、偏早期采用者;「放弃外购」为自报意向,未必等于已落地;占比是行业横截面非时间序列
信号 02 / AI Coding × 终端 · 控制面 + 本机运行时
Harness/客户端控制面成型:Copilot 思考强度档 + 组织级 agent,Codex CLI 让扩展改写 MCP 结果,Portable Computer 把运行时压到本机
AI Coding终端智能HarnessMCP 信任层本机运行时
事件
三件事共同把战场从「模型能力」压到「harness / 客户端控制面 + 本机运行时」:
- GitHub Copilot(VS)8/28 更新:思考强度档(Low/Medium/High 控制推理深度与 token 开销);组织/企业级可发布自定义 agent 跨仓库复用;Git 内联代码评审(评审未提交改动/指定 commit);全局模型策略 GA(8/26–9/1 逐步强制);Grok 4.6 进 Copilot 做 agentic coding。
- OpenAI Codex CLI v0.151.0(8/29):扩展可在 MCP 工具结果到达模型前 inspect/replace——在工具与推理回路之间插入脱敏 / 缓存 / 重排层;并修复 /cd 静默削弱沙箱、权限档案跨 TUI 保留等。
- Perplexity Portable Computer(8/25,与 NVIDIA):把模型 + 编排器 + 子代理 + 工具 + 沙箱整套 agent 运行时压到本地 DGX Spark / RTX Linux;本机完成不耗额度,敏感数据默认留本机,仅用户授权才升云。
为什么值得关注
思考强度档与组织级 agent 是「怎么管 agent」;MCP 结果过滤是 agent 与工具之间的信任闸门;本机运行时是「数据主权默认」。三者合起来,agent 工作从「云端黑箱」变成「可分级、可审计、可留本机」的运行环境。
可核验数据点 · Copilot VS 8/28 更新(官方 Changelog) · 思考强度档 + 组织级自定义 agent + Git 内联评审 + 全局模型策略 GA + Grok 4.6 · Codex CLI v0.151.0(8/29) · 扩展可改写 MCP 工具结果(脱敏/缓存/重排) · Perplexity Portable Computer(8/25) · 本机 DGX Spark/RTX · 本机不耗额度·敏感数据留本机 | 冷静点:Copilot/Grok 为厂商口径;Codex MCP 改写是开发者钩子非开箱策略;Portable Computer 首发限 Linux、Windows 9 月,模型为 Qwen3.8 27B/PPLX 27B
信号 03 / AI Agent · 生产速度 + Agent 经济
Agent 进真实吞吐:Uber 称 >70% PR 已归属 AI agents;Hyr 上线 agent 雇 agent 市场,SKILL.state 把长会话 token 降 ~94%
AI Agent生产速度Agent 经济长程
事件
agent 从 demo 推进到真实吞吐,并长出「承包商经济」雏形:
- Uber(据 AGI HUNT 8/30 日报):超过 70% 的 pull request 如今归属于本地或云端 AI agents——agent 进入真实工程吞吐,而非演示。
- Hyr 市场:上线「agents hire other agents against a USD budget」——agent 作为承包商,在预算约束下雇佣其他 agent 完成任务,agent 间协作开始计价。
- Google SKILL.state(同日):用结构化状态 + 最新观测替换全量 transcript,长会话 token 用量降约 94%;PILOT 论文让 agent 在同一次运行中持续反思、更新策略,对抗长程衰减。
为什么值得关注
agent 不再只是「能干活」,而是进入真实吞吐(70% PR)并长出「承包商经济」雏形——agent 成为可计价、可外包的生产要素,而非一次性调用。SKILL.state 这类「丢掉历史、保留状态」的范式,直接砍掉长程 agent 的成本墙。
可核验数据点 · Uber 称 >70% PR 归属 AI agents(AGI HUNT 8/30 聚合,待一手源) · Hyr agent 雇 agent 市场(USD 预算) · Google SKILL.state 长会话 token −94% · PILOT 同运行内策略更新 | 冷静点:Uber 70% 为聚合转述、非官方财报口径;Hyr 为新兴市场、规模待验证;SKILL.state/PILOT 为论文/工程笔记、待生产复现
信号 04 / AI Agent · 治理成董事会级
Agent 泛滥成董事会级议题:SAP LeanIX 调研 98% 企业已部署/计划 agent,仅不到一半说清自己有哪些;Gartner 估 Fortune 500 到 2028 年有 15 万+ agent
AI Agent治理proliferation董事会级
事件
- SAP LeanIX《Agentic AI》调研:98% 企业已部署或计划部署 AI agents,但不到一半能清晰掌握自己到底有哪些 agent 在运行;仅 13% 认为治理就绪。
- Gartner:典型 Fortune 500 到 2028 年将拥有 15 万+ AI agents;失控扩散(agent proliferation)带来越权、删数据、不可逆财务操作等风险;CIO 被警告「封堵/严限」不可持续,会逼出 shadow AI。
- 背景呼应:8/27 Salesforce×Anthropic「Claudeforce」、8/26 OpenAI-Hugging Face 700 agent 自主入侵事件——agent 真实风险已从哲学命题落到时间差。
为什么值得关注
「agent 治理平台」成为新品类(身份/权限/审计/退役)。
可核验数据点 · SAP LeanIX Agentic AI 调研 · 98% 已部署/计划 · <50% 说清有哪些 · 仅 13% 治理就绪 · Gartner · 典型 Fortune 500 到 2028 年 15 万+ agents · agent proliferation 风险(越权/删数据/不可逆财务) | 冷静点:SAP 调研为其自家治理产品背书、口径偏营销;Gartner 15 万为预测非实测;「13% 就绪」为自评
信号 05 / 具身 · 训练基建(世界模型 + 时序 VLA)
仿真到落地的训练基建补位:独立变量 WALL-SS 世界模型 60 秒连续推理、虚实相关性 0.926;大晓×港大 StreamPI 给 VLA 加时间维度
具身智能世界模型VLA训练基建
事件
两条 8/29 发布共同补「仿真→落地」的训练基建:
- 独立变量(Independent Variable)WALL-SS 世界模型:next-scale 自回归架构,攻克因果一致 / 长程推理 / 虚实一致三大瓶颈,实现 60 秒连续推理,虚拟与现实成功率相关性达 0.926——把仿真世界变成可验证的机器人训练场。
- 大晓机器人×香港大学 StreamPI:为 VLA 模型加入时间维度(流式时序建模),让系统记住过往状态、理解变化,显著提升真实任务成功率,推动具身从「空间智能」迈向「连续物理智能」。
为什么值得关注
世界模型 + 时序 VLA 是把「仿真→落地」距离压短的关键基建:前者给机器人可验证的训练场(虚实相关性 0.926 意味着仿真可信),后者给连续物理智能(不再只看一帧)。
可核验数据点 · 独立变量 WALL-SS 世界模型(next-scale 自回归) · 60 秒连续推理 · 虚拟/现实成功率相关性 0.926 · 大晓×港大 StreamPI · VLA + 时间维度(流式时序) | 冷静点:WALL-SS 相关性为厂商/论文口径、待独立复现;StreamPI 为研究发布、工业产线适配待验证;两者均闭源/早期,不代表即插即用
逻辑链 · 诚实声明
- 主线连续性:NO.56「工程化整合纪元(怎么规模用)」→ 本日 NO.57「自建·可信·在端·可训(建 / 管 / 跑 / 训)」。叙事从「四层长出标准接口」再推进到「客户自建改写入口、本机运行时落地、agent 结算与治理、世界模型训练场」——稀缺资源从能力演示进一步下沉到四件工程层实事。
- 交叉验证:01(McKinsey / LiveMint ANI 8/30)、02(GitHub Changelog / OpenAI Codex CLI / Perplexity·NVIDIA 官方)、03(AGI HUNT 8/30 聚合 + Google 工程笔记)、04(SAP LeanIX / Gartner 公开研判 + 8/26–27 事件)、05(GeekPark 8/29 转述独立变量 / 大晓)均为一级或权威转述,中高可信;03/05 含聚合与论文口径。
- 与历史各期零重复:本期补的是 8/28–30 增量——McKinsey 年度调研新发、Copilot/Codex 8/28–29 更新、Uber/Hyr/SKILL.state 8/30 新信号、SAP/Gartner 治理新研判、WALL-SS/StreamPI 8/29 新模型。与 NO.56(Hy4/Skild/Temporal/优必选/MHS)、NO.55(GLM-5.3/OpenAI-HF/Granite/AgentZ)完全分开。
- 诚实边界:02 Copilot/Grok、03 Uber 70% / Hyr、05 WALL-SS 相关性多为厂商或聚合口径、待独立复现;McKinsey 32% 为自报意向;SAP 调研偏营销、Gartner 15 万为预测。本报不构成投资建议。
本期一句话:能力就位之后,竞争压到「建 / 管 / 跑 / 训」——McKinsey 显示客户因 coding agent 转自建(C 入口被改写)、SAP/Gartner 把 agent 治理推上董事会(B 治理原语)。
风险与未决多项为厂商 / 聚合 / 论文口径、待独立复现(Copilot/Grok、Uber 70%、WALL-SS 相关性);McKinsey 32% 为自报意向非落地;SAP 调研偏营销、Gartner 15 万为预测;Portable Computer 首发限 Linux、Windows 9 月;世界模型 / 时序 VLA 仍闭源早期,不代表即插即用。开源 / 标准化「能力摊开」是双刃——让开发者可查,也让使用者独担部署后的集成与风险。