Leion · NO.58 2026-08-31 10:00 GMT+8

受托·上岗:AI Agent 与机器人集体跨过「演示 → 常驻委托 → 进产线 / 进终端」

Signals5 条 / 周末精选
主战场AI Coding · Agent · 终端 · 具身
硬数字25h · 90% · 80% · 4万 · 80×80
时间锚演示 → 受托 → 上岗
本期主线
自治体被推过「演示 → 受托 → 上岗」三道坎

能力就位已是共识,竞争焦点迁移到「能不能被委托、能不能真上岗」:① OpenAI 测试 Codex「持久模式」,复杂任务最长连续运行 25 小时、跨会话保存上下文、自主规划子任务——coding agent 从「一轮对话」变「常驻委托对象」;② JetBrains《2026 开发者生态调查》显示 90% 专业开发者每周用 AI coding agent、68% 每天,Claude Code 七个月内 18%→39%(美国 47%)反超 Copilot(21%),Codex 16%、Cursor 12% 下滑——coding agent 已成日常开发环境,竞争从「AI IDE 好不好用」转向「agent 能否把任务做完」;③ 华为云 828 B2B 企业节:智果 AgentArts 端到端任务完成率 80%、码道 CodeArts 升级 Agent Team 内置 16 个专家智能体——企业 agent 从「试了试」进入「装进真实生产系统」;④ 摩盖 MOG V1 AI 工作手机 8/26 首批交付,端侧 VLM + 云端决策协同的 Sales Agent 跨 App 读屏/执行,终端原生 agent 从概念走到货架;⑤ 第二届世界人形机器人运动会全自主(去遥控)破人类纪录(100m 9.39s、高跳 2.88m、400m 38.15s、1500m 2:21.63),H1 中国出货 4 万+ 占全球 97%、工信部估全年 10 万+,王兴兴量化人形 ChatGPT 时刻=80% 陌生场景完成 80% 任务,浙江均普机器人赴欧车企产线、2000 台服装场景批量交付、特定场景 99% 成功率——具身从秀场跨进考场与产线。一句话:稀缺资源从「能不能演示」进一步到「能不能被委托、能不能真上岗」

图 02 — 演示 → 受托 → 上岗 信号位置 | 自治程度轴:长程自主(Codex 持久)· 日常环境(Claude Code 反超)· 企业落地(华为 80%)· 终端原生(MOG V1)· 具身上岗(运动会/浙江出海)
DEMO → DELEGATED → DEPLOYED / 2026-08-31 演示(往期已证) NO.53/54/55/56/57 能力交付 受托 · 上岗(今日) 常驻委托·进产线·进终端 长程自主 AI Coding · 受托 01 Codex 持久模式 最长 25h 连续 跨会话存上下文 自主规划子任务 日常环境 AI Coding · 格局 02 JetBrains 调查 90% 周用/68% 日 Claude Code 39% 反超 Copilot 21% 企业落地 AI Agent · 上岗 03 华为 828 端到端 80% Agent Team 16 专家 装进生产系统 终端原生 终端智能 · 上岗 04 MOG V1 交付 8/26 首批商用 端侧 VLM+云端 Sales Agent 跨 App 具身上岗 具身 · 考场/产线 05 运动会/浙江 H1 4万/97% 全自主破纪录 出海+批量交付 C 客户委托 coding agent · B 企业 agent 进生产+终端原生执行 · A 本机/端侧可信运行 · D 具身上岗与出海交付
读法:横轴是「往期已证的演示 → 今日推进到的受托 / 上岗」。五点中,01/02 是 coding agent 变成「被长期委托的对象」(C 入口被日常化);05 是具身进考场与产线(D 上岗与出海)。四件事共同把「能力」翻译成「被委托、被使用、真上岗」。
SIGNALS / 05 当日动态
信号 01 / AI Coding · 长程自主

OpenAI 测试 Codex「持久模式」:复杂任务最长连续运行 25 小时,跨会话保存上下文、自主规划子任务

AI Coding长程自主持久模式受托

事件

据 WIRED 8/28 报道,通过查阅产品代码发现,OpenAI 正在为代码智能体 Codex 测试「持久模式(persistent mode)」新特性:

  • 从一轮对话到常驻委托:现有 Codex 完成一轮交互后即便任务未做完也会在运行一段时间后自动终止;持久模式下,AI 能主动规划后续子任务、跨会话保存项目上下文,无需用户反复下发指令,持续向设定目标迭代推进。
  • 实测时长:测试环境中处理复杂开发任务时,该智能体最长可连续运行 25 小时
  • 官方定性:OpenAI 确认该功能处于内部实验测试阶段,暂无近期上线安排;高算力消耗,出现在推理强度配置菜单中。
为什么值得关注

这把 coding agent 从「一轮问答工具」推向「被长期委托的工程实体」——人下发一次目标,agent 自己拆解、续跑、保住上下文。它和 NO.57 的 SKILL.state(长会话 token −94%)是同一方向的两条补完:一个解决「跑得久」,一个解决「跑得省」。

可核验数据点 · WIRED 8/28 报道(据产品代码逆向) · Codex 持久模式:跨会话存上下文·自主规划子任务·最长连续 25h · 高算力消耗·推理强度菜单 · 官方:内部实验·暂无上线安排 | 冷静点:消息源为媒体据代码逆向+官方确认,非正式发布;25h 为测试环境极值非常态;功能未上线,时间表不明
信号 02 / AI Coding · 格局重排

JetBrains《2026 开发者生态调查》:90% 专业开发者周用 AI coding agent、68% 每天;Claude Code 七个月 18%→39% 反超 Copilot

AI Coding日常环境格局Claude Code

事件

JetBrains Research 8 月发布第十版《开发者生态系统调查》(5–7 月,1.5 万+ 专业开发者),给出 coding agent 已成「日常开发环境」的硬证据:

  • 渗透率90% 专业开发者每周至少用一次 AI 编程 agent,68% 每天使用。
  • 七个月格局重排:Claude Code 从 1 月的 18% 飙升至 39%(美国市场 47%),登顶职场使用最广的 AI 编码工具;GitHub Copilot 由 29% 降至 21%;OpenAI Codex 由 3% 增至 16%(约 5 倍);曾经风头最劲的 Cursor 反向下滑,18%→12%(「知道的人更多、用的人更少」)。
  • 开源与标准:无厂商开源编码 Agent OpenCode 工作使用率 7%、认知度 42%;配置标准之争持续——Copilot 已能读仓库根目录 AGENTS.md 并调用仓库定义的 agent skills,被视为最接近「可移植配置标准」。
为什么值得关注

这是 AI 编程从「尝鲜工具」变为「日常基础设施」的最硬证据,竞争焦点已从「谁的 AI IDE 更好用」转向「谁的 agent 能真正把任务做完」。Claude Code 反超说明分发渠道(预装 IDE)不再是护城河,能否接管端到端开发工作流才是。

可核验数据点 · JetBrains Research《2026 开发者生态系统调查》(8月,5–7月,1.5万+开发者) · 90% 周用·68% 日 · Claude Code 18%→39%(美47%)·Copilot 29%→21%·Codex 3%→16%·Cursor 18%→12% · OpenCode 7%/认知42% · AGENTS.md 可移植配置 | 冷静点:样本为 JetBrains 生态开发者、偏早期采用者;使用率为自报;认知度≠使用率;横截面非时间序列因果
信号 03 / AI Agent · 企业级落地

华为云 828 B2B 企业节:智果 AgentArts 端到端任务完成率 80%,码道 CodeArts 升级 Agent Team 内置 16 个专家智能体

AI Agent企业落地上岗Agent 团队

事件

8/27 第五届 828 B2B 企业节(2026 数博会期间)聚焦 Agent 时代企业落地,华为云联合中软国际、软通动力、金山办公、科大讯飞等 16 家伙伴启动「企业 AI 百场景落地」行动,释放明确信号——AI 价值正从技术参数转向实际产出:

  • 端到端完成率:智果 AgentArts 企业级智能体平台全面践行 Harness 工程(生产级长程任务/企业级安全/行业知识深度/全链路可观测),将端到端任务完成率提升至 80% 的业界高水平,实现开发-运行-运维全生命周期闭环。
  • 多智能体协同:码道 CodeArts 代码智能体升级 Agent Team,内置 16 个专家智能体实现多角色并行协同开发;果办 OfficeAce 对接企业已有 IT 系统与知识库。
  • 生态卡位:软通动力天璇 AgentOS、北明软件灵零九企业智能体平台基于 openJiuwen 发布;华为云称 AI 正从「辅助工具」变为能自主作业的「数字员工」。
为什么值得关注

企业级 agent 从「试了试」进入「装进真实生产系统」——80% 端到端完成率 + 16 专家 Agent Team 是「能不能干完真实业务」的硬指标,呼应 NO.57 的 agent 治理议题:规模化上岗必须以可观测、可审计、可退役为前提。

可核验数据点 · 第五届 828 B2B 企业节(8/27,数博会) · 华为云 AgentArts 端到端完成率 80% · CodeArts Agent Team 16 专家 · 16 家伙伴·企业AI百场景落地 · 周跃峰/刘杰发言 | 冷静点:80% 为厂商口径、场景与口径未公开;「数字员工」为营销表述;AgentArts 完成率依赖华为自家 Harness 定义,非第三方基准
信号 04 / 终端智能 · 原生商用交付

摩盖 MOG V1 AI 工作手机 8/26 首批交付:端侧 VLM + 云端决策协同的 Sales Agent 跨 App 读屏/执行,终端原生 agent 从概念走到货架

终端智能原生商用上岗端侧 VLM

事件

8/26 上海,摩盖软件完成 MOG V1 AI 工作手机首批正式交付,标志业内首款面向一线员工、终端原生运行的 AI 工作智能体走向商用落地:

  • 架构:端侧 VLM 视觉大模型 + 云端决策协同,把完整 AI 智能体运行在手机终端之上;以销售人员智能体(Sales Agent)为核心,打通手机内多应用数据孤岛。
  • 能力:具备跨 App 读取记录、识别手机界面、自动执行操作的端侧原生能力;可语音调取设备状态、读业务聊天、代拟客户回复、自动生成工作复盘、执行设备底层管控指令。
  • 合规与适配:继承 MDM/MAM/MCM 移动设备管控能力,合规留存通话、短信、微信全链路业务沟通数据,完成敏感行为风控、企业客户资产沉淀;深度适配主流商用机型,企业无需更换特殊定制硬件即可获得端侧 AI 智能体全套能力,兼顾采购成本与落地兼容性,适配政企、销售型与私域运营团队。
为什么值得关注

这是终端原生 agent 从概念走到货架的实锤——不是云端助手套壳,而是把视觉理解 + 决策 + 跨 App 执行真正压到手机终端,且面向政企合规场景(通话/微信全链路留存、敏感行为风控)。它把 NO.57 的「本机运行时 / 数据主权默认」从个人生产力推进到企业移动办公。

可核验数据点 · 摩盖软件 MOG V1 AI 工作手机 首批交付(8/26,上海) · 终端原生 AI 工作智能体·端侧 VLM+云端决策·Sales Agent 跨 App 读屏/执行 · MDM/MAM/MCM 管控·通话短信微信全链路留存·深度适配主流机型 | 冷静点:厂商发布口径、首批交付规模未披露;端侧 VLM 具体模型/性能未公开;跨 App 自动执行依赖系统授权,真实稳定性待验证
信号 05 / 具身 · 上岗 / 出海

具身从秀场跨进考场与产线:第二届世界人形机器人运动会全自主破人类纪录,H1 中国出货 4 万+ 占全球 97%,浙江机器人赴欧车企产线批量交付

具身智能上岗出海量产

事件

周末两场盛会 + 一线落地,共同把具身从「演示」推到「考场 / 产线 / 出海」:

  • 运动会全自主破纪录:第二届世界人形机器人运动会(8/22–26,北京)2056 台机器人、666 队、51 项目;最大变化是去遥控、全自主——100m 跑 9.39s(破博尔特 9.58s)、站立跳高 2.88m(破人类 2.45m)、400m 38.15s、1500m 2:21.63,均超人类世界纪录。
  • 量产与占比:工信部预计全年产量破 10 万;H1 中国出货 4 万+ 占全球 97%(中国电子学会);宇树王兴兴给出人形「ChatGPT 时刻」量化定义=80% 陌生场景通过语音/文字指令完成约 80% 任务,临界点最快 2–3 年、最慢 5–10 年。
  • 出海与批量交付:浙江均普智能机器人赴欧洲头部车企生产车间「上岗」;2000 台服装场景定制机器人进入批量交付,特定测试场景作业成功率 99%;云深处行业级全天候人形机器人落地变电站巡检等复杂场景。
为什么值得关注

具身智能的稀缺资源从「能不能动」换成「能不能在全自主下干活、能不能真进产线、能不能出海交付」。全自主(去遥控)是能力拐点,99% 特定场景成功率 + 赴欧车企产线是「上岗」硬证据——呼应 NO.56/57 的「交付纪元 / 价值兑现」主线。

可核验数据点 · 第二届世界人形机器人运动会(8/22–26,北京) · 2056 台/666 队/51 项·全自主·100m 9.39s·高跳 2.88m·400m 38.15s·1500m 2:21.63 · 中国电子学会/工信部 · H1 出货 4万+ 占全球 97%·全年预计 10万+ · 王兴兴 · 人形 ChatGPT 时刻=80%场景完成80%任务(2–3年/5–10年) · 浙江均普 · 赴欧车企产线·2000台服装场景批量交付·特定场景 99% | 冷静点:运动会为标准化赛项非真实工况;97% 为全球产量占比含消费/教育类;99% 为特定测试场景非通用;出海交付规模与合同时长未披露

逻辑链 · 诚实声明

  1. 主线连续性:NO.57「自建·可信·在端·可训(建 / 管 / 跑 / 训)」→ 本日 NO.58「受托·上岗(演示 → 受托 → 上岗)」。叙事从「客户自建改写入口、本机运行时、agent 结算治理、世界模型训练场」再推进到「coding agent 被长期委托、企业 agent 进生产系统、终端原生 agent 商用交付、具身进考场与产线」——稀缺资源从能力演示进一步下沉到「被委托、被使用、真上岗」。
  2. 交叉验证:01(WIRED 8/28 据代码逆向 + OpenAI 确认)、02(JetBrains Research 8 月调查,1.5 万+ 样本)、03(华为云 828 企业节 8/27 多家媒体验证)、04(摩盖软件 8/26 发布)、05(China Daily / 证券时报 / 中新网 8/27–29 报道)均为一级或权威转述,中高可信;05 含赛事与厂商口径。
  3. 与历史各期零重复:本期补的是 8/26–29 增量——Codex 持久模式(新特性)、JetBrains 年度调查(新数据)、华为 828(新落地)、MOG V1 交付(新商用)、运动会纪录 + 王兴兴定义 + 浙江出海(新上岗证据)。与 NO.57(McKinsey/Copilot-Codex-Portable/Uber-Hyr-SAP-Gartner/WALL-SS-StreamPI)、NO.56(Hy4/Skild/Temporal/优必选/MHS)完全分开。
  4. 诚实边界:01 为媒体据代码逆向、功能未上线;03 的 80% 完成率为华为口径、非第三方基准;04 首批交付规模未披露;05 运动会为标准化赛项、97% 含消费/教育类、99% 为特定场景。本报不构成投资建议。
本期一句话:自治体(Agent + 机器人)集体跨过「演示 → 受托 → 上岗」三道坎——Codex 持久模式让 coding agent 被长期委托(25h 连续、跨会话存上下文)、JetBrains 调查证明 coding agent 已成日常环境(Claude Code 39% 反超 Copilot)、华为 828 把企业 agent 装进生产系统(端到端 80% + 16 专家 Agent Team)、MOG V1 让终端原生 agent 商用交付(端侧 VLM 跨 App 执行)、具身从秀场进考场与产线(全自主破纪录 + 4 万+ 出货 + 浙江出海 99%)。
风险与未决Codex 持久模式为内部实验、未上线、25h 为测试极值;华为 80% 完成率依赖自家 Harness 定义、非第三方基准;MOG V1 首批交付规模与端侧 VLM 性能未公开、跨 App 执行依赖系统授权;具身运动会为标准化赛项非真实工况、97% 全球占比含消费/教育类、99% 为特定测试场景。开源 / 标准化「能力摊开」是双刃——让开发者可查,也让使用者独担部署后的集成与风险。