本期主线
竞争焦点落在了「被委托之前先防住、能跑之后能算账」
能力就位已是共识,稀缺资源从「能不能演示」进一步下沉到五件让能力真正「能被委托、能上岗、能算账」的底座:① Manifold Security 9/1 披露 GitSpawn——8 个漏洞横跨 7 个 CLI coding agent,恶意 .git 配置(core.fsmonitor 等)能让 agent 在开发者机器上沙箱外、无审批执行攻击代码;goose / Claude Code / Cursor 已修,Hermes Agent、Qwen Code、Grok Build 及 Claude Code 另一路径仍裸奔——agent 安全边界不在模型、在管道;② OpenAI 宣布 11/12 终止向 Cursor 供模型(SpaceX 收购后不信任条款),同日阿里 Qwen3.8-Max 登顶 CodeArena 前端编程榜(1691,超 Claude Opus 5 / Kimi K3,每百万 token $5),开源 Orca 把 Codex / Claude Code / 多模型编成「多 Agent 开发团队」(Git Worktree 并行)——coding agent 护城河从「模型接入」转向「自有模型 + 场景绑定 + 多 Agent 工作台」;③ 企业级 agent 密集上岗:腾讯 WorkBuddy 在晶科能源把财务 BP 月度预算分析从 2 天压到 15 分钟、蒙牛自建 45 个 AI 数字员工,6 月以来腾讯/阿里/百度/字节/金山/360 密集推 AI 办公产品,国内 17 款主流 AI 办公智能体月访问量 3 月 2000 万 → 6 月 6000 万,Salesforce Slack Code 把编程智能体嵌进 Slack 协作流、Winter'27 Agentforce 从任务辅助进端到端自主工作流(73.1% 企业决策者列高优先级)——从「会问答」到「能交付、按结果计费」;④ 努比亚 NaviX Ultra(豆包手机二代)9/1 获工信部入网许可,全球首款量产 AI 智能体手机 9 月发售,端侧+云端协同跨应用多步自主执行(成功率 80%+),Counterpoint 估 2026 生成式 AI 手机出货占比 45%、2027 破 52%——智能手机从「功能型 AI」进「智能体型 AI」,入口从 APP 分发转智能体调度;⑤ 人形机器人从赛场进工位:第二届世界人形机器人运动会天工 Ultra 400m 38.15s(一年前 1:28),《国家人形机器人产业标准体系建设指南(2026版)》+ 全量数据集 2500h + 国际标准《人形机器人数据集》立项,上半年融资 935 亿 同比 5 倍、中国出货占全球 97%——从「参赛」到「定标」,但王兴兴再提醒「身体达标≠大脑成熟」。一句话:稀缺资源从「能不能演示」下沉到「可信边界(被委托前先防住)· 可控执行(多 agent 工作台 + 私有化)· 按结果交付(企业上岗算账)· 端侧闭环(手机量产)· 标准定义(具身定标出海)」这一组能力。
SIGNALS / 05
当日动态
信号 01 / AI Coding · 可信边界
GitSpawn:恶意 .git 配置可让 7 个 CLI coding agent 在开发者机器上沙箱外、无审批执行攻击代码
AI Coding可信边界上岗前提GitSpawn
事件
Manifold Security 9/1 披露 GitSpawn——跨 7 个命令行 coding agent 的 8 个安全漏洞,根因在普通管道而非模型:
- 触发机制:仓库自带
.git/config 的 core.fsmonitor 等性能项,值是 Git 在刷新索引(git status / git diff)时运行的命令;agent 启动即调用这些命令确定分支与变更,于是仓库配置里的命令在沙箱外、无审批下以用户权限执行——读取/篡改/删除用户文件、触及账户资源。
- 影响面:goose、Claude Code、Cursor 已修复;截至 9/1 复测,Hermes Agent、Qwen Code、Grok Build 及 Claude Code 另一路径仍裸奔;OpenAI 同日自曝 3 个同类的 Codex CVE。在 Hermes/Qwen Code 上载荷在信任提示接受前/认证前即触发。
- 本质:漏洞不在模型、不在新东西,而在「agent 启动时为确认自己在哪而 spawn 的子进程」——被仓库配置投毒。
为什么值得关注
这直接对冲 NO.58 的「受托 / 上岗」:一个能被长期委托(Codex 持久 25h)的 agent,攻击面也同步放大。它证明agent 的可信边界不在模型智能,而在启动序列与子进程隔离——这是「上岗前先防住」的最硬一课。
可核验数据点 · Manifold Security GitSpawn(9/1) · 8 漏洞/7 个 CLI agent · core.fsmonitor 等 .git 配置沙箱外执行 · 已修:goose/Claude Code/Cursor · 仍裸奔:Hermes Agent/Qwen Code/Grok Build/Claude Code 次路径 · OpenAI 同日 3 个 Codex CVE · The Hacker News 9/1 | 冷静点:利用需仓库以含 .git 的文件形式到达(共享压缩包/盘/USB),普通 clone 不触发;部分为厂商自述修复进度
信号 02 / AI Coding · 护城河迁移
OpenAI 11/12 终止向 Cursor 供模型 + Qwen3.8-Max 登顶 CodeArena + 开源 Orca 多 Agent 工作台:coding agent 护城河从「模型接入」转向「自有模型 + 多 Agent 工作台」
AI Coding护城河多 Agent 工作台模型无关
事件
9/2 三件事同日把 coding agent 的竞争结构显形:
- 模型商收紧:OpenAI 宣布 11/12 终止向 Cursor 提供模型服务,理由是不信任被 SpaceX 收购后的合作方遵守条款;Cursor 仅约 5% 流量依赖 OpenAI,Anthropic 已表态增算力支持 Claude 接入。
- 模型冲顶:阿里 9/2 更新 Qwen3.8-Max,CodeArena 前端编程榜 1691 分登顶(超 Claude Opus 5 / Kimi K3),每百万 token 综合均价约 $5,已接入 Qoder、千问办公。
- 工作台开源:GitHub 走红的 Orca 定位 Agent Development Environment——以 Git Worktree 为底座,让 Codex / Claude Code / OpenCode / Pi / Kimi / Qwen Code 并行工作于独立目录,开发者统一比较 Diff、Review 后合并,IDE 从「单人编辑器」走向「多 Agent 工作台」。
为什么值得关注
模型商与工具商的博弈进入新阶段:护城河从「谁能接入最强模型」转向「自有模型 + 场景绑定 + 多 Agent 工作台」。Orca 这类模型无关 harness 把「核心极小、能力靠扩展」做成范式,封闭产品的锁定正在松动。
可核验数据点 · 全天候科技/潮新闻 9/2 · OpenAI 11/12 终止 Cursor 模型供应·Cursor ~5% 流量依赖 OpenAI · 阿里 Qwen3.8-Max 9/2 · CodeArena 1691 登顶·每百万token ~$5·接入 Qoder/千问办公 · Orca(GitHub) · ADE·Git Worktree 多 agent 并行 | 冷静点:Cursor 断供为官宣、窗口至 11/12;CodeArena 为前端专项榜非综合;Orca 为社区项目、成熟度待验证
信号 03 / AI Agent · 企业上岗
AI 办公智能体密集上岗:WorkBuddy@晶科把预算分析 2 天压到 15 分钟,国内主流 AI 办公智能体月访问量 3 月 2000 万→6 月 6000 万,Salesforce 推 Slack Code 与端到端 Agentforce
AI Agent上岗按结果计费办公流
事件
9/3 上证报 / 新浪报道多家大厂把 AI 办公智能体推进一线业务,供给侧同步密集入局:
- 落地实证:晶科能源用腾讯 WorkBuddy,财务 BP 月度预算分析从 2 天压到 15 分钟(规则做成专属 Skill 持续更新);蒙牛一线员工自建 45 个 AI 数字员工,覆盖研发/供应链/销售;中国移动 MobileWork「数智员工」内部活跃超 9 万、沉淀 1400+ 技能。
- 供给侧放量:6 月以来腾讯/阿里/百度/字节/金山/360 密集推出 AI 办公产品;国内 17 款主流 AI 办公智能体月访问量 3 月 2000 万 → 6 月 6000 万。
- 协作流嵌入:Salesforce 9/1 发 Slack Code——在 Slack 专属频道里指派 Claude/Devin/Copilot 等编程智能体、跟踪进展、审批 PR;Winter'27 Agentforce 从任务辅助进端到端自主工作流,73.1% 企业决策者将 Agentic AI 列高优先级。
为什么值得关注
企业 agent 从「会问答」跨到「能交付、按结果计费」——HubSpot 按 $0.50/对话、Salesforce 按 $0.10/动作计费,正在取代 per-seat SaaS。这是「软件即工人」的商业化拐点,也是 Gartner「40% 企业 SaaS 含结果计费」预言的落地。
可核验数据点 · 上海证券报/新浪 9/3 · WorkBuddy@晶科 2天→15分·蒙牛 45 个 AI 数字员工·17 款 AI 办公智能体月访问 2000万→6000万(3→6月) · Salesforce Slack Code/Winter'27(9/1) · Agentforce 端到端·73.1% 企业决策者高优先级·$0.10/动作计费 | 冷静点:月访问量为国内样本、口径未明;按结果计费多为厂商定价非普遍落地;「数字员工」含营销表述
信号 04 / 终端智能 · 量产闭环
努比亚 NaviX Ultra(豆包手机二代)获工信部入网许可:全球首款量产 AI 智能体手机 9 月发售,端侧+云端协同跨应用多步自主执行
终端智能量产端侧闭环入口重构
事件
9/1 中兴终端总裁倪飞确认,努比亚 NaviX Ultra(豆包手机二代)正式获工信部入网许可,计划 9 月上市,定位全球首款量产 AI 智能体手机:
- 形态:字节豆包大模型 + 中兴硬件的「AI 厂商 + 硬件厂商」跨界量产模式;豆包手机助手深嵌系统底层,非 APP 套壳。
- 闭环:端侧 + 云端协同,构建「感知-规划-执行-反馈」完整闭环,可理解自然语言复杂需求、跨应用多步自主执行(跨应用比价、行程规划与预订、应用下载安装、信息整合),实测任务成功率 80%+。
- 市场:Counterpoint 估 2026 年全球生成式 AI 手机出货占比 45%、2027 破 52%;IDC 估中国新一代 AI 手机 1.47 亿台(+31.6%),终端侧普及带动消费电子产业链价值重估。
为什么值得关注
智能手机从「功能型 AI」(单点修图/翻译)进「智能体型 AI」(手机化身主动办事的智能体),入口从 APP 分发转向智能体调度。这是端侧执行闭环第一次以「量产旗舰」形态走到货架,而非概念机。
可核验数据点 · 中兴倪飞 9/1 确认/科技日报 9/3 · NaviX Ultra 入网·全球首款量产 AI 智能体手机·9月发售·跨应用多步执行成功率 80%+ · Counterpoint · 2026 生成式AI手机占比 45%·2027 破 52% · IDC · 中国新一代 AI 手机 1.47亿台(+31.6%) | 冷静点:80%+ 为技术预览实测、非长期大规模统计;量产规模/价格未定;跨 App 执行依赖系统授权与生态协同
信号 05 / 具身 · 定标 / 出海
人形机器人从赛场进工位:运动会天工 Ultra 400m 提速近 50 秒,国家标准体系 + 2500h 数据集 + 国际标准立项,上半年融资 935 亿、中国出货占全球 97%
具身智能定标出海量产
事件
新华社 9/2 报道,人形机器人从「展台」经「赛场」迈向「工位」,产业化进入关键转折:
- 能力进阶:第二届世界人形机器人运动会天工 Ultra 400m 大型组 38.15s 冲线,一年前该项冠军还是 1:28,一年提速近 50s;赛规规定全自主模式按原始分计、遥操作得分 ×0.5,倒逼去遥控真实能力。
- 标准定标:《国家人形机器人产业标准体系建设指南(2026版)(征求意见稿)》含基础共性/类脑与智算/肢体与部组件/整机与系统/应用/安全伦理 6 部分;闭幕式发布总时长超 2500h 的全量数据集,我国在 ISO 成功立项具身智能全球首项国际标准《人形机器人数据集》。
- 资本与占比:上半年国内具身智能融资 935 亿 同比 5 倍;IT 桔子称中国出货占全球 97%。但王兴兴再提醒:运动控制成熟≠具身智能成熟,「身体达标与大脑成熟之间隔整整一代技术」,ChatGPT 时刻=80% 陌生场景完成 80% 任务。
为什么值得关注
从「参赛」到「定标」——赛事规则 + 数据集 + 国际标准三位一体卡位生态话语权,把先发优势固化为标准优势。但「身体达标≠大脑成熟」的冷提示仍在:商业闭环、长程稳定性、端侧算力与能耗约束尚未完全逾越。
可核验数据点 · 新华社/中国经济信息社 9/2 · 天工 Ultra 400m 38.15s(一年前1:28)·全自主计分·遥操作×0.5 · 国家人形机器人产业标准体系指南(2026版) + 全量数据集 2500h + ISO《人形机器人数据集》立项 · IT桔子/中国电子学会 · 上半年融资 935亿同比5倍·中国出货占全球 97% · 王兴兴 · 身体达标≠大脑成熟·ChatGPT时刻=80%场景完成80%任务 | 冷静点:运动会为标准化赛项非真实工况;97% 含消费/教育类;商业闭环仍在形成、愿为通用大脑付费客户不多
逻辑链 · 诚实声明
- 主线连续性:NO.58「受托·上岗(演示 → 受托 → 上岗)」→ 本日 NO.59「可信·可控·可交付·端侧·定标(上岗底座)」。叙事从「agent 被委托、进产线/终端」再推进到「被委托之前先防住、能跑之后能算账」——稀缺资源从能力演示进一步下沉到五件让能力真正落地的底座。
- 交叉验证:01(Manifold Security / The Hacker News 9/1,含 CVE)、02(全天候科技/潮新闻 9/2 + GitHub Orca)、03(上海证券报/新浪 9/3 + Salesforce 9/1)、04(中兴倪飞 9/1 / 科技日报 9/3 + Counterpoint/IDC)、05(新华社/中国经济信息社 9/2 + 标准指南/ISO 立项)均为一级或权威转述,中高可信;03/04/05 含厂商与赛事口径。
- 与历史各期零重复:本期补的是 9/1–9/3 增量——GitSpawn 漏洞(新安全边界)、OpenAI 断供 Cursor + Qwen3.8-Max 登顶 + Orca(新生态结构)、WorkBuddy@晶科/Slack Code(新上岗证据)、NaviX Ultra 入网(新终端量产)、运动会提速 + 标准定标(新定标动作)。与 NO.58(Codex 持久/JetBrains/华为 828/MOG V1/运动会纪录)完全分开。
- 诚实边界:01 利用需仓库含 .git 文件到达、普通 clone 不触发;02 Cursor 断供窗口至 11/12、CodeArena 为前端专项榜;03 月访问量口径未明、按结果计费多为厂商定价;04 80%+ 为预览实测、量产规模未定;05 运动会为标准化赛项、97% 含消费/教育类。本报不构成投资建议。
本期一句话:自治体(Agent + 机器人)从「能不能演示」下沉到五件上岗底座——GitSpawn 逼出 coding agent 的「可信边界」(.git 钩子沙箱外执行、7 个 agent 裸奔)、OpenAI 断供 Cursor + Qwen3.8-Max 登顶 + Orca 把护城河推向「自有模型 + 多 Agent 工作台」、WorkBuddy@晶科与 Salesforce 把企业 agent 推进「按结果交付」、NaviX Ultra 入网让端侧执行闭环量产、运动会提速 + 标准定标把具身推向「出海与生态话语权」。
风险与未决GitSpawn 仍有多 agent 未修复、被委托的攻击面随自主时长同步放大;OpenAI 断供 Cursor 可能引发模型供应连锁重组、单模型押注风险上升;企业按结果计费多为厂商定价、真实 ROI 待验证;NaviX Ultra 量产规模与端侧性能未公开、跨 App 执行依赖系统授权;具身运动会为标准化赛项非真实工况、97% 全球占比含消费/教育类、商业闭环仍在形成。开源 / 标准化「能力摊开」是双刃——让开发者可查,也让使用者独担部署后的集成与风险。