8 月 14 日起,Anthropic 对新开 Claude Code 会话(Pro/Max/Team)默认启用 auto mode:权限由安全分类器判定是否需人工确认,分类器开销 token 不再计费;Enterprise/Bedrock/Vertex/Foundry 仍 opt-in(承诺一个月内跟进)。配套公布一项人因实验:1053 名付费测试者中 86.4% 批准了被暗中替换的危险命令,auto mode 拦截 89%;人类识别率随疲劳从约 17% 跌到约 5%,auto mode 始终稳定;第三方 Trajectory Labs 72 个间接提示注入场景零成功对抗 auto mode。Anthropic 称 auto mode 用户多交付约 25% PR。
最主流的编码智能体把默认安全模型从「人审批」切到「分类器」,且用一份可复现的数据集论证「这比现状更安全」。这把「高自主 vs 可控」从理念之争变成可量化的工程选择题——每个厂商都必须用同样的数据集为自己的权限 UX 辩护;但也需冷静:分类器无法防御执行不可信来源代码的系统,沙箱仍是底线。本栏目长期主线的「可信的自治」,今天被钉上了一颗最硬的钉子。
8 月 14 日前后,智谱发布 GLM-5.3,在 CyberGym 智能体安全评测上超过 OpenAI、Anthropic 的闭源对手;此前一天 DeepSeek 开源 Harness v0.1(MIT,24 小时内 GitHub 星标破 2.4 万)并 GA 其 V4 Pro。两家开放权重实验室在约 24 小时窗口内密集放出 coding agent 能力,直接对标 Claude Code / Codex 的执行层。
中国开放权重实验室正与西方前沿实验室在 agentic coding 基准上正面对抗,且价格仅为零头。当「模型」降格为可插拔配件、执行层(harness)开源,开发者入口之争从「谁的模型强」转向「谁的运行时可自托管、可替换、可被审计」——这正是本栏目反复判断的「能力不再稀缺,入口与可信才稀缺」的又一注脚。
据多家科技媒体 8 月 14 日报道,AI 编程助手 Cursor 已被 SpaceX 收购,意图以 SpaceX 的 GPU 资源训练自有模型。此前一周编码智能体赛道并购与整合明显升温(Adobe Workfront AI Collaborators GA、AWS Bedrock AgentCore 推浏览器工具自动化遗留系统、Cloudflare 发布面向 agent 的 Kitesurf 浏览器)。
编码智能体从「独立 SaaS 工具」进入大厂垂直整合——模型、算力、产品被同一主体收编,可能加速能力跃迁,但也给采购方带来供应商集中度与「模型训练用不用我的代码」的合规新问题;Cursor 用户需重新评估供应商锁定与数据边界。
8 月 15 日,中国经营报等深度拆解宇树科技资本棋局:发行市值 609.93 亿元、市盈率 219 倍,拟募资 42.02 亿元(近半投向智能机器人模型研发);2025 年人形机器人出货超 5500 台、全球市占率 32.4% 居首,但商业化高度集中于科研教育(73.6%)。同日央视报道,2026 年上半年国内具身智能赛道融资总额突破 935 亿元、同比增 5 倍;工信部、国资委要求年底形成百个高价值场景、万台级规模落地能力。
行业从「炫技」转向「实干」,资本为人形第一股定下锚点;但需清醒区分两件事——「上市拿的估值」与「能上岗赚的钱」。宇树自身数据已暴露真问题:出货量全球第一,商业化却集中在科研教育、AI「大脑」短板待补。估值锚定的是预期,单位经济与真实场景泛化才是交付纪元的硬通货。
8 月 14 日,法奥发布 ART 系列工业级人形力控臂,ART7 单臂含税 2.38 万元起,依托协作机器人万台级制造体系把谐波减速机 SKU 收敛至 10 款,打破具身硬件高价桎梏;同日原力无限完成近 10 亿元 A 轮及 A+ 轮融资打造 AtomBrain 具身大脑,亮源新创、恒璇科技分获数亿 / 数千万元布局旋转关节与执行器。
具身智能的瓶颈正被两端同时撬动——硬件侧把「用得起」做成现实(万元级力控臂让中小企业也能部署),大脑侧资本集中下注「世界模型 / 具身大脑」。当硬件成本下探与大脑投入同步发生,行业竞争焦点进一步从「能不能动」收敛到「能不能在真实场景稳定、便宜地干活」。