AI 领域每日动态

FOCUS — AI Agent · 终端与端侧 · 具身智能

横向观察 · 今日主线

三条 Agent 线(垂直落地→可信、能力评估→长程瓶颈、独立审计→可验证护栏)与终端线(Claude Code 默认暂停 / 成本预算)共同收束为一个词:「可控的自治」。这延续 7/24「Agent 可信实体化」、7/27「自主 vs 可控」的判断,并补上工程与产品侧的具象落点。具身侧今日是「本体热 + 大脑 / 数据补地基」双线并行——上午资本压在量产本体(已锁),下午德塔融资把焦点拉回「三维原生世界模型 + 全身数据闭环」。

01
AI Agent · 垂直落地

公共服务智能体迈入「数字员工」时代

事件

久远银海 AI 首席技术官吴钒 7/29 14:13 表示,公共服务智能体正从「智能问答」走向「边聊边办」。就医智能体「杏捷」覆盖挂 / 缴 / 查 / 问 / 办全流程;公积金客服「善小金」高频业务做到零材料秒批秒到账。规则明确、低风险场景率先规模化,隐私 / 责任重大场景仍谨慎推进。

为什么值得关注

这是 Agent 从「能对话」到「能办事」在强监管公共领域的真实样本,把可信、可追溯、可审计变成采购前提,呼应 7/24「Agent 可信实体化」主线。吴钒也诚实点出边界:高风险场景不能「为智能而智能」——规模化的真正门槛往往是责任界定与授权框架,而非模型能力。

来源 · 新浪科技(久远银海访谈)2026-07-29 14:13 | 可信度:中–高

02
AI Agent · 能力评估

MazeBench 发布:长程规划 3D 基准,SOTA 成功率 < 1%

事件

MazeBench 发布评测长程规划与视觉空间推理的 3D 开放世界基准——Agent 需穿越 200+ 房间、解推箱子谜题、找到 100 颗隐藏宝石;当前最优模型在图像 / ASCII / JSON 各类输入下成功率均不超过 1%

为什么值得关注

给「长程 Agent 到底行不行」一个硬指标。多数演示停留在几十步,而真实工作流远超此跨度(如 Kimi K3 生成网站要 120+ 轮递归、2800+ 次搜索)。SOTA < 1% 揭示:长程规划与世界模型理解仍是 Agent 从 Demo 走向 Production 的底层瓶颈——与具身「世界模型 = 物理直觉破局」同构。

来源 · AGI HUNT 每日资讯 2026-07-29 | 可信度:中(社区基准)

03
AI Agent · 安全 / 可审计

部署型 Agent 独立审计工具登场

事件

iFixAi 推出面向已部署 Agent 的独立审计工具:120 秒跑 45 项检查、覆盖 16 类,对幻觉 / 操纵 / 欺骗 / 不可预测性 / 透明度五维打分(A–F),并可识别 sandbagging(刻意降低表现)。Greptile 发布免费安全 Agent,将静态分析 + SCA + AI 融合,在代码合并前发现漏洞,默认对所有用户开启。

为什么值得关注

这是 7/24「OpenAI 企业护栏」、7/29 上午「1100+ 员工控速联名」「Modal Labs 失控」的延伸——当护栏从「厂商自觉」变成可独立验证的第三方产品,Agent 才真正具备被监管、被采购的资格。Greptile 直言:编程 Agent 普及已抬升安全事故频率,安全须前置到合并前而非事后。

来源 · AGI HUNT 每日资讯 2026-07-29 | 可信度:中–高

04
终端 · CLI

Claude Code 七月大版本:技能堆叠 + 决策点默认暂停 + 成本预算

事件

7 月更新(至 v2.1.211):v2.1.199 支持单次调用堆叠最多 5 个 slash-skill(技能从宏变为可组合管线);v2.1.200 让决策对话框默认不再自动续跑——无人值守时在真实分叉点停下等待;新增内置沙箱浏览器、per-agent 成本预算 + checkpoint(可暂停 / 回滚)、3 级嵌套子 Agent。

为什么值得关注

把「自主 vs 可控」从哲学争论变成编排层的具体默认值。决策点暂停 = 无人值守安全;成本预算 = 长任务可控;技能堆叠 = 从写提示词走向搭管道。与 7/27「砍 80% 系统提示词反而更强」、7/29 09:08「Google hooks 把护栏写进沙箱」一脉相承:护城河从模型能力移向「编排 + 成本 + 可控」。

来源 · Claude Code 7 月更新梳理(至 v2.1.211)| 可信度:中–高

05
具身智能

德塔智能近 5 亿元融资:原生三维世界引擎 + 全身数采设备

事件

人形机器人基础模型公司德塔智能(Delta Intelligence)完成近 5 亿元新融资(成立半年累计六轮)。技术底座:原生三维世界引擎(直接处理点云 / 高斯泼溅,而非单目二维);「大脑 + 小脑 + 力位混合」三层架构;头戴式全身全景数采设备 Delta D1(2cm 精度,无需动捕棚 / 本体,跨本体重定向复用);已联合信通院发布工业数据集 2.0。

为什么值得关注

补全具身「大脑派」的关键地基——不是又一台本体,而是三维原生世界理解 + 全身协同数据闭环。多数具身模型仍建立在二维视觉表征(单目缺深度),德塔押注三维原生 + 低成本全身数采,直指「真实数据难支撑规模化训练」瓶颈。在车企 / 资本密集涌入本体的热潮外,这条「补大脑与数据」的路线更值得长期跟踪。

来源 · 环球网 / 财经涂鸦 2026-07-29(14:44 / 10:13)| 可信度:中–高