CALIBRATION LOG / NO.2026-0730-N5 · AI DAILY SIGNALS
21:50 GMT+8 · SHIFT 5 / 5

NIGHT
CALIBRATIONLab · 夜校准室

AI 领域每日动态 · 2026 年 7 月 30 日 夜班
方向 AI AGENT 方向 终端与端侧 方向 具身智能 信号数 05 去重 已避开当日前 4 班约 20 条
MEASURING RANGE — 今晚五条信号在「可信度刻度」上的落点
社区自述 媒体报道 厂商披露 官方/开源 同行评审 VERNIER · 本期主证据带 01 记忆账本 02 尺子失准 03 确定性架构 04 新评测轴 05 物理下限
Today's Main Line
今日主线 · 刻度之夜

白天讲的是边界、入口和围栏,夜里露出的是更根上的一件事:我们手里没有可信的刻度。今晚五条信号,四条在补刻度或绕开刻度——腾讯把 Agent 记忆做成带 ACL、版本与审计的资产账本;ITSMBench 给企业任务出了一把更难的新尺子,并顺带暴露「判官本身有多不准」;优艾智合干脆不信概率输出,把确定性蒸馏进模型结构;智元则把评测轴从静态图文挪到真实场景的声画同步。第五条把地基向下压到 8 美元的单片机与 2GB 内存里。

可信不是声明出来的,是被测量和结构约束出来的;量不准,就谈不上放手。

Thesis — trust is measured & structurally enforced, not declared.
Signals · 五条信号
01AI Agent
量具 厂商发布 + 开源可验证 / 不确定度 ± 低

记忆层第一次有了产权与账本

TencentDB Agent Memory 2.0.0 beta — open sourced

腾讯云 TencentDB Agent Memory 于 2026 年 7 月发布 2.0.0 beta 并首次公开开源,7 月 30 日出现体系化解读。它不做「更大的上下文窗口」,而是把团队记忆拆成四类可继承资产:Memory(对话异步提炼的长期画像)、LLM-Wiki(PRD/接口说明/运维手册/知识索引)、Code Graph(文件、符号、函数、调用链与影响范围)、Skill(团队 SOP、工具链、检查项封装为执行单元)。

工程核心是资产目录,为每份资产标注 identity / scope / trust / lifecycle / governance / usage——这是什么、属于哪个团队与仓库、来源证据是什么、谁能看谁能改、在哪些任务里被引用过。三个组件分工明确:Memory Core 作为事实源承载 ACL、版本、审计与绑定关系;Memory Hub(Panel + Knowledge)做管理面;Memory Proxy 站在 Agent 与资产之间,按 team/agent/task/role 做召回、上下文编排、权限过滤、token 预算控制与审计——不是把资产全塞进上下文,而是按任务相关性和预算做选择。Core / Hub / Proxy 及 TypeScript、Python SDK 均已开源,可一键拉起三件套。公开评测 PersonaMem 上,启用后总回答准确率由 48% → 76%(相对提升约 59%)。

Why it matters

过去一周的主线一直是「给 Agent 装护栏」,但护栏几乎都装在动作层(只读权限、pre-tool hook、沙箱)。这是第一次有人把同一套逻辑装进记忆层:谁写入、谁修改、何时引用、是否过期、能不能撤回,全部要有记录。它解决的是一个被长期低估的风险——Agent 引用过期经验、错误结论或越权信息时,动作层护栏完全看不见,因为动作本身合法。把记忆变成有产权、有生命周期、有预算的资产,等于给「上下文」补上会计制度。

Uncertainty一级信源(厂商公开发布 + 代码开源可自行验证)。PersonaMem 的 48%→76% 为厂商自测口径,尚待第三方独立复现;提升幅度高度依赖任务分布,不宜外推为「接入即涨 59%」。
02AI Agent · 评测
量具 二级汇总 + 6 月论文重提 / 不确定度 ± 中

新基准出炉,同时暴露「判官」本身的分层

ITSMBench & the judge-reliability problem

7 月 30 日流通的 ITSMBench 是一套面向企业 IT 服务管理场景的 Agent 基准,覆盖 93 种类型的工具,结果显示前沿模型在真实企业流程中的可靠性显著下滑;同时暴露文化偏置——受测 8 个模型中有 6 个的处置风格倾向「日本式」。同日社区还在讨论两件相关的事:有团队用约 $77.81 的自动评测替代原本约 $7,500 的人工评测;以及「Agent 循环烧评测集」的警告——反复在同一评测集上跑并保留高分,本质是在拟合噪声。

这些讨论引用的判官硬数据来自更早的两篇论文,需要如实标注时间:arXiv 2606.13685 测得成对判决平均 13.6% 翻转率、GPT-4o-mini 有显著首位偏好(72% 选 A,p=0.024)、跨判官一致率仅 76%(κ = 0.51),并指出需重复约 11 次投票才能以 95% 概率还原 50 次参考判决;但 arXiv 2606.19544 的大规模审计(21 个模型、约 54.1 万次判断)又显示头部判官 κ 可达 0.88–0.90

Why it matters

把两组数字放在一起,正确结论不是「LLM 判官全废」,而是判官质量严重分层,且便宜判官不足以做生产门禁。这恰好卡在 Agent 当下最要命的位置——从演示走向生产,唯一的通行证是「我们凭什么说它变好了」。今日 15:28 班那条 HANDBOOK.md 基准(最高仅 36.2% 遵守率)是「规则约束不住」,这条则是「结果衡量不准」:一个管输入,一个管输出,两头同时漏气。

UncertaintyITSMBench 与社区成本对比为二级汇总,未见完整论文与榜单原文,数字应视为方向性参考;两篇 arXiv 为一级来源但发表于 6 月,属今日被重新引用而非今日新发——此处不作「今日突破」包装。
03具身智能
量具 厂商发布会 / 不确定度 ± 中

工业界的答案:不修提示词,改架构

UBTRobot / 优艾智合 FabriX — determinism distilled into the model

7 月 30 日,优艾智合发布工业具身智能大模型「智合」(FabriX),自述为「全球首个可规模化应用的工业具身智能大模型」,同场发布工业原生人形机器人「隙锋」。技术路径与通用 VLA 明显分岔:采用边端侧双重架构,以工业真机数据训练的多模态 MoE 为基座,并把机理控制的确定性结果转化为先验引导知识注入模型。

核心手段包括确定性先验蒸馏约束锚定智能体先验引导层(把复杂数据蒸馏为确定性信息,为动作扩散指明方向)与双回路逻辑校验层(对输出做全流程确定性约束与核验,支撑自主诊断与故障恢复)。联合创始人兼 CTO 边旭的表述很直白:要解决通用具身大模型概率性输出难以适配工业场景的问题。同步启动生态伙伴计划,目标三年赋能 10,000 个工业现场。

Why it matters

这是今天下午那条判断的正面回应。15:28 班的结论是「写下来的规则不是控制」——散文式治理文档管不住模型;工业界给出的方案不是把文档写得更长,而是把确定性做进架构:先验层限定动作方向、双回路层核验输出、机理控制提供不可协商的物理约束。工业场景不接受「大概率对」,于是它用结构把概率分布的尾部裁掉。这也解释了为什么工业现场反而是具身最先跑通商业闭环的地方——约束越硬的场景,越容易用工程手段兑现可靠性

Uncertainty「全球首个可规模化」为企业自述,缺乏第三方口径;「三年 10,000 个工业现场」是目标而非已交付量,不应计入产能。技术描述来自官方通稿,尚无独立复现或第三方产线实测数据。
04具身智能 · 评测
量具 企业口径 + 自媒体解读 / 不确定度 ± 中偏高

换一把更接近物理世界的尺子

AgiBot WITA-OmniPreview tops DailyOmni at 85.21

7 月 30 日消息,智元自研具身原生全模态大模型 WITA-OmniPreview 在全球具身全模态理解榜单 DailyOmni 上以 85.21 分取得综合第一,八项细分评测中六项居首,成绩位于千问、Gemini、豆包、NVIDIA 等通用大模型之上。

DailyOmni 的取材方式是关键:全程使用商场、展厅、居家等开放空间的原生音视频素材,环境中存在多人交谈杂音、背景响动与连续发生的琐事,考察三项能力——把说话人与画面声源精准匹配、理清事件的先后时序、结合画面与声音做综合推理

Why it matters

绝大多数多模态评测停留在静态图文问答或剪辑短片解读,适配的是「人在手机上刷内容」的场景。DailyOmni 换的是坐标系——机器人站在嘈杂展厅里,第一道坎不是识别物体,而是分清谁在叫它。榜单前列几乎都是互联网大厂的通用全模态模型,唯一的纯具身玩家反而登顶,说明真实物理环境的声画同步理解是一条通用模型没有专门优化过的独立能力轴。它也标注了具身的重心迁移:过去一年在拼「动得了」,接下来要拼「听懂现场」。

Uncertainty来源为企业侧口径与自媒体解读,未见官方技术报告或 DailyOmni 榜单页面直连;DailyOmni 的行业认可度弱于 OSWorld、SWE-bench 等成熟基准,单一榜单第一不宜外推为「全模态能力全面领先」。结合信号 02——榜单本身也是一把待校准的尺子。
05终端与端侧
量具 社区自述 / 个人项目 / 不确定度 ± 高

把可用智能压进 8 美元和 2GB

The floor keeps dropping — MCU-class inference & local wake word

7 月 30 日社区侧出现一组同向信号。其一,有人把约 2,890 万参数的 LLM 跑在 ESP32-S3 上——约 8 美元的单片机、完全离线、功耗接近一颗 LED,活跃工作集约 450 字节/token;同日另有在 ESP-32 上做本地 AI 运动追踪的项目。其二,TurboFieldfare 是 Swift + Metal 编写的 M 系 Mac 推理引擎,宣称约 2GB 内存即可跑 Gemma 4 26B-A4B-IT。其三,Hermes Agent 新增本地语音唤醒:唤醒检测完全在本地运行、默认关闭,支持 openWakeWord / sherpa / Porcupine 多引擎。作为反向坐标,同日有 NVIDIA RTX GPU 最高涨价 30% 的报道。

Why it matters

这组信号的意义不在性能,而在下限。一边是数据中心侧的成本与硬件价格继续上抬,一边是「可用智能」的物理门槛被压到 8 美元的芯片和 2GB 的内存里。对具身与终端 Agent 而言这是现实底盘问题——真正要装进机器人关节、传感器节点与随身设备的,从来不是最强模型,而是在功耗、成本、离线三重约束下仍能工作的那一档。Hermes 的本地唤醒补的是入口侧:唤醒词不上云,意味着「常驻监听」第一次可以在隐私上说得通。端侧竞争的本质不是跑分,而是主权与下限

Uncertainty三项均为个人项目或社区自述,参数规模、内存占用与实际可用性(生成质量、上下文长度、持续吞吐)均未经独立复现。「2GB 跑 26B」一类表述通常隐含激进量化与 MoE 稀疏激活前提,不能等同于常规部署体验。GPU 涨价为媒体报道。
Cross-reading · 横向观察
  1. 护栏正在从动作层向记忆层与架构层扩散。只读权限和沙箱管得住「这一步能不能做」,管不住「它凭什么这么想」——腾讯给记忆加账本、优艾智合把确定性蒸馏进模型,走的是同一方向的两条路。
  2. 尺子问题第一次比模型问题更紧迫。HANDBOOK.md 基准最高 36.2%、ITSMBench 企业场景可靠性骤降、判官 κ 从 0.51 到 0.90 分层严重——在这种情况下,任何「能力又提升了」的说法都需要先问一句:用什么量的。
  3. 两端同时下沉。具身往工业现场沉(约束硬、可交付),算力往 8 美元芯片沉(成本硬、可自持)。Agent 的下一段增长可能不在中间层的通用能力,而在这两个被约束逼出来的边缘。
Continuity · 与近期主线的衔接
07 / 24可信化 —— 国标身份、支付信任、企业护栏
07 / 27自主 vs 可控 —— 失控事件 ↔ 更强自治
07 / 29可控的自治 —— 治理联名、编排层 hooks、本地化回落
07 / 30早班 边界划定 → 午班 入口收拢·账本亮相 → 午后 围栏而非文本规则 → 傍晚 主体交接的底座工程
今夜刻度之夜 —— 护栏与底座都在建,但衡量它们是否有效的尺子仍未校准;今晚的补丁分别落在记忆账本、企业基准、模型结构与物理下限上。