Leion · NO.44 2026-08-16  09:50  GMT+8

模型之外那一层

Signals5 条 / 零重复
主战场Harness · Skill · 数据
冷水skill 缺陷率 91.8%
时间锚世界机器人大会 8/19
本期主线
竞争重心从「模型有多大」,挪到「模型之外那一层」

模型更像 CPU——它决定推理上限,却不会自动长出文件系统、工具、权限、会话、沙箱与协作协议。今天的五条信号指向同一处:Harness、Skill、数据基建成了产品差异的主战场。但同一周内,两套新基准与两篇论文同时浇下冷水——插件好写,质量不可自动保证:91.8% 的 skill 存在缺陷,头部模型在长程生活任务基准上集体不及格。这一周真正发生的不是能力跃升,而是评价体系的重建

图 01 — 装配层剖面  |  五条信号在栈中的位置与今日受力方向
STACK CROSS-SECTION / 2026-08-16 LAYER 4 · 落地层 终端智能 · 具身智能 · 产线与利润表 信号 04 端侧进入财报验证 · 信号 05 具身路线未收敛 LAYER 3 · 评测层 从「单点难度」转向「长程稳定性」 信号 03 VibeLifeBench 1247 项 atomic checks · 头部模型不及格 LAYER 2 · HARNESS 层 — 今日主战场 Everything is a Plugin 模型适配器 工具 / 沙箱 技能 SKILL 会话日志 append-only Agent 循环 存储 / 调度 Web UI 四种运行模式 信号 01 DSH v0.1 · MIT · 93k★ LAYER 1 · 模型层(= CPU,不再是差异来源) V4-Pro-0813 · dots3-note 280B/16B · 开源权重持续下沉 Terminal Bench 2.1:V4-Pro 87.9  |  dots3-note 75.1(领先美系开放权重 4.9) 信号 02 · 91.8% 缺陷率 开源下沉 →
读法:模型层(CPU)已非差异来源,竞争上移到 Harness 层;评测层今日把考题从「单点难度」改为「长程稳定性」;落地层的验证标尺换成利润表与产线换型时间。红色虚箭头是本期唯一的反向作用力——skill 质量问题正从评测层反噬装配层。
SIGNALS 五条信号 · 逐条解读
信号 01  /  AI CODING · AGENT 基础设施

DeepSeek 开源 Harness,把「模型之外那一层」摆上桌面

MIT 协议93,000+ starsTerminal Bench 87.98/16 新价目生效

事件

DeepSeek 发布 DeepSeek Harness v0.1 开发者预览版,以 MIT 协议开源,底层以 vendor 方式引入 Cordis 元框架。核心宣言是 "Everything is a Plugin"——模型适配器、工具、技能、会话、沙箱、存储、Agent 循环乃至整个 Web 界面,全部作为独立插件由内核挂载、卸载与解析依赖。

  • append-only 会话日志:模型看到的一切都被记录,会话可恢复、分叉、检索、重放,而非从聊天历史重建。
  • 四种运行模式:Standard(全工具集)、Code(用 TypeScript 编排操作)、Minimal(为跑基准精简)、Creator(构建自定义预设)。
  • 安装路径npx @deepseek-ai/dsh web 或从源码运行,仓库已突破 93,000 stars。

同步 GA 的 V4-Pro-0813 几乎全部围绕 agentic 负载。经 Harness minimal 模式测得:Terminal Bench 2.1 87.9、DeepSWE 62.7、Toolathlon-Verified 74.1、CyberGym 83.3、公开 AutomationBench 31.8。原生支持 OpenAI Responses API,可一键配置 Codex,模型名不变、既有集成不破。新 API 价目 8 月 16 日生效,闲时价较峰时低 50%。

为什么值得关注

Claude Code 与 Codex CLI 的走红从来不只是模型之胜。模型决定推理上限,但不会自动长出文件系统、工具、权限、会话、持久化、沙箱与协作协议——把这些组织成产品的正是模型外面的 Harness 层,那里才是产品差异的真正战场。

DeepSeek 把这一层直接开源,等于主动放弃 harness 侧的护城河。对自建 Agent 平台的团队是明确利好:可自托管、可审计、免供应商锁定;对靠 harness 收租的闭源产品则是直接压力。值得注意的是 append-only 会话日志的设计——它把「可重放」变成一等公民,这对任何需要审计留痕的企业内部部署都有直接借鉴价值。

可核验数据点  ·  MIT 协议  |  93,000+ stars  |  Terminal Bench 2.1 = 87.9  |  DeepSWE 62.7  |  峰谷价差 50%(8/16 生效)
信号 02  /  AI AGENT · 工程质量

两项研究给「一切皆插件」浇冷水:91.8% 的 skill 存在缺陷

arXiv:2608.090969 个模型受测Office 域失灵缺陷率 91.8%

事件

Evo-Bench(arXiv:2608.09096)是首个评测「模型能否自主进化自己的 Harness」的基准,覆盖 Search / Office / General 三个 Agent 域。它用 harness-guided 构造框架——先靠辅助任务演化筛出真正对框架改进敏感的任务,再做敏感度分层切分——把 harness 提升与基座模型强度剥离开。9 个前沿与开源权重模型的评测结果:

  • 顶级模型自主进化的绝对增益最高达 16.6 分,已逼近人工工程基线(Artificial Harness 总分 47.5,自主进化最优约 41.4)。
  • 自主进化在 General 与 Search 域超过人工 harness,但在需要高度特定处理流程的 Office 域失灵
  • 暴露「早饱和」等时间异常;合成出的 harness 具备高可迁移性,能稳定提升不同策略模型。

同期 AI Agents Weekly 汇总的另一项研究,发现 91.8% 的 skill 存在缺陷

为什么值得关注

这两条把「一切皆插件」的叙事拽回工程现实。插件与 skill 好写,但质量不能自动保证——九成以上带缺陷,意味着 skill 数量的增长可能是负债而非资产

Evo-Bench 的 Office 失灵进一步划出边界:流程越是高度特定,越依赖人工工程,自动进化帮不上忙。对维护 skill 库的团队,直接结论是需要建立 skill 层的审校与回归测试机制,而不是无限堆数量。这与信号 01 构成一组张力——开源降低了造 harness 的门槛,却没有降低造 harness 的门槛。

可核验数据点  ·  arXiv:2608.09096  |  9 个模型  |  最高绝对增益 16.6 分  |  人工基线 47.5 vs 自主最优 41.4  |  skill 缺陷率 91.8%
信号 03  /  AI AGENT · 长程能力与评测

小红书开源 dots3-note,并放出让头部模型集体不及格的长程基准

280B / 16B 激活512K 上下文Terminal-Bench 75.1Apache 2.0

事件

小红书 dots.studio 开源 dots3-note preview(Apache 2.0,BF16 与 FP8 两版)。280B 总参 / 16B 激活的 MoE 架构,512K 上下文,首次同时具备文本、视觉与语音理解能力。Terminal-Bench 2.1 得分 75.1,据 SemiAnalysis 图表较其中表现最好的美国开放权重模型高 4.9 分。

方法层提出 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization):把长轨迹切分为多个 macro-step,每个 macro-step 结束时同一个 Agent 从 actor 切换为 critic,通过 test-time scaling 推理估计剩余回报,从而在单次运行需数十小时的任务上做有效强化学习。ARC-AGI-3 上平均分较 baseline checkpoint 提升 31.5%、较 GRPO 提升 20.6%。同系列分支版本在 IMO 2026 取得官方认证 42/42 满分。

同时开源两套基准:

基准规模考什么
VibeSearchBench20 领域 / 200 任务用户没一次说清需求时,Agent 能否在多轮对话中问明白
VibeLifeBench10 领域 / 20 任务,每任务 20–30 阶段,1247 项 atomic checks天气、价格、库存等外部条件异步变化后,Agent 还跟不跟得住

结果:Claude Opus 5、GPT-5.5 等头部模型均未达到设定及格水平

为什么值得关注

两点信号价值高于榜单排名。其一,「评价比生成更简单」这一假设被实证支持——即使 Agent 尚解不出某问题,作为 critic 时仍能从两个表面相似的中间状态里识别出真正突破规律的那个。这意味着递归自我评价可能是缺乏可验证奖励场景的解法路径。

其二,新基准的集体不及格明确划出了当前 Agent 的真实边界:单点高难任务已足够强,但把这种能力稳定维持数小时以上,仍是力所不及处。对任何计划把 Agent 投入长周期真实业务流程的团队,这比参数对比更有决策价值——它告诉你风险出现在第几小时,而不是第几个 benchmark。

可核验数据点  ·  280B/16B 激活  |  512K 上下文  |  Terminal-Bench 2.1 = 75.1(领先 4.9) |  TEMPO 较 baseline +31.5%  |  VibeLifeBench 1247 项 atomic checks
信号 04  /  终端智能 · 商业验证

终端智能从叙事进入财报:星宸科技预计净利同比 +583%~650%

14 家预告 / 12 家预喜星宸 +583.72%~650.42%LPDDR 涨约 2 倍

事件

据 Wind 数据统计,截至 8 月 13 日,4 家端侧 AI 产业链上市公司披露 2026 年半年报或业绩快报,净利润均实现同比增长;另有 14 家披露半年报业绩预告,其中 12 家预喜

星宸科技预计上半年归母净利润同比增长 583.72% 至 650.42%。公司表述:报告期内端边侧 AI 应用进入规模化落地爆发期,具身智能、服务机器人、家庭智能体、车载边缘计算、激光雷达等下游核心赛道需求集中放量。

产业链另一面是成本挤压:2026 年第二季度 LPDDR4/5 价格较 2025 年第四季度上涨约两倍,存储与散热模块单机价值量上移,成为 2026 年全球智能手机大盘下滑的核心诱因之一,并迫使低端机型退出市场。

为什么值得关注

终端智能的验证标尺已从「发布会参数」换成「利润表」,这是叙事阶段结束的标志。但同一产业链内出现明显分化——芯片端吃到红利,整机端被存储成本反噬。

三个未解问题仍在:消费者是否愿为 AI 付溢价(换机周期仍在 36 个月以上);端侧体验受 NPU 算力、内存带宽、系统调度与散热设计的硬约束;Agent 绕过 App 流量入口后,手机厂商、互联网平台与模型提供商之间的利益如何重新分配。

客观判断:端侧渗透方向的确定性高于纯云端赛道,但增长是非线性的——若 2026 下半年至 2027 上半年仍无「非换不可」的场景,高增长可能迅速回落至行业大盘的下行通道,届时靠概念撑起的估值将面临业绩考验。

可核验数据点  ·  4 家已披露净利均增  |  14 家预告中 12 家预喜  |  星宸 +583.72%~650.42%  |  LPDDR4/5 涨约 2 倍  |  换机周期 >36 个月
信号 05  /  具身智能 · 路线分叉

具身智能:两条相反的技术路线,在同一周各自拿到钱

艾欧智能数亿元橡木果零数据路线世界机器人大会 8/19

事件
路线数据即持续资产本能优先 / 零数据
公司 艾欧智能 IO-AI Tech 橡木果机器人 Acorn Robot
本轮 数亿元;顺为资本、松禾资本、深创投联合投资,并获头部机器人本体企业战略投资 天使轮;招商局创投、蔚来资本领投
技术主张 遥操作数据采集(Telexperience)、真实世界人类数据采集(Sensexperience,Ego/Wrist/UMI/Compute 四模块)、具身数据管理平台(EmbodiFlow),做采集→管理→训练→反馈闭环 Natus AGE-0 具身本能模型:以触觉感知与接触力学为第一性原理,明确摒弃 VLA 数据预训练范式,主张零样本冷启动、毫秒级自适应、跨本体/物料/工况泛化
已验证 服务全球 150 余家本体企业与模型公司,累计适配 80 余款机器人;团队来自腾讯 Robotics X、小鹏、字节、亚马逊、百度 在某国际头部化妆品 ODM 产线跑通 POC,换型时间从约一周压缩至分钟级,已产生商业收入

时间锚点:2026 世界机器人大会 8 月 19 日在北京开幕。主论坛将发布《2026 人形机器人产业发展报告》、启动「全球机器人应用探索计划」、成立世界模型专家委员会;宇树科技王兴兴 8 月 20 日出席,展望人形机器人产业的下一个十年。

为什么值得关注

这是一次真正的路线分叉,而非同一路线上的快慢之争。「数据即持续资产」与「本能优先、零数据冷启动」在同一周各自拿到资本背书,说明具身智能的技术共识尚未收敛——这与大语言模型早已收敛到 Transformer + Scaling 的状态截然不同。共识未收敛的赛道,估值分歧会持续放大。

对观察者而言,可核验的判据是换型时间、冷启动耗时与跨本体泛化率,而不是演示视频。橡木果的分钟级换型若能在第二、第三家产线复现,才构成对数据驱动路线的实质挑战;反之,艾欧智能「适配 80 余款机器人」的横向覆盖,恰恰是数据路线难以被绕开的证据。两者都不必然错——更可能的结局是分层:本能层解决实时接触控制,数据层解决任务级泛化。

可核验数据点  ·  艾欧智能 数亿元  |  服务 150+ 客户 / 适配 80+ 款机器人  |  橡木果换型 ~1 周 → 分钟级  |  世界机器人大会 8/19 开幕

交叉观察 · 三层同时发出信号,方向一致

  1. Harness 层(信号 01 / 02):从闭源护城河变为开源公共品,但质量验证机制缺位——91.8% 的 skill 带缺陷,自动进化在高度特定流程域失灵。
  2. 评测层(信号 03):新基准把「长程稳定性」而非「单点难度」立为考题,头部模型集体不及格,能力边界被清晰标出。
  3. 落地层(信号 04 / 05):终端侧进入利润表验证阶段,具身侧技术路线仍未收敛。
一句话判断:这一周的共同主题不是能力跃升,而是评价体系的重建。当参数榜单失效、Harness 开源、skill 质量存疑,唯一可靠的判据回到可核验的工程指标——换型时间、atomic checks 通过率、利润表。谁先建立这套内部度量,谁就先脱离「看发布会做决策」的阶段。
风险与反证 本期多条数据来自公司自述或单一媒体转述,需注意:星宸业绩为预告而非终报;橡木果 POC 的换型时间与良率数据来自公司披露,未见第三方复现;「91.8% skill 缺陷率」的样本范围与缺陷判定标准需查原文核实。Evo-Bench 的「逼近人工基线」结论限于其自身三域样本与九个受测模型,跨域外推需谨慎;其 Office 域失灵也可能源于任务构造偏差而非能力本质缺陷。