模型更像 CPU——它决定推理上限,却不会自动长出文件系统、工具、权限、会话、沙箱与协作协议。今天的五条信号指向同一处:Harness、Skill、数据基建成了产品差异的主战场。但同一周内,两套新基准与两篇论文同时浇下冷水——插件好写,质量不可自动保证:91.8% 的 skill 存在缺陷,头部模型在长程生活任务基准上集体不及格。这一周真正发生的不是能力跃升,而是评价体系的重建。
DeepSeek 发布 DeepSeek Harness v0.1 开发者预览版,以 MIT 协议开源,底层以 vendor 方式引入 Cordis 元框架。核心宣言是 "Everything is a Plugin"——模型适配器、工具、技能、会话、沙箱、存储、Agent 循环乃至整个 Web 界面,全部作为独立插件由内核挂载、卸载与解析依赖。
npx @deepseek-ai/dsh web 或从源码运行,仓库已突破 93,000 stars。同步 GA 的 V4-Pro-0813 几乎全部围绕 agentic 负载。经 Harness minimal 模式测得:Terminal Bench 2.1 87.9、DeepSWE 62.7、Toolathlon-Verified 74.1、CyberGym 83.3、公开 AutomationBench 31.8。原生支持 OpenAI Responses API,可一键配置 Codex,模型名不变、既有集成不破。新 API 价目 8 月 16 日生效,闲时价较峰时低 50%。
Claude Code 与 Codex CLI 的走红从来不只是模型之胜。模型决定推理上限,但不会自动长出文件系统、工具、权限、会话、持久化、沙箱与协作协议——把这些组织成产品的正是模型外面的 Harness 层,那里才是产品差异的真正战场。
DeepSeek 把这一层直接开源,等于主动放弃 harness 侧的护城河。对自建 Agent 平台的团队是明确利好:可自托管、可审计、免供应商锁定;对靠 harness 收租的闭源产品则是直接压力。值得注意的是 append-only 会话日志的设计——它把「可重放」变成一等公民,这对任何需要审计留痕的企业内部部署都有直接借鉴价值。
Evo-Bench(arXiv:2608.09096)是首个评测「模型能否自主进化自己的 Harness」的基准,覆盖 Search / Office / General 三个 Agent 域。它用 harness-guided 构造框架——先靠辅助任务演化筛出真正对框架改进敏感的任务,再做敏感度分层切分——把 harness 提升与基座模型强度剥离开。9 个前沿与开源权重模型的评测结果:
同期 AI Agents Weekly 汇总的另一项研究,发现 91.8% 的 skill 存在缺陷。
这两条把「一切皆插件」的叙事拽回工程现实。插件与 skill 好写,但质量不能自动保证——九成以上带缺陷,意味着 skill 数量的增长可能是负债而非资产。
Evo-Bench 的 Office 失灵进一步划出边界:流程越是高度特定,越依赖人工工程,自动进化帮不上忙。对维护 skill 库的团队,直接结论是需要建立 skill 层的审校与回归测试机制,而不是无限堆数量。这与信号 01 构成一组张力——开源降低了造 harness 的门槛,却没有降低造好 harness 的门槛。
小红书 dots.studio 开源 dots3-note preview(Apache 2.0,BF16 与 FP8 两版)。280B 总参 / 16B 激活的 MoE 架构,512K 上下文,首次同时具备文本、视觉与语音理解能力。Terminal-Bench 2.1 得分 75.1,据 SemiAnalysis 图表较其中表现最好的美国开放权重模型高 4.9 分。
方法层提出 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization):把长轨迹切分为多个 macro-step,每个 macro-step 结束时同一个 Agent 从 actor 切换为 critic,通过 test-time scaling 推理估计剩余回报,从而在单次运行需数十小时的任务上做有效强化学习。ARC-AGI-3 上平均分较 baseline checkpoint 提升 31.5%、较 GRPO 提升 20.6%。同系列分支版本在 IMO 2026 取得官方认证 42/42 满分。
同时开源两套基准:
| 基准 | 规模 | 考什么 |
|---|---|---|
| VibeSearchBench | 20 领域 / 200 任务 | 用户没一次说清需求时,Agent 能否在多轮对话中问明白 |
| VibeLifeBench | 10 领域 / 20 任务,每任务 20–30 阶段,1247 项 atomic checks | 天气、价格、库存等外部条件异步变化后,Agent 还跟不跟得住 |
结果:Claude Opus 5、GPT-5.5 等头部模型均未达到设定及格水平。
两点信号价值高于榜单排名。其一,「评价比生成更简单」这一假设被实证支持——即使 Agent 尚解不出某问题,作为 critic 时仍能从两个表面相似的中间状态里识别出真正突破规律的那个。这意味着递归自我评价可能是缺乏可验证奖励场景的解法路径。
其二,新基准的集体不及格明确划出了当前 Agent 的真实边界:单点高难任务已足够强,但把这种能力稳定维持数小时以上,仍是力所不及处。对任何计划把 Agent 投入长周期真实业务流程的团队,这比参数对比更有决策价值——它告诉你风险出现在第几小时,而不是第几个 benchmark。
据 Wind 数据统计,截至 8 月 13 日,4 家端侧 AI 产业链上市公司披露 2026 年半年报或业绩快报,净利润均实现同比增长;另有 14 家披露半年报业绩预告,其中 12 家预喜。
星宸科技预计上半年归母净利润同比增长 583.72% 至 650.42%。公司表述:报告期内端边侧 AI 应用进入规模化落地爆发期,具身智能、服务机器人、家庭智能体、车载边缘计算、激光雷达等下游核心赛道需求集中放量。
产业链另一面是成本挤压:2026 年第二季度 LPDDR4/5 价格较 2025 年第四季度上涨约两倍,存储与散热模块单机价值量上移,成为 2026 年全球智能手机大盘下滑的核心诱因之一,并迫使低端机型退出市场。
终端智能的验证标尺已从「发布会参数」换成「利润表」,这是叙事阶段结束的标志。但同一产业链内出现明显分化——芯片端吃到红利,整机端被存储成本反噬。
三个未解问题仍在:消费者是否愿为 AI 付溢价(换机周期仍在 36 个月以上);端侧体验受 NPU 算力、内存带宽、系统调度与散热设计的硬约束;Agent 绕过 App 流量入口后,手机厂商、互联网平台与模型提供商之间的利益如何重新分配。
客观判断:端侧渗透方向的确定性高于纯云端赛道,但增长是非线性的——若 2026 下半年至 2027 上半年仍无「非换不可」的场景,高增长可能迅速回落至行业大盘的下行通道,届时靠概念撑起的估值将面临业绩考验。
| 路线 | 数据即持续资产 | 本能优先 / 零数据 |
|---|---|---|
| 公司 | 艾欧智能 IO-AI Tech | 橡木果机器人 Acorn Robot |
| 本轮 | 数亿元;顺为资本、松禾资本、深创投联合投资,并获头部机器人本体企业战略投资 | 天使轮;招商局创投、蔚来资本领投 |
| 技术主张 | 遥操作数据采集(Telexperience)、真实世界人类数据采集(Sensexperience,Ego/Wrist/UMI/Compute 四模块)、具身数据管理平台(EmbodiFlow),做采集→管理→训练→反馈闭环 | Natus AGE-0 具身本能模型:以触觉感知与接触力学为第一性原理,明确摒弃 VLA 数据预训练范式,主张零样本冷启动、毫秒级自适应、跨本体/物料/工况泛化 |
| 已验证 | 服务全球 150 余家本体企业与模型公司,累计适配 80 余款机器人;团队来自腾讯 Robotics X、小鹏、字节、亚马逊、百度 | 在某国际头部化妆品 ODM 产线跑通 POC,换型时间从约一周压缩至分钟级,已产生商业收入 |
时间锚点:2026 世界机器人大会 8 月 19 日在北京开幕。主论坛将发布《2026 人形机器人产业发展报告》、启动「全球机器人应用探索计划」、成立世界模型专家委员会;宇树科技王兴兴 8 月 20 日出席,展望人形机器人产业的下一个十年。
这是一次真正的路线分叉,而非同一路线上的快慢之争。「数据即持续资产」与「本能优先、零数据冷启动」在同一周各自拿到资本背书,说明具身智能的技术共识尚未收敛——这与大语言模型早已收敛到 Transformer + Scaling 的状态截然不同。共识未收敛的赛道,估值分歧会持续放大。
对观察者而言,可核验的判据是换型时间、冷启动耗时与跨本体泛化率,而不是演示视频。橡木果的分钟级换型若能在第二、第三家产线复现,才构成对数据驱动路线的实质挑战;反之,艾欧智能「适配 80 余款机器人」的横向覆盖,恰恰是数据路线难以被绕开的证据。两者都不必然错——更可能的结局是分层:本能层解决实时接触控制,数据层解决任务级泛化。