LEION · DAILY AI 2026-09-24 · 第 77 期

Claude Opus 5.5 强化大规模代码库能力,具身智能数据路线与端侧模型同期披露

本期收录 Anthropic 新旗舰模型的性能与定价变化、人形机器人在陌生家庭中的预训练实验对比、特斯拉供应链订单与机构出货预期调整、阿里 Agent 服务平台,以及端侧全模态模型在座舱的落地进展。

NO.01 · 大模型 / AI coding

Anthropic 发布 Claude Opus 5.5,缓存读取价下调六成

AI coding 大模型 Agent
事件简述

9 月 23 日,Anthropic 发布旗舰模型 Claude Opus 5.5。在面向命令行复杂任务的 Terminal-Bench 4.0 上得分 66.4%,上一代 Opus 5 为 52.3%,OpenAI 的 GPT-6 Astra 为 57.9%。输入、输出价格分别降至每百万 Token 4 美元和 20 美元,较 Opus 5 下降 20%;缓存读取价从 0.50 美元降至 0.20 美元,降幅 60%。官方称同一任务所需步骤与 Token 更少,典型任务总成本可下降约 40%。

据官方披露的早期测试:一名测试者用它迁移 68 万行代码,用时不到一天;另一名测试者审计并修复一个 20 万行代码库,耗时不到 3 小时,而 Opus 5 完成同样任务用了超过 20 小时、Token 数量是其 2.5 倍。Pro、Max、Team 与企业版五小时使用限额同步提高,Sonnet 5.5 与 Haiku 5.5 将在未来几周推出。

关注理由

缓存读取价降六成,比 API 单价下调更直接地影响编程 Agent 的账本——长对话与大型代码库任务中,反复读取上下文占据成本的大头。Terminal-Bench 这类面向真实命令行操作的评测被单独拿出来横向比较,说明竞争重点已从能否生成代码,转向能否在真实环境里连续完成多步操作。

来源

量子位 https://www.qbitai.com/2026/09/496221.html

NO.02 · 具身智能 / 数据路线

Figure 公布人类行为预训练实验,陌生家庭完整任务成功率由 9% 升至 56%

具身智能 VLA 数据
事件简述

9 月 17 日,Figure 让 Helix 2.5 进入旧金山湾区 30 个陌生家庭执行整理客厅、叠毛巾、铺床任务,机器人到场后不采集新数据、不更新权重。官方公布的第一组实验中,随机初始化的策略在完整任务上的成功率为 9%,经 Index 人类行为预训练的同类策略达到 56%(部分完成不计分)。第二组实验用四档嵌套数据将预训练规模扩大 8 倍,模型规模与下游训练保持一致,动作预测损失随数据翻倍持续下降。

Index 通过创作者网络在真实家庭与工作场所采集视频,到 8 月底累计收到超过 1600 万条视频、向创作者支付 1500 万美元;9 月初 Figure 与英国 AI 云厂商 Nscale 达成初始价值 35 亿美元的算力合作。量子位 9 月 23 日的分析同时梳理了另外两条路线:Dyna Robotics 用四档人类第一视角视频预训练,在 14 个真实任务上的平均归一化得分依次为 20%、28%、45%、53%;亮源新创 9 月 21 日发布技术博客,称人类动作预训练规模从 37.5 亿扩展至 1200 亿 Token后,多本体动作预测误差呈幂律下降。

关注理由

这组对比把「具身智能的数据从哪来」变成可测量的工程问题:专门采集能主动调整数据分布,从互联网第三视角视频中提取可迁移信号则省下物理采集成本,代价转移到表示、对齐与算力上。需要留意的是,目前公开证据多停在离线迁移指标,从预训练规模到真实闭环成功率的连续曲线尚未披露,两条路线的数据经济性还无法直接换算。

来源

量子位 https://www.qbitai.com/2026/09/496129.html

NO.03 · 具身智能 / 量产

特斯拉向供应链下达约 5000 台 Optimus 订单,机构上调人形机器人出货预期

具身智能 量产交付 供应链
事件简述

广发证券 9 月 22 日研报指出,9 月上旬特斯拉向核心供应链一次性下达约 5000 台 Optimus 批量订单;华福证券同日判断,量产节奏置信度持续提升,预计周产爬坡量级有望在年底达到 2000 台/周。机构同步上调出货预期:高盛将 2030 年全球人形机器人出货量预测从 25.6 万台上调至约 89 万台,德意志银行将 2026 年预期从 1.75 万台上调至约 5 万台,并认为中国是增长的核心引擎。

9 月 23 日,马斯克在专访中称未来 15 年全球人形机器人或达 100 亿台、20 年可能达到 1000 亿台。需对照的是,特斯拉 2025 年原定生产 5000 台 Optimus 的目标已落空,实际产量为数百台。

关注理由

供应链一次性下单是比发布会更靠前的量产信号,意味着硬件方案已基本定型、进入可批量复制的阶段。机构同时提示软件层技术路径尚未收敛,短期可落地的 VLA 分层架构与需要大量数据的一体化端到端模型仍在竞争,泛化能力不足是商业化进度不及预期的主要风险。

来源

科创板日报(财联社)https://www.cls.cn/detail/2491150 ;经济参考报(证券时报转载)https://www.stcn.com/article/detail/4194066.html

NO.04 · AI Agent / 平台

阿里千问 AI 平台升级,推出企业级 Agent 服务平台 Agent Studio

AI Agent 企业平台 AI 云
事件简述

9 月 22 日云栖大会 MaaS & Agent 技术主论坛上,阿里宣布千问 AI 平台在模型服务之外新增 Agent 服务与行业 AI 解决方案,并发布 Agent Studio:按任务自动路由模型、提供 24 小时托管运行、支持企业内部知识数据与外部软件服务接入,开放覆盖运行环境、长期记忆、工具服务、会话请求的 50 多个原子 API,后续将推出包含运行观测、AI 评测器与优化器的 Agent 自进化引擎。

平台给出的数字包括:模型弹性启动时间由 1200 秒缩短至 70 秒,1 分钟内可拉起 1 万个 Pods,首 Token 延迟降低 38%,Prompt Caching 成本最高节省 95%。订阅侧 Token Plan 以一份订阅覆盖 Qwen、Kimi、GLM、DeepSeek 等模型,原生打通 Qoder、Cursor、Codex、OpenClaw 等编程工具与 Agent 框架;供给侧提供按量付费、优速模式、吞吐预留与独占吞吐四种口径。

关注理由

云厂商的竞争位置正从卖 Token 转向托管 Agent 的运行环境,计量方式也随之分层——从按量计费到预留、独占,本质是把 Agent 长时运行的确定性成本单独定价。对做 Agent 应用的团队来说,模型路由、记忆与工具接入被平台打包,自建中间层的空间被压缩,迁移成本与锁定风险需要重新评估。

来源

量子位 https://www.qbitai.com/2026/09/496301.html

NO.05 · 终端智能 / 端侧模型

斑马智能发布端侧全模态模型 AutoOmni 2.0-23B-A3B

终端智能 端侧模型 智舱
事件简述

9 月 23 日云栖大会期间,斑马智能发布全模态端侧大模型 AutoOmni 2.0-23B-A3B,采用 MoE 架构,官方称其在智能座舱场景的普通任务能力相当于 10 倍参数量的云模型,复杂任务约为后者的 80%-90%。公司披露该模型已与国内外 10 家芯片企业合作,软硬协同支持 8 路以上多任务稳定并发,大模型推理加速 5-6 倍,量化保真度超过 99%,运行内存占用减少 50% 以上。

同场亮相 AutoClaw 2.0 智舱协作实车方案,并联合 AI 数据终端公司打通车内 1 小时与车外 23 小时的上下文。公司称元神 AI 已覆盖主流车企 68% 的服务,过去一年端模型上车的企业中 63% 选择了斑马智能,后续将从 AutoOmni 向 EdgeOmni 演进。

关注理由

把全模态模型压到 20B 级别并跑在车规芯片上,约束条件就从「能否运行」转向功耗、内存与多任务并发——量化保真度与内存占用这类指标开始成为可比较的卖点。座舱同时是免唤醒、主动服务的试验场,对时延和隐私的要求高于云端助手,端侧模型的能力边界直接决定哪些任务可以不上云。

来源

量子位 https://www.qbitai.com/2026/09/496471.html