NO.69 · 2026-09-15
本期梳理 9 月上旬的编码智能体与端侧/具身进展:OpenAI 把新一代旗舰的能力重心明确放到长程软件工程与电脑操作;GitHub 在 Copilot CLI 中把多模型协同编排产品化,用更低的 token 成本逼近更强单模型的基准表现;清华与 Qwen 团队给出「轨迹即数据」的编码 agent 训练环境构建方法;面壁智能的 2B 端侧模型初具通用 Agent 能力,把工具调用与代码生成压到手机与 PC 本地;小鹏机器人自动化总装产线启用,人形机器人从研发试制跨向规模制造。
01 / 05
OpenAI 发布 GPT-6 Astra,把长程软件工程与电脑操作用作旗舰定位
AI Agent
基础模型
软件工程
电脑操作
事件
9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra(API 代号 gpt-6-astra),分阶段向 ChatGPT Plus / Pro / Business / Enterprise、OpenAI API、Azure、AWS Bedrock 推送。标准定价为每百万输入 token 10 美元、输出 50 美元,上下文窗口 105 万 token、最大输出 12.8 万。OpenAI 将其定位为迄今「最适合软件工程」的模型,并强调电脑 / 浏览器操作能力:Terminal-Bench 4.0 由 GPT-5.6 Sol 的 37.3% 提升至 57.9%,OSWorld 2.0 达 72.6%,同时给出 1.05M 上下文与更低幻觉率(4.2% vs Sol 12.2%)。它也成为 OpenAI 首个被自家 Preparedness Framework 列为「Critical」网络安全阈值的模型,公开版对高级漏洞利用能力设限,更强能力置于受控的 Daybreak 计划。
关注理由
这代旗舰的卖点从「聊天」明确转向「长程软件工程与电脑操作」,并把最大上下文与更低幻觉率打包进来。对 AI coding 与 agent 的含义是:头部模型厂商正把「能独立跑完一个长任务、能操作电脑」当作旗舰级能力的核心指标,而不只是刷分;随之而来的是安全护栏与可用性之间的张力——能力越强,公开可用的边界越需要被框定。选型时值得跟踪它在 Terminal-Bench 等编码榜上的真实表现,而非只看官方跑分。
来源 · OpenAI 官方公告与 API 定价页(gpt-6-astra,2026-09-03);yottalabs 发布拆解 · GPT-6 Astra: Release Date, Pricing, Benchmarks, and Rollout
02 / 05
GitHub 在 Copilot CLI 推出 HydraFusion 多模型编排研究预览
AI coding
多模型编排
成本
Copilot
事件
9 月 4 日,GitHub 将 Project HydraFusion 作为研究预览开放给 Copilot CLI,开发者可在 CLI 中通过 /experimental 命令调用。系统按任务动态编排多个模型,提供三种执行模式:Single(单模型执行)、Cascade(廉价模型先试,质量不足再升级到更强模型)、Critique(一模型写代码、二模型评审、再据反馈修订)。GitHub 称其在 TerminalBench 2.1、DeepSWE、CheckpointBench 上达到或优于 Claude Opus 5,而估算 token 成本降低 36%–67%;不单独收费,按底层模型标准费率计费,各订阅档位均可调用。
关注理由
它把「用多个模型协同降本」从技巧变成了产品能力。对 AI coding 的含义是:当单模型能力趋于同质,编排策略(何时升级、何时评审)正成为可控成本与稳定质量之间的关键杠杆;开发者选型的注意力,会从「哪个模型最强」部分转向「编排与路由怎么配」。这不是模型能力的胜利,而是工程化调度的胜利。
来源 · dutchstartup.ai 行业梳理(2026-09-04)· A wave of new AI agent tools is emerging around early September 2026
03 / 05
清华与 Qwen 团队发布 Terminal-Universe,把 agent 轨迹重放成训练环境
AI coding
训练数据
智能体
开源
事件
9 月 9 日,清华与阿里 Qwen 团队在 arXiv 发布 Terminal-Universe(arXiv:2609.04148)。方法是从已有终端编码 agent 的轨迹中确定性重放文件操作,还原出可复现的工作空间,再以补全 agent 补齐缺失文件与依赖,并在其上合成带自动测试的验证任务与多轮对话数据。对公开轨迹套用该流程得到 3.73 万(37.3k)个任务就绪环境与约 3.19 万条 SFT 演示;在其上微调 Qwen3.5-27B,Terminal-Bench 2.1 由 46.2% 升至 58.1%(+11.9),EvoCode-Bench v2 MT@4 提升 13.8 分。
关注理由
它点出编码 agent 训练的真正稀缺资源是可执行、可验证的环境,而非轨迹本身——一条轨迹是冻结的演示,一个环境能被反复求解与验证。对自研编码模型的含义是:「轨迹即数据」给出了把公开 agent 行为低成本转成训练语料的路径,尤其利于资源有限、又想复用公开轨迹的团队;但环境重建质量比轨迹长度更重要,论文也提示更长轨迹反而拖累表现。所有性能数据来自论文自报,尚无第三方复现。
来源 · arXiv:2609.04148(2026-09-09)· Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments;chooseai 中文速览
04 / 05
面壁智能开源 MiniCPM5-2B,端侧 2B 模型初具通用 Agent 能力
终端智能
端侧模型
开源
Agent
事件
9 月 8 日,面壁智能联合 OpenBMB 开源社区开源 MiniCPM5-2B 高密度端侧语言基础模型,并同步开放完整训练配方、强化学习框架与配套数据集(Apache 2.0)。评测机构 Artificial Analysis 榜单显示,该 2B 模型以 23 分位列全球 4B 以下开源模型首位;其 Agentic Index 智能体指标获 20 分,而同级模型普遍低于 10 分。模型已适配英特尔 AIPC、瑞芯微 RK3588 双芯、Arm SME2 移动平台,可本地跑通工具调用、深度搜索、代码生成等端侧 Agent 能力。截至 2026 年 8 月,MiniCPM 系列开源模型全球下载量突破 5000 万次。
关注理由
它初步验证了「端侧模型承载通用 Agent 能力」的可行性——以往 10B 以下端侧模型大多只能聊天,多步工具调用容易掉链子。对终端智能的含义是:当手机、PC、汽车能在本地跑通 Agent,推理成本、响应时延与数据隐私这三项普及约束都会松动;面壁把「权重 + 框架 + 数据 + 训练方法」一次性公开,是争取端侧开发者生态粘附的基础设施级打法。
来源 · 光明网 / 新京报 / 经济观察报(2026-09-08)· 面壁智能开源MiniCPM5-2B让智能体有望在终端本地运行
05 / 05
小鹏机器人自动化总装产线启用,首台 IRON 自主走下产线
具身智能
人形机器人
量产
物理AI
事件
9 月 10 日,小鹏机器人全球首条高阶通用人形机器人自动化总装产线启用,首台 IRON(编号 9527)完成自动化总装并自主走下产线。该产线以规模量产为目标正向开发,核心制程自动化率超 80%,将汽车工业质量体系与人形机器人精密制造融合。IRON 全身 76 个自由度、单手 21 个自由度,搭载 3 颗图灵 AI 芯片、端侧有效算力约 2250 TOPS,小鹏物理 AI 大模型在端侧部署,无需遥操即可自主完成复杂任务;官方计划 2026 年底进入规模量产、从门店与园区落地,2027 年面向中国与海外上市交付。
关注理由
这是具身智能从「研发试制」跨到「产线制造」的节点信号。对行业的含义是:人形机器人的瓶颈正从单体运动能力转向可规模复制的制造与品控——以车规级一致性标准造机器人,意味着产能与成本曲线开始向汽车工业看齐;当量产时点明确,下游场景(门店导购、园区服务)的商业化才从演示走向可采购。同日优必选公布上半年交付约 600 台 Walker S2、智元发布 AGILE 2.0 感控一体模型,行业重心正从「能跑能跳」转向「真干活」。
来源 · 广东省采购与供应链协会 / 小鹏官方(2026-09-10)· 小鹏机器人生产线正式启用,全球首位高阶通用人形机器人完成自动化总装并自主走下产线