模型改写自己的 GPU 内核,20% 成本降幅当天变成 80% 降价
7 月 29 日,OpenAI 发布博文披露:团队用 GPT-5.6 Sol 优化 GPT-5.6 系列自身的推理链路,分三层——调度层(Sol 经 Codex 分析生产流量、识别负载失衡、调整路由启发式,按地域、可用容量、加速器类型分配请求);内核层(让 Sol 学 Triton 与 Gluon,自主改写生产环境 GPU 内核,端到端服务成本最多降 20%,正确性用开源浮点清理器 FpSan 验证);解码层(优化投机解码,token 生成效率提升 超过 15%)。
7 月 30 日(美东)/31 日(北京),这部分收益直接传导给客户:GPT-5.6 Luna 降价 80%、Terra 降价 20%,API 引入 Fast mode 替代 Priority Processing(Sol 最高 2.5× 速度、2× 价格,智能不变)。内部衡量自我改进能力的 RSI Index 上,GPT-5.6 比 5.5 高出 16.2 分。
这是"递归自我改进"第一次有了可核验的商业闭环——不是论文概念,是账单数字。飞轮很清楚:模型越强 → 越能优化推理栈 → 同样的卡吐出更多 token → 成本下降 → 更强的模型铺给更多人。竞争轴随之偏移:过去比谁买得起更多 GPU,现在开始比同样一批卡谁榨得出更多 token。
同频参照:同一周,腾讯混元开源端到端投机解码框架 AngelSpec(7/29–30),并开放 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码——DFly 在 4–64 全并发档位平均加速 1.98–2.40×,D-cut 机制在高并发下再提升 15.7% 吞吐。同一件事的两条路径:一条让模型自己改,一条把工具链开源出去。