AI 开始自己带徒弟了:GPT-5.6 如何让旗舰模型训练子模型
OpenAI GPT-5.6 系列中最小的 Luna 模型,竟是由旗舰 Sol 自主完成后训练的——找 GPU、配环境、写脚本、执行确认,全程无需人类工程师。这标志着递归自我改进从理论走向现实,AI 不再只是工具,它开始进化了。
一场被大多数人忽略的技术地震
2026年7月9日,OpenAI 向全球用户全面开放了 GPT-5.6 全系列模型。三款模型各有分工:旗舰版 Sol 坐镇性能巅峰,均衡版 Terra 兼顾成本与能力,轻量版 Luna 主打极致性价比。
大多数人的注意力被两个数字吸走了。
第一,Sol 在编程基准测试 Terminal-Bench 2.1 中拿到 91.9% 的得分,比 Anthropic 的 Claude Fable 5 高出超过 8 个百分点。第二,Luna 的输入价格压到了每百万 token 仅 1 美元,直接掀翻了硅谷的定价体系。
但技术圈真正炸锅的,是技术文档里一句被轻描淡写带过的话。
Luna 的后训练由 Sol 自主完成。Sol 自行寻找可用 GPU、确定训练配置、编写启动脚本并确认任务执行,全程无需人类工程师干预。
这句话的含金量远超所有跑分。AI 不再是人类手里的工具——它开始自己带徒弟了。
什么是递归自我改进
要理解这件事的意义,得先弄清楚大模型训练的传统流程。
以前训练一个模型,需要一群人类研究员完成一系列繁重的工作:数据清洗、奖励模型设计、知识蒸馏、超参数搜索。每一步都需要大量专业知识和工程资源。这也是为什么训练 GPT 级别的大模型,只有少数几家顶级实验室玩得转。
递归自我改进(Recursive Self-Improvement)打破了这个链条。当一个模型强大到能够自主完成「训练出另一个模型」的全流程时,就不再需要人类在中间充当瓶颈。AI 可以自己找 GPU 资源、自己设计训练策略、自己启动任务并检查结果。
Sol 训练 Luna 这件事,就是递归自我改进第一次在工业级产品中公开展示。不是实验室里的概念验证,而是已经落地的产品发布。
这意味着什么
首先,成本结构会彻底改变。如果旗舰模型可以批量产出轻量模型,大厂就不需要每次为每个细分场景重新投入人力训练小模型。AI 自己就能根据需求产出合适的子模型。Luna 每百万 token 1 美元的定价,本身就是这种新范式的产物。
其次,迭代速度会指数级加速。过去一个新模型领先几个月到半年。但如果 AI 可以自己迭代下一个版本,领先窗口可能缩短到几周甚至几天。这也是为什么 Grok 4.5、腾讯混元 Hy3 这些后发选手能在几个月内追到第一梯队——技术配方扩散加上自动化训练,让追赶变得前所未有的快。
最后,也是最重要的一点:递归自我改进是通向 AGI 的关键路径之一。当 AI 能自主提升自己的能力,每一步迭代都为下一步铺路,这个飞轮一旦转起来就不会停。
风险和隐忧
事情的另一面是安全风险。
AI 安全领域的研究者一直警告:递归自我改进可能带来不可控的模型行为漂移。人类研究员在训练过程中天然会做安全检查和行为对齐,但如果这一步也被自动化,谁能保证 AI 训练出来的子模型不会出现意外的能力或偏好?
OpenAI 对此的回应是,Luna 的训练全程在沙箱环境中进行,且最终模型经过了严格的安全评估。但这本质上是一个更大的问题:随着 AI 越来越自主,人类在回路中的角色从「操作者」变成了「监督者」,而监督者的难度往往远高于操作者。
行业的连锁反应
GPT-5.6 这一发布已经引发了连锁反应。Anthropic 延长了 Claude Fable 5 的促销使用期,Claude Code 周额度加 50% 的活动还在继续。Grok 4.5 的口碑突然翻上来,不少人觉得比 Opus 4.8 还好用。腾讯混元 Hy3 只激活 21B 参数,也敢和更大的旗舰模型掰手腕。
竞争格局正在从「谁有最强模型」变成「谁有最强的模型训练模型的体系」。未来 AI 公司真正的护城河,可能不是某一个模型的跑分,而是一整套自动化训练和自我迭代的基础设施。
写在最后
人类研究员花了五年时间教会 AI 写代码。现在 AI 反过来,用它学会的代码能力去训练新的 AI。
这件事最有趣的地方在于:我们不知道这个飞轮转起来之后会发生什么。但我们知道,2026年7月9日,它会成为一个被反复提起的日期。