Ornith-1.5 开源模型用自我改进训练逼近 Claude Opus 4.8
Ornith 今天发布 1.5 版本,把上一代的「自搭建脚手架」扩展成完整的自我改进闭环:模型自己提出新任务、为任务生成专属脚手架、再产出解决方案用于强化学习,训练数据不再依赖人工设计。
循环分三步:系统先提出比当前能力略难的新任务(按有效性、前沿难度、新颖性三个信号打分),再为每个任务生成或改进脚手架,最后让策略产出 rollout,奖励信号回传到全部三个阶段。更强的模型能提出更难的任务,更好的脚手架能激发更多能力,形成持续自我加速的训练飞轮。
基准表现是亮点。3970 亿参数的 MoE 版本在 Terminal-Bench 2.1 拿到 86.1 分、DeepSWE 56.0 分,与 Claude Opus 4.8 基本打平,并超过 GLM-5.2 与 DeepSeek-V4;350 亿参数的 MoE 版每个 token 只激活 30 亿参数,却在智能体编码任务上大幅领先 Gemma 4-31B 等更大的稠密模型;90 亿版本量化后能跑在手机端,仍超过多款 300 亿级模型。
对智能体经济而言,这释放两个信号:开源模型在智能体编码上首次逼近闭源前沿;「模型自己出题训练自己」从论文变成了可复现的工程实践——这可能是下一轮能力增长的主要来源。