
Ornith-1.5:从自脚手架到自改进,开源模型学会给自己出题
Ornith-1.5 把训练循环从'人类出题'变成'模型自己出题、自己搭脚手架、自己解题',397B 版本编程基准追平 Claude Opus 4.8,9B 小模型能跑在手机上。
原文来源:Ornith Blog — Ornith-1.5 将自脚手架框架扩展为完整的端到端自改进循环,模型自己生成训练任务、自己搭解题脚手架,在编程与智能体基准上追平 Claude Opus 4.8。
大模型训练有一个尴尬的瓶颈:训练数据永远是有限的。人类专家写几千道题已经是极限,可模型越变越强,很快就"做完"了手头所有题——剩下的要么太简单,要么太难,都没有学习价值。各家的解法通常是堆人力:雇更多标注员、写更多评测集、设计更复杂的训练环境。Ornith 团队这次换了个思路:既然模型已经会解题,为什么不干脆让它自己出题?
这就是 Ornith-1.5 的核心——从 Ornith-1.0 的"自脚手架"(Self-Scaffolding)进化到完整的自改进循环(Self-Improvement Loop):模型自己提出新任务、自己生成任务专属的解题脚手架、自己产出解决方案,再用强化学习从这些自产自销的经验里持续进步。
三个规模,覆盖从手机到数据中心
Ornith-1.5 一次发布了三个模型:397B MoE、35B MoE(每 token 只激活 3B 参数)和 9B dense,外加量化版 9B-Mobile,可以直接部署到 iPhone 和 Android 上。
旗舰 397B 版本的成绩相当能打:Terminal-Bench 2.1 拿到 86.1,DeepSWE 拿到 56.0——官方数据里这两个数字分别和 Claude Opus 4.8 的 85.0 和 59.0 基本持平,同时超过了同级别的 GLM-5.2(82.7 / 46.2)和 DeepSeek-V4-Flash-0731(82.7 / 54.4)。在 SWE-bench Verified 上 86 分,也压过了这两个对手。
有意思的是 35B 版本:激活参数只有 3B,但智能体编程能力(Terminal-Bench 2.1 的 68.5 分)把同量级的 Qwen 3.6-35B(49.2)甩开近 20 分,还大幅领先两个稠密模型 Gemma 4-31B(43.4)和 Meta 的 Muse Glimmer-30B(51.7)。至于 9B 小模型,Terminal-Bench 2.1 47.0、SWE-bench Verified 70.6——一个 9B 参数、能塞进手机的模型,编程能力超过了 31B 的 Gemma 4,这个数据放在一年前很难想象。
—— 广告 ——
自改进循环是怎么转起来的
Ornith-1.5 和 1.0 的本质区别,在于训练数据的来源。1.0 的自脚手架框架里,任务还是人类定的,模型只负责优化"怎么解题";1.5 则把任务生成也交给了模型自己。每个训练周期分三个阶段:
第一阶段:提出任务。 给定一个环境或代码库、任务类型的高级指令,以及模型之前的解题历史,系统会提出越来越难的新任务——难到刚好超出模型当前能力边界,这样才能暴露能力缺口,把训练前沿不断往前推。
第二阶段:搭建脚手架。 针对每个任务,模型生成或精炼一套专属脚手架——包括指令、工具、任务拆解策略和编排方式。说白了就是"这道题该怎么组织思路、调用什么工具"。
第三阶段:产出方案。 基于任务和脚手架,策略模型生成解决方案(rollout)。最终的奖励信号会反向传播到全部三个阶段——模型不仅要学会解出更好的答案,还要学会生成更有用的训练任务、搭出更有效的脚手架。
整个循环是闭环的:策略越强,就能生成更难、更有信息量的任务;脚手架在进化中发现更好激发模型能力的方式;高质量 rollout 又提供越来越有效的学习信号。模型不再依赖静态的训练分布,而是持续扩展自己的课程表。
奖励函数:三道关卡
自改进循环里最微妙的设计是奖励函数。如果只是让模型随便出题,它很快就会偷懒——出简单的题刷分,或者反复出同一道题的变体。Ornith-1.5 用三个信号相乘来约束任务质量:
R_task = V(有效性) × D(前沿难度) × N(新颖性)
有效性(Validity):任务和脚手架必须构成一个可运行、可验证的学习环境——脚手架能跑通、高置信度的答案能通过、明显错误的答案会挂掉。这个信号还是硬门禁:有效性为 0,整个奖励就是 0,防止模型用"看起来很困难"的畸形任务骗分。
前沿难度(Frontier Difficulty):难度直接用模型自己的 rollout 来估算。对每个任务采样 N 次,算经验成功率 p,然后奖励成功率接近目标值 p*=0.2 的任务——太难(全挂)和太简单(全过)都不行,20% 成功率意味着"有挑战但还能学到东西"。这里有个精巧的动态:模型越进步、任务越容易解,奖励自然下降,生成器就被迫去出更难的题。课程难度自动跟随能力水涨船高。
新颖性(Novelty):防止模型反复生成相似任务的变体,用与历史任务缓冲区的最大相似度来惩罚。不过它排在有效性和难度之后——新颖不是目的,减少冗余才是。
脚手架本身也有奖励,三个维度:任务对齐度(评测环境是否忠实反映任务规格)、奖励保真度(奖励是否真实反映方案质量)、抗 hack 能力(是否防止奖励作弊、走捷径)。三个阶段各自用 GRPO 优化,在同一循环里共同进步。
这意味着什么
Ornith-1.5 的技术路线值得关注的点在于:它把"找题"这个原本依赖人类专家的环节完全自动化了。传统 RLHF/RL 流程里,数据飞轮的核心瓶颈是人工数据供给;而 Ornith 这套方案里,模型既是学生也是出题老师,训练数据的边际成本趋近于零。
当然,要冷静看待几个问题。第一,自改进循环的上限还没验证——模型能自己出题,但如果它反复出同一类它擅长的题,能力会不会只在特定分布内增长?论文用新颖性奖励缓解了这一点,但长期是否真的能突破分布边界,还需要更多训练周期的数据。第二,benchmark 数字都是官方自测,Terminal-Bench 2.1 的评测框架(Harbor/Terminus-2)和 Claude Code 模式都做了模板适配,跨实验室直接对比时要小心口径差异。第三,Ornith-1.0 时代就已经有"自脚手架超越 Opus 4.7"的宣传,这次 1.5 追平 4.8——跟进速度很快,但 Open 权重社区和闭源模型的差距依然存在。
对于开发者来说,最实际的信号是 9B-Mobile 版本:能在手机上跑、SWE-bench Verified 70.6 的编程模型,意味着本地代码助手不再是玩具。这可能是 2026 年下半年端侧 AI 最值得关注的方向之一。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/ornith-15-self-improvement
相关文章
Ornith-1.0:首个自脚手架开源编程模型,397B 超越 Claude Opus 4.7
DeepReinforce 开源 Ornith-1.0 模型族,9B 到 397B 全覆盖,核心创新是让模型学会自己生成编排逻辑。397B 版本在编程基准上超越 Claude Opus 4.7。
Qwen 3.6 27B:一台消费级显卡就能跑起来的旗舰级编程模型
Qwen 3.6 27B 稠密模型在编程能力上超越了上一代 397B MoE 旗舰,而且部署简单——一台 24GB 显存显卡就够。HN 当日最热,580 票。
Meta 开源 Muse Glimmer:30B 参数、能跑在消费级硬件上的本地 Agent 模型
Meta Superintelligence Labs 开源了 Muse Glimmer——一个 30B 参数、专为本地 Agent 工作流设计的模型。量化后不到 20GB,24GB 显存的机器就能跑,还自带视觉能力和投机解码加速。