Ornith:从 9B 到 397B 的开源编程模型家族,训练任务由模型自己生成

Ornith 是一个把"训练什么"和"怎么训练"一起交给模型自己的开源编程模型家族,名字取自希腊语里的"鸟"。

Ornith 由 AI 研究实验室 DeepReinforce 推出,面向智能体编程(agentic coding)任务。它没有停留在固定训练流程里把模型调得更准,而是把训练本身的组织权也交还给模型:训练任务由模型提出,解题脚手架由模型搭建,最终的解法轨迹同样由模型生成。官方把这条路线称作自改进(self-improvement),并把它作为整个家族的主线。

目前 Ornith 已迭代出两代。2026 年 6 月发布的 Ornith-1.0 提出"自脚手架"(self-scaffolding)框架,2026 年 8 月发布的 Ornith-1.5 把这一框架从"脚手架与解法联合优化"扩展为完整的自我改进回路。

从自脚手架到自改进回路

Ornith-1.0 的核心做法是把脚手架当作可学习的对象。在常规的强化学习训练里,工具调用的顺序、出错后的重试逻辑、记忆如何组织,这些都由人工写好的固定骨架决定,模型只负责在骨架内产出解法。Ornith-1.0 让模型在每一轮训练中先依据任务描述提出一版更精细的脚手架,再按这版脚手架生成解法轨迹;解法拿到奖励后,奖励会同时回传给"写脚手架"和"写解法"两个阶段。反复迭代之后,针对不同任务类别的编排策略会自行浮现,不必由人工逐类指定。

训练流程示意配图
Ornith-1.0 的两阶段自脚手架流程,奖励同时回传给脚手架与解法。

Ornith-1.5 把这条思路再推进一步。训练回路从两阶段变成三阶段:模型先提出一个比此前更难的新任务,再为这个任务生成专属脚手架,最后在该脚手架条件下产出解法轨迹。奖励贯穿三个阶段,因此模型学到的除了"怎么解得更准",还包括"怎么出更有价值的题"和"怎么搭更有效的脚手架"。

训练回路示意配图
Ornith-1.5 的三阶段自改进回路:出题、搭脚手架、产出解法分别用各自的奖励联合优化。

题目怎么出:三重奖励的乘法设计

让模型自己出题,最直接的风险是它专挑软柿子捏,或者反复生成大同小异的题目。Ornith-1.5 用三个信号相乘来约束方向:有效性、前沿难度与新颖性。有效性衡量题目与脚手架是否构成一个定义清晰、可验证的学习环境,一旦脚手架跑不起来,或评测标准与题目规格对不上,这一项直接归零,整道题的奖励随之清零。

前沿难度依据模型在一道题上的实际成功率来估计。成功率越接近 0.2,难度奖励越高;当模型把某类题解得越来越稳,这道题的奖励会自然下滑,出题方向于是被推向更难的区域。新颖性用来压掉重复,以当前题目与历史题目缓冲区之间的最大相似度反向计分。三项相乘,意味着只有同时满足"可验证、有挑战、不重复"的题目才能拿到奖励。

三档规模与官方评测

Ornith-1.5 提供三档规模,覆盖从数据中心到终端的完整区间:397B 的混合专家(MoE)版本面向旗舰场景,35B-A3B 版本每个 token 只激活约 3B 参数,9B 的稠密(Dense)版本面向单卡与边缘设备。上一代的 Ornith-1.0 在这三档之外,还额外提供过一档 31B 稠密模型。整个家族的检查点共用同一套 OpenAI 兼容接口。

产品主视觉配图
Ornith-1.0 的官方主视觉,这一代提供 9B、31B、35B 与 397B 四档规模。

规模

Terminal-Bench 2.1

SWE-bench Verified

硬件定位

397B MoE

86.1

86.0

多卡节点

35B-A3B MoE

68.5

79.0

中型团队

9B Dense

47.0

70.6

单卡与终端

其中 9B 版本还派生出一份量化后的 Mobile 版本,官方称它可以直接在 iPhone 与 Android 设备上运行。三档模型均支持 256K(262,144 token)的上下文窗口,借助 YaRN 缩放因子 4.0 可扩展到约一百万 token。

怎么跑:本地推理与开源许可

Ornith 系列属于推理模型,默认情况下助手回复会先输出一段 think 推理块,再给出最终答案;官方提供的推理配方会把这段思维链拆到单独的字段里返回,同时开放工具调用解析,便于接入各类智能体编排框架。

Ornith 官方渠道使用的标识图。

在运行方式上,Ornith 没有托管 API,也不存在价目表,全部能力以模型权重形式发布,需要自行部署。官方给出了 vLLM、SGLang 等推理栈的部署配方,也提供了面向长上下文的专门配置;量化格式覆盖 GGUF 与 MLX,可以经由 llama.cpp 与 Ollama 在本地运行。


权重以 MIT 许可发布,官方说明其"全球可获取、不受地域限制",研究用途与商用部署都不需要额外的授权环节。

Ornith 把"训练什么"和"怎么训练"一起交给模型自己:出题、搭脚手架、写解法构成一条闭环,再用有效性、难度与新颖性的乘法奖励约束出题方向。它以三档规模覆盖从数据中心到手机的不同硬件,用 MIT 许可与纯本地部署换取完全的使用自由。

Ornith下载地址
支持的操作系统: Windows macOS Linux