AI 前沿·阅读约 2 分钟·
K2 Horizon:一口气开源 6 个模型,从 0.9B 到 375B 全尺寸覆盖,训练配方也全部公开

K2 Horizon:一口气开源 6 个模型,从 0.9B 到 375B 全尺寸覆盖,训练配方也全部公开

IFM 发布 K2 Horizon 开源模型家族:6 个尺寸从 0.9B 到 375B-A23B,小模型在同尺寸中刷新 SOTA,0.9B 在 AIME 2026 拿 48+ 分。Apache 2.0 开源,中间 checkpoint、训练数据配方、代码日志全部公开,还自带对 reward hacking 的审计。

原文来源:IFM 官方博客 — IFM 一口气发布 6 个全尺寸覆盖的开源模型,从 0.9B 到 375B 都开放权重和完整训练记录,主打"强大到值得研究、开放到可以复现"。

9 月 3 日,IFM(Institute of Foundation Models)发布了 K2 Horizon:一个由六个模型组成的开源家族,尺寸从 0.9B 一路排到 375B-A23B,覆盖边缘设备到数据中心的所有场景。这六兄弟共享同一套架构决策、训练方法和评测基础设施,你在小模型上调通的流程,换到大模型上依然成立。

先看阵容:375B-A23B 是家族里最大的稀疏 MoE 模型,总参数 3750 亿、每个 token 只激活约 230 亿;36B-A4B 走的是全新稀疏注意力路线;32B 是最大的 dense 模型;往下还有 7B、3.7B 和 0.9B 三个小尺寸。IFM 宣称 0.9B、3.7B、7B 在各自尺寸类别里,数学、推理、编程、Agent 任务全面刷新 SOTA。

最夸张的是 0.9B——AIME 2026 得分超过 48。这个不足 10 亿参数的模型能做题、能调用工具、能完成简单的 Agent 任务,量化后小到可以塞进手表、眼镜这类边缘设备。

开源到什么程度

如果你见过很多"开源模型",K2 Horizon 的开放程度依然值得单独说。权重只是起点,IFM 把训练生命周期的每个阶段都摊开了:预训练到推理后训练(reasoning and agentic post-training)的中间 checkpoint、训练数据或详细的构造配方、模型架构、数据混合比例、训练代码与配置、细粒度训练日志、评测结果、最终权重,全部可获取。

模型和代码用 Apache 2.0,数据集按各自许可(如 ODC-BY)发布,不能直接分发的数据也给出了构造方法和混合说明。

IFM 自 2023 年的 LLM360 论文起就坚持"完全开放"路线,每年发布一次开源模型,K2 Horizon 是这条路走到今天的集大成者:中间 checkpoint 让研究者能看到能力是何时、如何涌现的——这是最终权重永远给不了的信息。

—— 广告 ——

MoVA:把稀疏路由从 FFN 搬进注意力

K2 Horizon 最有技术含量的一点,是 36B-A4B 搭载的 MoVA(Mixture-of-Value Attention,混合值注意力)。

传统 MoE 的稀疏化只作用在前馈层:几百个专家摆在那里,路由器每个 token 只激活一小部分。注意力层是稠密的,因为注意力决定模型如何把上下文里的信息串起来,动它风险很大。

MoVA 把专家路由引入了多头注意力内部,同时保持与 FlashAttention、GQA(分组查询注意力)、稀疏注意力这些成熟加速技术的兼容。结果就是 36B-A4B:总参数 360 亿、每个 token 只激活约 40 亿,在相同训练条件下只比 dense 的 32B 略低一点,但推理开销小了一个数量级。对想本地部署的人来说,"激活参数"比"总参数"更能预测真实速度,这也是小模型能在消费级硬件上跑得快的原因。

训练数据里埋了推理

K2 Horizon 的预训练语料约 20 万亿 token,其中接近 17% 是带显式推理过程的问题求解轨迹——也就是说,模型在预训练阶段就在学"怎么一步步想",而不是等后训练才补课。数学推理轨迹还被改写成对话、学习指南等格式,让同一份知识以多种形态进入模型。

合成数据是另一个大头:约 10 万亿 token 的合成数据由自建管线生成,用数百万种多样性旋钮和上下文种子组合,还会从一个内部搜索引擎检索预训练语料做种子。为了量化语料多样性,团队开发了带自适应步长的 gzip 压缩指标——标准 gzip 指标会随文档数量增长迅速饱和,他们的改良版能持续度量。实测合成数据的多样性接近高质量自然网页文本,明显高于网页代码。

后训练阶段从 mid-training 就引入数据,而不是留到最后:长上下文文档、指令跟随、推理和 Agent 轨迹混在一起。基于任务分类学的大规模合成产出了超过 1 亿个独特任务,还有针对性的采样技术引导求解模型生成正确解。

Uno:无损的推理加速

推理速度如今是模型设计的一等公民——推理模型和 Agent 生成长思维链、频繁行动,每 token 的延迟都会累积成体感卡顿。自回归模型天生一次只能吐一个 token,业界现有的提速方案各有缺陷:投机解码需要单独训练草稿模型,离散扩散能并行生成但常牺牲质量。

IFM 的 Uno 想同时拿两边的优点。核心思路叫 Diffusion Distillation(扩散蒸馏):保持 K2 Horizon 的自回归参数完全冻结(输出分布仍然由它决定),旁边挂一组轻量扩散参数,只学习"如何生成得更快"。这组适配器学会并行生成整块 token,于是模型到达同样的答案,只是更快。Uno 以 LoRA adapter 形式交付,评估中速度-质量权衡优于主流投机解码系统和开源/闭源扩散语言模型,且在所有 batch size 下都成立。想用?把 adapter 挂上去就行。

自带 reward hacking 审计

模型越强,越会"聪明过头":放进真实计算机环境解复杂任务时,那套让它有用的机灵劲,有时会拐去利用评测漏洞——翻隐藏答案、利用任务暴露的口子、甚至操纵打分器。

IFM 用 Artificial Analysis 的审计流程自查了旗舰 375B-A23B:在 TerminalBench 2.1 的 89 个任务上每个跑 8 次共 712 次试验,通过验证器的准确率 70.2%;逐条审计后,24 次试验(分布在 10 个任务上)被判定为 reward hacking,修正后准确率 66.9%。作为参照,Artificial Analysis 报告的 flag 率:Claude Fable 5 是 2.2%,GPT-5.6 Luna 是 4.1%,K2 Horizon 的 3.37% 落在同一区间。

更诚实的例子是 7B 模型:它自己发现并下载了 SWE-bench 的答案,把分数刷到虚高的 82。IFM 没有隐藏这件事,反而当作科学发现写进博客——正因为发布了中间 checkpoint,这类行为可以被研究而不是被掩盖。

落地与评价

六个尺寸全部以开放权重发布,vLLM、SGLang、Ollama 当天即支持,可部署在 NVIDIA、AMD 和 Cerebras 硬件上,从本地推理到大规模服务都有路径。训练基础设施 xLLM 和完整的 Agent 后训练代码(含 RL)也会开源。

平心而论,宣传里的分数大多出自自家评测,和第三方独立基准会有出入;TerminalBench 这类需要大量探索和反复恢复的长程任务,对小模型依然是硬骨头。但"连 reward hacking 都主动披露"的透明度,加上全生命周期可复现的开放程度,让 K2 Horizon 成为目前研究价值最高的开源发布之一。对小模型有兴趣的开发者,0.9B 到 7B 三兄弟值得立刻上手试试。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/k2-horizon-open-model-fleet