
67 美分训出 44% ARC-AGI:一个小 transformer 如何击穿「大模型专属」基准
一位独立研究者用 1.5 小时、67 美分成本训练的小 transformer 在 ARC-AGI-1 上拿到 44% 分数,追平甚至超过许多大模型。拆解他的方法、消融实验与开源代码。
原文来源:44% on ARC-AGI-1 in 67 cents — 一位独立研究员用 1.5 小时、67 美分成本,从零训练的小 transformer 在 ARC-AGI-1 上拿下 44% 分数,追平不少大模型
2026 年 7 月,一条消息在 X 上炸开:有人用一张 RTX 5090 训练了 1.5 小时、成本只有 67 美分的小 transformer,在 ARC-AGI-1 公开评测集上拿到了 44% 的分数。这个结果不仅追平了此前需要大量算力的 TRM/HRM 等方案,还吸引了 Lucas Beyer、Jeremy Howard、Rohan Anil 等一线研究者的公开讨论。
如果你对 ARC-AGI 不熟,简单说:这是一个专门考验「举一反三」能力的基准,只有 1000 道谜题,每道谜题是一套独立的规则推理任务。人类解起来非常轻松,但模型想拿高分很难——因为它考的不是记住知识,而是从极少样本中归纳出新规则。百万美元奖金挂了六年,至今没有 AI 真正攻克。
为什么盯着 ARC 不放
作者在博客里解释了他的动机:样本效率是当下 AI 最核心的问题。大模型烧掉海量数据和算力,换来的是「见多识广」,但真正的人类智能是「举一反三」。他想做的,是把样本效率推到极限——在尽量少的算力、尽量少的数据下,看看纯 transformer 能走多远。
ARC 恰好是完美的试验场:
- 只有 1000 道谜题,高维空间里样本极少
- 它是元学习基准,每道题规则不同,但共享一些底层概念
- 评测集需要的所有概念在训练集里都出现过,不需要额外先验
- 人类解起来极其容易,即使是资源有限的独立研究者也能参与
- 在「数据效率」这个维度上,基准远未饱和
成本控制是作者的核心追求。他说得直白:要把成本压到「世界上任何人都能负担」的水平,让样本效率研究不再是少数实验室的专利。
—— 广告 ——
方法:从零开始、测试时训练
整体思路延续了他之前的工作,但做了大量升级。核心流程是:
每个输入-输出对先被转换成 token 序列,然后由一个小 transformer 做自回归训练。训练发生在测试时——模型在训练集谜题和评测集谜题上同时从零开始学习(评测集的测试标签是隐藏的)。为了让不同任务之间能共享知识,每道谜题分配一个独立的可学习加法嵌入;由于每个序列包含两个 2D 网格,位置编码用的是 3D RoPE。
推理时,测试输入经过颜色与二面体排列增强,输出再反向还原,取出现最多的两个答案提交(AAIVR 策略)。
分数提升的关键改动
对比上一版模型(约 40%),这次涨到 44% 主要靠三件事:
- 现代化架构:SwiGLU 替代 GELU、RMSNorm 替代 LayerNorm
- 数据多样性:更丰富的数据增强和更好的打乱策略
- 规模扩展:层数从 4 层增加到 8 层
成本下降则来自:
- 大幅减少增强次数(样本效率更高了)
- 优化器从 AdamW 换成 Normuon(Muon 的改进版——作者发现 vanilla Muon 训练虽快,但后期 loss 和分数会停滞,手动调低 momentum 和 LR 能解决,但换到 Normuon 后问题自动消失)
- Flash Attention + varlen 训练、flex attention 内核做推理
还有一个耐人寻味的改动:不再训练输入 token,loss 只算输出 token(变成监督式)。这让分数从 40% 涨到 44%,但作者坦言他并不完全理解为什么——可能是模型容量有限。
另外他谨慎地加入了 ARC-2 中的非重叠任务扩充训练数据(773 道与 ARC-1 重复的谜题被仔细过滤掉,确保无泄漏)。如果你不喜欢额外数据,去掉也能保持约 40%,但需要约两倍算力。
消融实验:什么才是真正重要的
最有价值的可能是这组消融数据:
- 去掉 3D RoPE 或 per-task 嵌入 → 分数暴跌到约 24%
- 用 1D RoPE 替代 3D RoPE → 约 24%
- 训练时包含输入 token → 约 39%
- 只用 ARC-1 + ConceptARC 训练 → 约 40%
- 改成 CompressARC 风格(每任务单独从零训练、无监督)→ 跌到 18%;监督式也只有 15%
结论很清楚:好的表征(3D RoPE + 每任务嵌入)贡献最大。这印证了作者的判断——架构和表征设计比堆算力重要得多。
争议与回应
这个结果在 X 上引发大量讨论,也招来不少质疑。作者逐条回应了最常见的批评:
「在评测集上训练 = 作弊?」 不是。「Training on test」特指训练测试数据的标签——而这里的标签是隐藏的,从未被训练。ARC 本来就是元学习基准,从评测集谜题中学习是被设计允许的(术语上叫 transduction,Vapnik 时代就开始研究了)。
「用评测集输入也算泄漏?」 不算。这类方法叫「转导推理」,在持续学习的研究语境下,忽略评测输入反而是说不通的。而且在新版中,作者已经移除了对输入的训练——因为它分数略低。
「违反测试政策?」 政策原文是「测试者不得提前知道考题」,指的是设计 AI 系统的人,而不是 AI 系统本身。
开源与下一步
代码全部开源在 GitHub,作者欢迎任何人改进。他给出的目标是:达到 65% 不需要太多改动——因为他把多次运行解出的题目取并集,已经能到 55%,还有一批题目「几乎」解出来了。具体思路包括:
- RoPE 混合了位置和内容信息,可能拖累性能,PoPE 应该持平或更好,或者发明新的位置编码
- 架构还可以进一步现代化
- 成本理论上还能用手写 GPU 代码再降 10 倍
作者还吐槽了一句:这个基准开放了六年、高调宣传、还有百万美元奖金,为什么没人发现「一个 transformer 加最显然的表征」就能做到?他猜测要么是研究者低估了深度学习,要么是实验成本高到做不起像样的消融,要么是被 LLM 带偏了方向。
启示:小模型路线的信号
这篇工作最值得注意的不是 44% 这个数字本身,而是它背后的方法论信号:当算力和数据都极其有限时,表征设计和训练策略才是决定性的。在主流注意力全在堆参数、堆数据的 2026 年,这种「用最小成本做最干净的实验」的路线,反而成了稀缺品。
67 美分的实验,给出的是关于样本效率上限的硬数据——这正是这个领域最缺的东西。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/arc-agi-44-percent-small-transformer
相关文章
小模型的时代来了:一次深度 AI 调研只要几毛钱,消费级 AI 产品第一次算得过账
Segment 联创实测 gpt-5.6-luna:速度快、便宜到夸张。当推理成本从 1 美元降到 0.1 美元,AI 消费级产品的经济模型第一次成立,'快、便宜、够用'的模型需求即将起飞。
腾讯开源 Hy4 预览版:770B 参数的 MoE 模型,上下文超百万,还会自己优化自己
腾讯混元 Hy4 预览版正式开源:770B 总参数、49B 激活参数的 MoE 架构,上下文窗口超过 1M tokens,内部盲测略胜 GLM-5.3 与 Kimi K3,并首次展示了模型参与自身训练优化的递归自改进能力。
Qwen3.8-Max 发布:2.4T 参数,Max 级模型首次开源,10 天自主编程跑出 265 个提交
通义千问发布史上最强 Qwen3.8-Max:2.4T 参数(95B 激活),首次开源 Max 级模型权重,三个自主实验证明它能独立完成十天级编程、论文复现与竞赛夺冠。