来源:HN (645pts)
URL: https://mvakde.github.io/blog/44-on-arc-1/
精读日期:2026-09-03
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • 作者在单张 RTX 5090 上从零训练一个小型 transformer,仅用 1.5 小时,在 ARC-AGI-1 公开评测上达到 44% 准确率,成本仅 67 美分。
  • 该成绩与 TRM/HRM 等模型持平,且优于许多 LLM,同时保持开源、更快、更好、更便宜。
  • 训练数据仅约 1000 个 puzzle(ARC-1 训练集),并额外加入经严格去重过滤的 ARC-2 非重叠任务(347 个新 puzzle),确保无数据泄漏。
  • 关键改进:不再训练输入 token(仅监督输出 token),使分数从 40% 提升至 44%,但作者承认不理解原因。
  • 最大性能贡献来自 3D RoPE 位置编码 + 每任务可学习 embedding;移除任一模块,分数骤降至约 24-25%。
  • 作者预测 65% 可在 transformer 框架内达到:多次运行的已解任务并集已达 55%,且许多任务“几乎被解出”。
  • 作者认为样本效率是当今 AI 最重要的问题,本工作旨在探索 transformer 在极少样本下的极限,并大幅降低迭代成本。

二、方法/架构拆解

  • 整体范式:测试时训练(test-time training)——在推理时,对每个 puzzle 的 train 集和 eval 集(隐藏标签)从零开始训练一个小型 transformer,进行自回归建模。
  • 输入表示:每个输入-输出对转换为 token 序列;每个 puzzle 分配独立的可学习加性 embedding 以支持跨任务学习;由于每个序列包含两个 2D 网格,位置编码采用 3D RoPE。
  • 数据增强:序列经颜色和二面体(dihedral)置换增强;推理时对测试输入做增强,对输出做逆变换,提交最常出现的 2 个输出(AAIVR 策略)。
  • 架构升级:SwiGLU 替代 GELU、RMSNorm 替代 LayerNorm、Flash Attention + varlen 训练、Flex Attention kernels 用于推理。
  • 优化器:使用 NorMuon(而非 AdamW 或 vanilla Muon),解决了 Muon 在训练后期 loss/分数停滞不收敛的问题。
  • 损失函数:仅计算输出 token 的损失(监督式),不训练输入 token;测试 loss 反而更差,但评测分数更高且更稳定。
  • 消融实验关键数字
  • 移除 3D RoPE 或每任务 embedding → 分数降至 ~24-25%
  • 训练输入 token → ~39%
  • 仅用 ARC-1 + ConceptARC 训练集 → ~40%
  • 3D RoPE 换 1D → ~24%
  • 移除每任务 embedding → ~24%
  • 每任务独立从零训练(无跨任务学习)→ ~18%
  • 数据泄漏控制:ARC-2 含 773 个 ARC-1 重复 puzzle,作者仔细过滤掉这些重复项,避免直接训练 ARC-2 导致 100% 分数的泄漏。

三、值得注意的局限/争议

作者承认的局限:

  • 作者不理解为何仅监督输出 token 比同时训练输入 token 效果更好(40% → 44%),推测与有限模型容量有关。
  • 作者“讨厌”使用数据增强,认为应设法移除,但挑战在于保持训练成本低廉。
  • 作者认为监督式训练在部分场景下可能不如无监督式,仍在评估中。
  • 作者承认测试时训练(在 eval puzzle 上训练)在传统 ML 视角下具争议性。

AI 判断的争议/局限:

  • “训练在测试集上”的争议:虽然作者强调未训练测试标签,但在 eval puzzle 的输入上训练仍可能泄露任务结构信息,这在统计学习理论(Vapnik 时代起)中即被讨论。ARC 作为元学习基准,其设计意图是测试泛化到新规则的能力,测试时训练可能削弱这一意图。
  • 评测可比性存疑:作者仅与“做类似测试时训练”的模型比较,未与纯前向推理的 LLM 或传统方法对比,44% 的“超越许多 LLM”结论可能被高估。
  • 成本计算口径:67 美分仅含单次 GPU 训练成本,未包含开发迭代、消融实验、多轮运行的累计成本。
  • 数据增强依赖:尽管作者声称“无增强也能保留大量性能”,但消融显示增强仍是达到 44% 的必要组件,其“讨厌增强”的立场与实际依赖存在张力。
  • 可扩展性未知:方法依赖每任务从零训练,推理时计算开销随 puzzle 数量线性增长,实际部署成本可能远超训练成本。

四、与 RRLab 研究的关联

  • Harness 工程:本文展示了“测试时训练”作为一种新型 harness 策略的可行性——在推理阶段动态适配模型。RRLab 可借鉴其 varlen Flash Attention、Flex Attention 等工程优化,构建更高效的推理 harness。
  • 多模型协同:作者通过“多次运行取并集”将分数从 44% 提升至 55%,暗示多模型集成/投票机制的有效性。RRLab 的多模型协同研究可参考其 AAIVR(取最常见输出)策略,探索更优的集成决策方案。
  • 模型评测:本文对 ARC 基准的评测方法论(数据泄漏控制、消融设计、成本核算)为 RRLab 的模型评测体系提供参考,尤其是“测试时训练”类方法的公平对比标准。
  • Agent 落地:ARC 的元学习特性(每任务新规则)与 Agent 在动态环境中的适应需求高度相似。RRLab 可探索将“测试时从零训练小模型”作为 Agent 的快速适应模块,降低对大规模预训练的依赖。
  • AI 原生产品:67 美分/1.5 小时的极低成本训练范式,为 AI 原生产品提供了“按需定制小模型”的可能性——用户数据到达后即时训练专用模型,而非依赖通用大模型。RRLab 可评估此模式在个性化推荐、代码生成等场景的落地潜力。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://mvakde.github.io/blog/44-on-arc-1/