来源:HN (350pts)
URL: https://mvakde.github.io/blog/44-on-arc-1/
精读日期:2026-09-02
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- 作者在单张 NVIDIA RTX 5090 上,用 1.5 小时从零训练一个小型 transformer,在 ARC-AGI-1 公开评测集上达到 44% 准确率,成本仅 67 美分。
- 该成绩与 TRM/HRM 持平,且优于许多大型语言模型(LLM),同时更快、更好、更便宜,并保持开源。
- 作者认为样本效率(sample efficiency)是当前 AI 最重要的研究问题,本工作旨在探索 transformer 在极少样本(仅 1000 个谜题)下的性能极限,并大幅降低迭代成本。
- 关键改进之一:不再训练输入 token,仅对输出 token 计算损失(转为监督式),使分数从 40% 提升至 44%,但作者承认不理解其原因。
- 通过严格过滤 ARC-2 中重复的 773 个 ARC-1 谜题,避免数据泄漏,额外加入 347 个新任务,使分数提升至 44%;若移除该数据,分数约 40%,但需约双倍计算量。
- 消融实验显示:移除 3D RoPE 或每任务嵌入(per-task embedding)会使分数骤降至约 24%;切换为 1D RoPE 同样降至约 24%;采用无监督训练风格则降至约 18%。
- 作者预测,在不增加训练数据的前提下,通过架构优化(如 PoPE 替代 RoPE、进一步现代化架构、手工 GPU 代码降本 10 倍),达到 65% 分数是可行的。
二、方法/架构拆解
- 数据集与基准:
- 使用 ARC-AGI-1 公开评测集(ARC-1),训练集仅含 1000 个谜题,每个谜题包含若干输入-输出对(网格)。
- 额外引入 ARC-2 中 347 个非重叠任务(严格过滤掉 773 个重复谜题,确保无泄漏)。
- 基准为 ARC-1 公开评测,仅与采用类似测试时训练(test-time training)方法的模型对比。
- 模型架构:
- 小型 transformer,从零训练,采用现代架构组件:SwiGLU 激活函数(替代 GELU)、RMSNorm(替代 LayerNorm)。
- 每个输入-输出对转换为 token 序列,模型以自回归方式训练。
- 每个谜题分配一个独立的可学习加法嵌入(per-task embedding),以支持跨任务学习。
- 位置编码采用 3D RoPE(旋转位置编码),适配 2D 网格的序列结构(每个序列含两个 2D 网格)。
- 训练与推理策略:
- 训练时仅对输出 token 计算损失(监督式),不训练输入 token,性能更优且更稳定。
- 数据增强:对序列应用颜色(color)和二面体群(dihedral)置换;推理时对测试输入做增强,并对输出做逆变换,提交最常出现的 2 个输出(AAIVR 策略)。
- 使用 flash attention 支持变长序列训练(varlen training),推理时采用 flex attention 内核加速。
- 优化器:采用 NorMuon(归一化 Muon),解决了 vanilla Muon 在训练后期损失和分数停滞不收敛的问题;相比 AdamW 训练速度显著更快。
- 关键消融结果:
- 3D RoPE + per-task embedding 是最大性能贡献者,移除任一即饱和于 25%。
- 训练输入 token 使分数降至约 39%。
- 仅用 ARC-1 + ConceptARC 训练集,分数约 40%。
- 无监督训练风格(每任务独立从零训练)降至约 18%。
三、值得注意的局限/争议
- 作者承认的局限:
- 不理解为何仅训练输出 token(监督式)比训练输入+输出(无监督式)效果更好(40% → 44%),推测与有限模型容量有关。
- 测试损失反而更差,但评测分数更高,存在“损失-分数不一致”现象,作者认为这挑战了“最小化验证损失”的常见样本效率优化目标。
- 依赖数据增强(颜色/二面体置换),作者明确表示“讨厌使用它”,并希望未来能移除,但需保持训练成本可控。
- 训练数据中加入了 ARC-2 的 347 个任务,虽严格过滤避免泄漏,但作者承认若不喜欢可移除,分数会降至约 40% 且需双倍计算量。
- AI 判断的潜在争议:
- 测试时训练(在 eval 谜题上训练,即使不训练标签)可能被视为“训练在测试集上”,作者反驳称 ARC 是元学习基准,训练 eval 输入是标准做法,且标签完全隐藏;但该做法在传统监督学习范式下仍可能引发泛化性质疑。
- 评测仅对比“类似测试时训练”的模型,未与纯零样本(无测试时训练)的 LLM 或专用 ARC 方法对比,可能高估相对优势。
- 分数 44% 虽高于许多 LLM,但 ARC-AGI-1 基准的“未饱和”性(作者自述)意味着仍有大量空间,且 65% 目标为作者预测,未经实证验证。
- 依赖单张 5090 GPU 和 1.5 小时训练,虽成本极低,但可复现性依赖特定硬件(RTX 5090),且代码开源但未提及跨平台兼容性。
四、与 RRLab 研究的关联
- Harness 工程:
- 作者强调“测试时训练”和“数据增强+逆变换”的推理管线,与 RRLab 的 Harness 工程可借鉴:设计灵活的测试时训练框架,支持从零训练小模型、动态增强与投票策略(AAIVR),可集成到多模型评测 Harness 中。
- 成本控制(67 美分/1.5 小时)展示了极低资源下的迭代模式,RRLab 可参考其“低成本快速实验”的 Harness 设计哲学。
- 多模型协同:
- 作者提到“取多次运行的已解任务并集可达 55%”,暗示多模型集成(不同随机种子/初始化)可提升整体性能。RRLab 的多模型协同研究可借鉴此“集成投票”策略,探索小模型集合 vs 单一大模型的性价比。
- 模型评测:
- 作者对“损失-分数不一致”的观察(测试损失更差但分数更高)对 RRLab 的模型评测体系有启示:评测指标不应仅依赖损失,需结合任务级准确率、样本效率等多维度评估。
- 消融实验方法论(逐步移除组件并记录分数)可作为 RRLab 评测基准的参考,强调“表示学习”(如 3D RoPE + per-task embedding)对性能的关键影响。
- Agent 落地:
- 测试时训练范式(在推理时快速适应新任务)与 Agent 的在线学习场景高度相关。RRLab 的 Agent 落地可借鉴此思路:在 Agent 执行任务时,利用少量示例进行快速微调或上下文适应,提升泛化能力。
- 低训练成本(1.5 小时)使得在边缘设备或实时场景中部署“从零训练”的模型成为可能,为 Agent 的个性化适配提供新路径。
- AI 原生产品:
- 作者强调“样本效率是 AI 最重要问题”,并展示小模型在特定基准上超越 LLM 的可能性。RRLab 的 AI 原生产品可探索“小而专”的模型策略:针对特定领域(如 ARC 类推理任务)训练轻量模型,替代通用大模型,降低成本并提升响应速度。
- 开源代码和低成本复现路径(单 GPU)为 RRLab 提供了可快速验证的基线,可用于内部工具链的基准测试和产品原型验证。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://mvakde.github.io/blog/44-on-arc-1/