来源:HN (107pts)
URL: https://hugovergnes.github.io/little-lm-3-8b/
精读日期:2026-09-11
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • 个人以约 $998 预算训练出 3.8B 参数 LLM,CORE 得分 0.384,超过同价位 nanochat 的 $1,000 配置。
  • 训练总耗时 35.9 小时(含约 7% 用于 CORE 评估),稳态吞吐约 480,000 tokens/sec,共处理 57.3B tokens。
  • 早期失败案例:858M Llama 在 FineWeb-Edu 上训练 16.4B tokens、单卡 A100 耗时 5.8 天,结果仍差于 2019 年的 GPT-2 124M(后者约 63%),生成重复且近乎无意义。
  • 关键改进带来显著提升:Muon 优化器 + 动态 tensorwise FP8 缩放 + 词表 padding 至 50,304(64 的倍数),合计吞吐 +33%,主要来自 FP8。
  • 上下文长度从 2048 提升后 CORE 得分明显改善,差距主要来自上下文依赖型任务。
  • 硬件对比:同代码 150M 模型 FP8 下,RTX 5090 为 184,662 tok/s,B200 为 477,440 tok/s,纯硬件带来 2.59× 提升。
  • 优化器 master weights 用 bf16 替代 fp32,VRAM 降低 27%,吞吐从 640K 提升至 1.4M tok/s(2.2×),CORE 仅从 0.23 降至 0.22(4000 步时)。

二、方法/架构拆解

  • 框架:little-lm,配置驱动(YAML 指定 model/dataset/optimizer/schedule/callbacks),组件自注册到全局 registry,按名解析,换优化器或数据集只需一行配置。
  • 模型架构:Llama 风格,含 RMSNorm、RoPE、GQA(24 query heads / 8 KV heads)、relu² MLP、QK-norm、logit softcap、逐层可学习残差标量、ResFormer 风格 value embeddings(占参数量 19%,14 张表)。
  • 训练配置:Muon 用于矩阵参数,AdamW 用于其余;warmup 5%,flat 后线性 cooldown 至峰值 5%;FP8 三处 GEMM 动态 tensorwise scaling;词表 50,257→50,304;fused linear cross-entropy;文档边界 masking 用 flex attention。
  • 分布式:纯 DistributedDataParallel,3.8B 单节点下梯度通信非瓶颈,无需 sharded-optimizer。
  • 数据:FineWeb-Edu,本地下载 shard 避免网络等待。
  • 评估:CORE 基准,每次约 15 分钟,全程 10 次,占总时间 7%。
  • 硬件:调试在 RTX 5090,训练在租用 B200。

三、值得注意的局限/争议

  • 作者承认
  • 早期 858M 运行学习率 2.5e-4 偏低,最后 30% 计算预算几乎无产出,曲线在约 70% 步数后完全平坦。
  • FineWeb-Edu “不错但非最佳可用”。
  • SwiGLU 中间比率 2.75 不能迁移到 relu²,非门控需用 4×,否则学习明显变差。
  • bf16 master weights 有真实但较小的质量代价(CORE 0.22 vs 0.23)。
  • 仍存在“我还不知道”的部分。
  • AI 判断
  • 单次运行、单一基准 CORE,缺乏多基准与多次重复的统计稳健性。
  • $998 成本口径未明确是否含调试用 5090 与失败运行,实际总投入可能更高。
  • 与 nanochat 对比基于不同配置,公平性需谨慎看待。
  • 文档边界 masking 描述在正文中被截断,实现细节不完整。

四、与 RRLab 研究的关联

  • Harness 工程:little-lm 的 YAML 驱动 + 组件自注册 registry 是典型 harness 设计,实验以“三行 YAML diff”表达而非开分支,可直接借鉴到 RRLab 的实验管理与可复现性建设。
  • 多模型协同:文中提到 Claude 因 6% 性能下降快速否决某优化,但该优化换来 8GB VRAM 从而增大 micro-batch,提示多模型/多信号协同决策时需综合权衡而非单指标否决。
  • 模型评测:CORE 评估占总时间 7%、单次 15 分钟,说明评测开销在预算敏感场景下不可忽视;上下文长度对上下文依赖型任务得分影响显著,评测设计需控制该变量。
  • Agent 落地:配置驱动、无隐藏机制、可读配置即知全流程的 infra 理念,适合 Agent 系统的可观测性与可替换性设计。
  • AI 原生产品:$1,000 级别训练出可用小模型,为低成本垂直模型/边缘部署提供数据点;“capability per dollar”视角下 dtype 处理等被低估的杠杆值得产品化关注。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://hugovergnes.github.io/little-lm-3-8b/