Training a 3.8B LLM to 0.384 CORE for $998(998 美元训练 3.8B 小模型)
2026/9/10大约 3 分钟
Training a 3.8B LLM to 0.384 CORE for $998(998 美元训练 3.8B 小模型)
📅 2026-09-10 | 🏷️ 工程 & Agent | ⭐ HN 110 分/18 评论
🔗 原文:https://hugovergnes.github.io/little-lm-3-8b/
是什么
一位独立开发者发布博客,记录了只花 998 美元把一个 3.8B 参数的语言模型训练到 0.384 CORE 分的全过程。这是把「自己训一个语言模型要多少钱」从玄学变成可查账单的实践样本。
🔍 小白解读
先说几个词
- 3.8B 参数:模型大脑里「旋钮」的数量,38 亿个。参数越多通常越聪明,但也越贵。3.8B 属于能在单张消费级/工作站显卡上跑的小模型。
- CORE 分:学界(DCLM/DataComp-LM 一系工作)常用的预训练质量综合指标,把模型在多个下游任务上的表现聚合成一个分数,专门用来横向比较不同「训练配方」的效率,而不是只看单一榜单。
- 预训练:让模型「读完整座图书馆」形成基础能力的阶段,是训练成本的大头。
- 训练配方(Recipe):数据配比、训练顺序、超参数的总和。同样的钱,配方不同,效果天差地别。
这篇到底在说什么
打个比方:大家都在比谁的车贵,这位博主直接公开了「一万美元以内组装一辆能上路的车」的全套购物清单和调校记录。998 美元、3.8B 参数、0.384 CORE——三个数字连起来是一句话:在公开数据和高效率配方下,训练一个有基础通用能力的小模型,成本已经低到个人和小公司可以亲自下场。HN 上 110 分、18 条评论,讨论集中在成本构成与该分数的参照系。
这跟普通人有什么关系
对中小公司来说,「用 AI」之外多了「训 AI」的选项:如果业务数据足够独特,花小几千美元做一个贴身小模型,可能比调用大模型 API 更便宜、更可控。
为什么值得架构师关注
- 成本锚点:998 美元 / 0.384 CORE 是一个罕见的公开「单价」数据点。做「微调 vs 自训 vs 调 API」的成本模型时,这是可以直接引用的锚。
- 配方 > 规模的证据链:近年 DCLM 等研究反复证明数据质量与配比对 CORE 分的杠杆作用,本篇是该结论在极小预算下的再次落地——这直接影响「要不要为涨点买十倍算力」的决策。
- 团队技能校准:千美元级实验意味着训练实验的试错成本进入团队年度预算可承受范围,值得安排一次端到端复现演练来积累数据工程能力。
核心内容
- 模型规模 3.8B 参数,最终成绩 0.384 CORE 分,总花费 998 美元(缓存数据:博客标题)。
- 全过程以博客形式公开(数据、训练细节见原文,缓存未含更细的分项成本)。
- HN 讨论 110 分/18 评论,热度集中于成本可行性与 CORE 分参照系(缓存数据:HN 帖)。
行动建议
论文/实践类:对「私有领域小模型」有兴趣的团队,值得完整读原文并核对成本分项,评估把内部 1-2 个数据密集型场景(如垂直领域分类、结构化抽取)改为小模型自训路线的可行性;通用能力需求仍走大模型 API,两者是互补而非替代。