From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix(从生产流量到后训练:打造覆盖企业请求全集的自托管 LLM)
2026/9/3大约 3 分钟
From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix(从生产流量到后训练:打造覆盖企业请求全集的自托管 LLM)
📅 2026-09(arXiv 2609.01572) | 🏷️ 🧠 前沿论文 | ⭐ HF upvotes 31
🔗 原文:https://huggingface.co/papers/2609.01572
是什么
一篇企业一手实践论文:在数据驻留(data-residency)约束必须自托管 LLM 的前提下,作者团队面对"新模型持续上线、旧模型不退役、GPU 池被撕裂"的困境,将200+ 内部应用的流量整合到单一自托管模型上。方法是先做生产错误分析定位质量差距,再沿三个轴线(指令遵循、function-calling、内部任务分布)做定向后训练补齐,并用分层评测持续跟踪质量。
为什么值得架构师关注
这是"企业 LLM 舰队治理"命题上少见的公开一手案例。自托管企业几乎必然滑向"一个应用一个模型"的碎片化:GPU 分散、运维翻倍、每个模型的评测体系各自为政。本文给出的整合路径——用生产流量分布定义评测集、用确定性验证器 + 校准 LLM judge 打分、按差距做定向后训练——是一套可直接抄的工程方法论,回答了 CIO 级的问题:能不能把 20 个模型砍成 1 个,凭什么敢砍。
核心内容
- 问题定义真实:数据驻留强制自托管;新模型只增不减导致 serving 舰队膨胀,有限 GPU 池碎片化——这是所有自托管企业的共同轨迹。
- 流量整合规模:200+ 内部应用的请求混合(request mix)收敛到单一模型,而非按业务线各养一个。
- 三轴质量补齐:通过生产错误分析沿指令遵循、function-calling、内部任务分布三条轴线做定向后训练,而不是盲目全量微调。
- 评测即治理:离线 benchmark 按生产流量分层构造,用确定性验证器或校准过的 LLM judge 打分——质量度量对齐真实负载,而非通用榜。
行动建议
- 若组织内自托管模型已超过 3 个,立项"模型整合"评估:先统计各模型的流量分布重叠度,重叠高的对先做合并 PoC。
- 直接采用其评测设计:从生产日志采样构建分层评测集(按任务类型/难度分层),避免用通用 benchmark 指导内部决策。
- 整合路线的关键前置是"生产错误分析"管线(错误聚类→轴归因),建议先建该管线再谈后训练投入。