Mercury 2.5 LLM hits 770 tokens per second(Mercury 2.5 大模型推理速度达每秒 770 token)
Mercury 2.5 LLM hits 770 tokens per second(Mercury 2.5 大模型推理速度达每秒 770 token)
📅 2026-09-23 | 🏷️ 工程 & Agent | ⭐ HN 146分/89评论
🔗 原文:https://artificialanalysis.ai/models/mercury-2-5
💬 讨论:https://news.ycombinator.com/item?id=49823348
是什么
第三方模型评测平台 Artificial Analysis 的 Mercury 2.5 模型页面显示,该模型推理速度达到每秒 770 token。据公开资料,Mercury 系列采用扩散式(diffusion)文本生成路线,与主流逐 token 生成的自回归架构不同。该数据在 Hacker News 上获得 146 分、89 条评论。
🔍 小白解读
先说几个词
- Token:模型处理文字的最小单位, 大约一个词或半个词。模型生成回答就像打字员一个字一个字往外敲,token/秒就是"打字速度"。
- 自回归生成:主流模型的生成方式,一个 token 接一个 token 顺序输出,后一个依赖前一个。像传话游戏,必须一个个往下传。
- 扩散式生成(Diffusion):先出一版粗糙的"整段草稿",再逐步精修。类似画家先铺大色块再细化细节,可以大面积并行处理,而非逐字推进。
- 推理吞吐:单位时间内模型能吐出多少 token。吞吐越高,同样时间能服务的请求越多、单个请求等待越短。
这篇到底在说什么
据 Artificial Analysis 的评测页,Mercury 2.5 的推理速度达到了 770 tokens per second。为什么这个数字值得看?因为主流模型是自回归的,一个字一个字往外蹦,速度有天然上限;而据公开资料,Mercury 走的是扩散式路线,可以并行解码,天生适合"一次处理一大块"。打个比方:自回归像一个人抄书写,扩散式像一群人分工同时抄不同段落——后者的速度天花板高得多。770 token/秒是第三方平台测得的速度数据,实际效果以原文评测为准。HN 上 89 条评论说明大家对"另一种生成架构能不能打"这个话题分歧和兴趣都不小。
这跟普通人有什么关系
生成速度直接决定你用 AI 时"等答案"的时长。如果高吞吐模型成熟,AI 助手回答更快、批量任务更便宜,用 AI 干活的体验会明显变顺滑,按量计费的成本也可能随之下降。
为什么值得架构师关注
对 agent 系统来说,推理吞吐直接影响循环延迟与成本结构:一个 agent 任务往往包含几十次模型调用,每次省几百毫秒,端到端就是量级差异。扩散式并行解码提供了与自回归不同的吞吐/成本曲线,在批量文档处理、高频 agent 调用等对延迟敏感的场景,值得作为选型对比项纳入评估——注意在质量与速度之间做实测权衡,而不是只看 tok/s 数字。
核心内容
- 据 Artificial Analysis 模型页,Mercury 2.5 推理速度达 770 tokens per second(第三方平台实测口径)。
- 据公开资料,Mercury 是扩散式(diffusion)文本生成路线的大模型,采用并行解码而非逐 token 自回归。
- 数据来源为第三方评测平台 Artificial Analysis 的模型页面,非厂商自述。
- 社区热度:HN 146 分 / 89 条评论。
行动建议
若你的业务存在高吞吐需求(批量内容生成、高频 agent 调用),建议把扩散式模型纳入候选对比:用真实业务 prompt 实测质量与速度,评估其在成本结构上的差异。单一速度指标不足以做选型决策。