Introducing System One Models and Jev(TypeSafe 发布 System One 模型类别与首个模型 Jev)
Introducing System One Models and Jev(TypeSafe 发布 System One 模型类别与首个模型 Jev)
📅 2026-09-15 | 🏷️ 模型发布 & 行业动态 | ⭐ HN 676分/216评论
🔗 原文:https://typesafe.ai/blog/introducing-system-one-models-and-jev
是什么
隐身两年的 TypeSafe AI(创始人 Diogo Almeida,前 OpenAI、其研究是 ChatGPT 背后方法的一部分)发布全新模型类别「System One Models」:专为软件直接消费的快速结构化决策而生。首个公开模型 Jev 今日开启早鸟访问,宣称在「系统一型任务」上智能水平对标现有 LLM,同时快两个数量级、因放弃字符串生成而「在类型层面不可能幻觉」。HN 当日 676 分、216 条评论,是本周 AI 圈最大争议话题。
🔍 小白解读
先说几个词
- 系统一/系统二:心理学的双加工理论——系统一是快速直觉反应,系统二是慢速深思。现有 LLM 是「系统二」(逐字生成长答案),Jev 想做「系统一」(秒出判断)。
- 自回归生成 vs 并行采样:LLM 像逐字写作文,写完才知道说了啥;Jev 像一张卷子上的选择题,所有选项的概率一次算完。
- 结构化输出/类型安全:输出必须是事先定义好的字段和类型,不可能出现「格式不合法」——像插座只允许特定形状的插头。
- 校准概率:模型说「90% 把握」时真有九成正确率。普通 LLM 自报的置信度经常虚高。
- RLCD(校准决策强化学习):TypeSafe 自创的训练方法,奖励的不是「人爱看的话」,而是「校准良好的判断」。
这篇到底在说什么
创始人抛出的核心问题是:聊天模型已经超人好几年了,为什么自动化还是没爆发?他的答案:让软件消费「一篇文章」太费劲——要解析、要校验、还可能被骗(幻觉),而且等旗舰模型 3 到 329 秒才回话,塞进代码里就是瓶颈。System One 模型反着来:输入非结构化状态,输出带概率的类型安全决策值;不逐字生成,一次查询并行产出全部输出;每个答案自带校准置信度,置信度与正确率真实挂钩。官方给的数字:端到端 70–500ms(对同类任务比前沿 LLM 快 40–200 倍),输入 $0.042/百万 token、输出免费;配套发布了一种新评测「workflow evals」——假设业务流程里存在一个正确的计算图,拿最强外部模型(Astra、Fable)的预测均值当参照系,Jev 在近两个数量级范围独占帕累托前沿。适用场景也被划得很清楚:分类、路由、打分、抽取这类「智能 if 语句」,海量数据的 map-reduce,实时交互,以及给 LLM 输出做校验/守栏/越狱检测。作者自己也没把话说满:速度是 laptop 实测、定价可能有补贴、所谓「不可能幻觉」只是「类型层面不会错」的数学陈述——判断内容对不对仍取决于训练。
这跟普通人有什么关系
你用的 App 里那些「秒级智能」环节——风控拦截、消息分类、工单分派——未来可能都换成这类决策模型,响应更快、误报更少;而对写代码的人,这是继「LLM API」之后一种全新的可组合智能组件。
为什么值得架构师关注
- 新组件类型进入选型池:LLM 一直在「当数据库用」「当搜索引擎用」之间挣扎,Jev 直接定义了「工作流模糊决策层」——分类/路由/打分场景值得立刻做 PoC 对比。
- 成本与延迟量级变化:70–500ms + 输出免费,让「每个请求都过一次智能判断」从成本禁区变成默认选项;可能改写实时链路的架构假设。
- 置信度驱动的容错设计:输出自带校准概率意味着降级策略可以按置信度分流(高置信自动执行、低置信转人工),比现在的「全靠人审或全靠赌」精细得多。
核心内容
- 新模型类别 System One:输入非结构化状态、输出类型安全的结构化决策;放弃字符串生成,换取并行采样、类型级无幻觉、输出附校准概率。
- 首个模型 Jev 性能主张:与 LLM 同等智能(系统一型任务),端到端 70–500ms(快 40–200 倍),输入 $0.042/MTok、输出免费;训练方法是自研的 RLCD。
- 新评测「workflow evals」:以真实业务计算图为底、以最强外部模型(Astra/Fable)预测均值为参照,Jev 在约两个数量级上独占帕累托前沿;另附与 GPT-5.6 Terra(默认推理档)的并排演示对比。
- 官方自列的证据边界:速度为西海岸笔记本实测、定价可持续性待时间验证、「不可能幻觉」仅指类型层面;首个模型 Jev 即日起早鸟访问。
- 目标场景:AI 工作流(分类/路由/打分/抽取/分支)、大数据 map-reduce 特征化、实时应用、LLM 输出的验证/守栏/越狱检测。
行动建议
值得动手验证而非围观:列出系统里 3–5 个「高频小决策」环节(路由、分类、打分、守栏),申请早鸟资格,用真实流量做延迟/准确率/成本三线对比——重点压测「校准概率」在自家数据上是否真校准。同时保持清醒:这是初创公司的自述数据,独立复现与价格稳定性都是未知数,不影响现有 LLM 选型,先做旁路试点。