Jev in 25 Lines of Python(用 25 行 Python 实现 Jev 决策模型核心)
Jev in 25 Lines of Python(用 25 行 Python 实现 Jev 决策模型核心)
📅 2026-09-23 | 🏷️ 工程 & Agent | ⭐ HN 629分/197评论
🔗 原文:https://www.nobodywho.ai/posts/jev-in-25-lines/
是什么
一篇 Hacker News 上拿到 629 分、197 条评论的技术博文,只用 25 行 Python 就实现了 Jev 式类型化决策模型的核心。它想回答的问题很简单:这一周火遍 Agent 工程圈的「小决策模型」范式,到底有多少真实的技术含量?
🔍 小白解读
先说几个词
- 系统一/系统二:心理学说法。系统一是快而不假思索的直觉判断,系统二是慢而深入的思考。Jev 这类小模型扮演系统一,大模型扮演系统二。
- 类型化决策:让模型只输出固定格式的判断,比如「选了哪个选项、打几分」,而不是自由发挥一大段话。就像考试只填答题卡,不用写作文。
- 概率校准:模型说自己 80% 有把握时,事情真的八成会发生。就像体温计不能明明不烧却显示 39 度。
- agent 循环:AI 助手自主干活时「想一步、做一步、再看结果」的循环流程,每一步都可能要做很多小判断。
这篇到底在说什么
09-22 简报报道过 Jev 生态爆发中的 jev-review(分阶段代码评审);今天的 629 分热帖更进一步:它直接把这个范式的核心压缩到 25 行 Python 里,证明「小决策模型」并不是什么神秘黑科技。打个比方:大模型像请了一位专家顾问,每问一句话都要付高额咨询费;而 Jev 这类小模型像一张提前印好的判断清单,遇到常见情况照单勾选,又快又便宜。背后是两个公认的技术常识在支撑:一是把输出约束成固定类型,模型就很难胡说;二是做概率校准,让模型「知道自己不知道」。本周生态也在井喷:JevBench 提供了可复现基准(https://benchmarkheaven.com/jev-models ,HN 139 分),Nokia Applied Research 开源了 AnyJev 仓库(https://github.com/nokia-applied-research/AnyJev ,384 星),官方描述是「Turn any LLM into a Jev-style decision model: typed decisions, real probabilities, no training」。一个范式一周内同时长出应用、基准和工具,说明它踩中了真实需求。
这跟普通人有什么关系
你用的 AI 助手以后会更快更便宜,因为它不会事事都去请示大模型,只在真正需要深思时才升级。省下的算力成本,最终会体现在你付的订阅费里。
为什么值得架构师关注
LLM 每步推理又贵又慢,而 agent 循环里大量判断其实是低复杂度决策。把「大模型管推理、小模型管判断」做成成本分层,能显著压低 token 开销和响应延迟。25 行就能复现核心,意味着引入门槛极低、试错成本低;但概率校准的质量决定了分层后判断会不会跑偏,这是要重点评估的风险点。
核心内容
- 25 行 Python 复现 Jev 式类型化决策核心,说明范式本质是「输出类型约束 + 概率校准」的工程组合,而非重型模型。
- Jev 是 TypeSafe AI 的「系统一」模型,输出 Choice/Score/Noul 等带校准概率的类型化决策。
- 生态井喷:JevBench 可复现基准(HN 139 分)+ Nokia AnyJev 仓库(384 星,无需训练即可把 LLM 变成 Jev 式决策模型)。
- 成本分层架构:agent 循环中高频小判断交给廉价小模型,低频深推理留给大模型。
行动建议
读原文和 HN 讨论(https://news.ycombinator.com/item?id=49812769),评估自己 agent 链路里哪些环节可替换为类型化小决策;先在低风险场景(如意图分类、路由分发)试点,再用 JevBench 类基准验证校准质量,最后再谈推广。