reverify — Stop your AI from making things up(reverify:让 AI 不再胡编,确定性工具来裁决)
2026/9/6大约 4 分钟
reverify — Stop your AI from making things up(reverify:让 AI 不再胡编,确定性工具来裁决)
📅 2026-09-06 | 🏷️ 值得研究的仓库 | ⭐ 923(7天爆发窗口)· Python
🔗 原文:https://github.com/2akouwu/reverify
是什么
一个刚发布一周就冲到 923 star 的开源项目,定位是「别让你的 AI 编造事实」:它把智能体的工作流切成两半——模型只负责提议(propose),而由确定性工具(deterministic tools)负责裁决(decide)。AI 产出的每一条声明都要对照 ground truth(基准真值)逐一检验并保留证据;经过验证的事实与上下文可以在会话重置后继续存活。项目提供 MCP server 和 CLI 两种接入形态,并以逆向工程作为主打验证场景(proving ground)。
🔍 小白解读
先说几个词
- 幻觉(hallucination):AI 一本正经地说假话——编造不存在的函数、报错信息或结论,语气还特别自信。
- ground truth(基准真值):拿铁证对答案。不是问 AI「对不对」,而是查数据库、跑测试、看真实文件,用事实说话。
- 确定性工具:同样的输入永远得到同样输出的程序(比如脚本、查询引擎),不像大模型每次回答都可能不一样。好比计算器 vs 一个爱蒙答案的学生。
- MCP(Model Context Protocol):让大模型应用连接外部工具/数据的标准协议,类似 AI 世界的 USB 接口。
- 逆向工程:拿到一个软件或协议,反过来分析它内部是怎么工作的——AI 特别容易在这种「没有标准答案」的场景里瞎猜。
这篇到底在说什么
打个比方:现在的 AI 像一个特别自信的实习生,让他调查一件事,他会把「查到的」和「自己脑补的」混在一起汇报给你。reverify 的做法是给这位实习生配一位一丝不苟的审核员:实习生只能提想法,每一条「我发现了 XX」的说法,都必须由审核员去现场核实、盖章留底,没证据的说法不许进报告。而且核实过的结论会记在正式台账上,就算实习生换班(会话重置),台账还在,下一班接着用。项目选了逆向工程作为第一个「考场」,因为那是最容易瞎编、也最容易验证真伪的场景。上线一周 923 颗 star,说明「治幻觉」的需求相当旺盛。
这跟普通人有什么关系
用 AI 查资料、写分析报告最怕的就是被「一本正经的胡说」坑。这种「提议与验证分离」的思路意味着未来的 AI 工具会自带事实核查,输出更可信;对小团队来说,也意味着可以用便宜模型干活、用确定性校验兜底,而不必迷信更贵的模型。
为什么值得架构师关注
- 幻觉治理的架构化路径:把「生成」与「验证」解耦成独立组件,验证环节用确定性代码实现——这是可以写进架构规范的模式,比「换个更强模型」更可控、更可审计。
- 证据链即审计:每条声明对照 ground truth 并保留 evidence,天然满足合规与事后追责需求,适合金融/医疗等强审计场景。
- MCP 生态集成成本低:提供 MCP server + CLI 双形态,主流 agent 框架可直连,试点成本低。
- 状态持久化:经验证的事实与上下文跨会话存活,缓解 agent 长任务中的「记忆清零」问题。
核心内容
- 核心原则:模型 propose,确定性工具 decide——每条声明对照 ground truth 验证并附带证据(据仓库描述)。
- 状态管理:经过验证的事实与上下文在会话重置后依然存活(grounded facts and context survive resets)。
- 接入形态:MCP server + CLI,Python 实现。
- 主打场景:逆向工程(proving ground)——无标准答案、高瞎猜风险的领域。
- 热度信号:⭐923,创建于 2026-08-31,7 天爆发窗口。
行动建议
- 评估试用:在自家 agent 的输出侧加一道 reverify 式校验(先从有明确 ground truth 的场景入手:数据库状态、接口返回、文件内容),测量幻觉拦截率与误报率。
- 架构参考:即使不用该项目,其「提议/裁决分离 + 证据留存」的结构也值得抄进内部设计文档。
- 了解即可:不做 agent 落地的团队,可将其视为「AI 输出可信度工程化」趋势的风向标。