AI Coding Assistant Data Extraction(AI 编程助手聊天记录统一提取)
2026/9/11大约 4 分钟
AI Coding Assistant Data Extraction(把 10 种 AI 编程助手的聊天记录统一提取成 JSONL)
📅 2026-09-11 创建 | 🏷️ 值得研究的仓库 | ⭐ ⭐386(7天爆发)
🔗 原文:https://github.com/kruzovic7/ai-data-extractor
是什么
开源 Python 工具集:把你自己的 AI 编程助手本地聊天记录——Claude Code、Codex CLI、Cursor、Windsurf、Aider、Cline/Roo Code 等 10 种工具——自动发现并统一提取成标准化的 JSONL 格式,用于微调、个人使用分析或历史备份,避免多年对话随应用缓存清空而丢失。
🔍 小白解读
先说几个词
- JSONL:每行一个 JSON 对象的文本格式,程序批量处理最喜欢的「一行一条」。
- 会话存储:每家 AI 编程工具把聊天记录藏在不同地方——有的存 JSONL 文件、有的塞进 SQLite 数据库、有的写 Markdown 笔记。好比每家银行的对账单格式都不一样。
- 微调(fine-tuning):拿自己的数据再训练模型,让它在你的场景里更专业。
- agent 轨迹:AI 编程助手干活的全过程记录——调了什么工具、改了哪些文件、结果如何。
这篇到底在说什么
你在 Claude Code、Cursor 这些工具里的全部对话——问过什么、AI 改了哪些文件、调用了什么工具——都存在你电脑本地,但各家格式五花八门,想统一拿出来分析或备份非常麻烦。这个项目把 10 种主流工具的存储位置全部摸清:自动适配 macOS/Linux/Windows 三平台的目录习惯(Application Support、.config、APPDATA 等),一键把它们全部抽成统一 JSONL。能提取的内容包括用户消息、AI 回复、代码上下文(文件路径、选区、片段)、diff、工具调用及结果、时间戳、模型名等。价值有三层:数据资产化(这些对话是宝贵的领域语料)、用量分析(团队 AI 使用画像)、以及防止换机/清缓存导致的历史丢失。
这跟普通人有什么关系
普通开发者可以一键备份自己与 AI 的全部工作对话;团队管理者可以第一次真正量化「大家到底怎么用 AI 编程」。
为什么值得架构师关注
- 企业级 AI 编程治理的基础设施工件:合规审计(哪些代码被外发)、效能度量(接受率、工具分布)、成本归因(模型用量)都需要统一的会话数据层——这个仓库给出了 10 家工具的存储位置地图,相当于免做一轮调研。
- 微调数据管线的起点:真实工作中的 agent 轨迹(工具调用 + diff + 结果)正是训练内部代码助手最值钱的语料形态。
- 边界清醒:只读提取本地数据;各家 schema 差异大(Windsurf/Trae 依赖启发式解析),接入数据仓库前需自行校验字段完整性。
核心内容
- 支持 10 种来源:Claude Code、Codex CLI、Cursor、Windsurf、Trae、Continue、Gemini CLI、OpenCode、Cline/Roo Code、Aider。
- 提取内容:用户/AI 消息、代码上下文(文件路径、选区、片段)、代码 diff、工具调用及结果、时间戳、session ID、项目路径、模型名。
- 自动适配 macOS/Linux/Windows 的存储目录约定,无需指定操作系统。
- 存储形态覆盖三类:JSONL 文件(Claude Code/Codex)、SQLite(Cursor/Windsurf/Trae)、JSON/Markdown(Continue/Gemini CLI/Aider)。
- 工程亮点:Cline/Roo Code 存的是原始 Anthropic 格式消息数组,其解析器可直接复用为接入新工具的模板;Aider 无中央数据库、仅 Markdown 转录的形态也被单独处理。
行动建议
团队落地路径:先在一台开发机验证提取覆盖率,再批量接入生成「AI 使用基线报告」;若计划用于微调,注意先做敏感信息清洗(可结合本期的 maskit 思路);纯备份用途可立即使用。