如何从 Cursor、Claude 和 Windsurf 提取所有 AI 聊天记录
如果你在过去一两年里一直在使用 AI 助手编写代码,磁盘上会积累数 GB 的隐藏上下文。这包括数百次对话、调试会话、生成的差异补丁、编辑内容和上下文片段。问题在于每个工具都将这些数据隐藏在各自的角落。Cursor 将历史记录存储在 SQLite 数据库中,Claude Code 写入单独的 JSONL 会话文件,而 Continue 和 Gemini CLI 则将所有内容保存在深层系统文件夹中。
开发者 0xSero 的 ai-Data-extraction 仓库解决了一个简单的问题:它能找到所有本地助手数据库,解析它们,并以统一的 JSONL 格式导出一个干净的数据集。
为什么要提取这些数据
主要原因是微调你自己的模型。当开发者为他们的技术栈调优 Qwen2.5-Coder 或 DeepSeek-Coder 等开源模型时,合成数据集往往不够用。你与助手的真实对话包含独特的数据:你如何准确地表述任务、你修复了哪些错误、你将哪些文件传入上下文,以及你实际接受了哪些编辑选项。
第二个原因更实用:简单的备份和本地搜索。在 Cursor 或 Trae 界面中查找三个月前的会话可能很困难,尤其是项目已关闭或迁移的情况下。
脚本集合能做什么
该项目是一组小型 Python 脚本。一个不错的细节是:没有外部依赖。你只需要标准的 Python 3.6+,脚本使用内置模块 sqlite3、json、pathlib 和 os。
该套件支持八种流行工具:
- Cursor(包括旧版聊天版本、Composer v1 和 v2 以及表
cursorDiskKV) - Claude Code 和 Claude Desktop
- Windsurf
- Trae
- Continue
- OpenCode(桌面 Tauri 版本和 CLI)
- Google Gemini CLI
- Codex
脚本自动检测操作系统(macOS、Linux 或 Windows),定位编辑器的工
相关项目