>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
Python

如何从 Cursor、Claude 和 Windsurf 提取所有 AI 聊天记录

如果你在过去一两年里一直在使用 AI 助手编写代码,磁盘上会积累数 GB 的隐藏上下文。这包括数百次对话、调试会话、生成的差异补丁、编辑内容和上下文片段。问题在于每个工具都将这些数据隐藏在各自的角落。Cursor 将历史记录存储在 SQLite 数据库中,Claude Code 写入单独的 JSONL 会话文件,而 Continue 和 Gemini CLI 则将所有内容保存在深层系统文件夹中。

开发者 0xSero 的 ai-Data-extraction 仓库解决了一个简单的问题:它能找到所有本地助手数据库,解析它们,并以统一的 JSONL 格式导出一个干净的数据集。

为什么要提取这些数据

主要原因是微调你自己的模型。当开发者为他们的技术栈调优 Qwen2.5-Coder 或 DeepSeek-Coder 等开源模型时,合成数据集往往不够用。你与助手的真实对话包含独特的数据:你如何准确地表述任务、你修复了哪些错误、你将哪些文件传入上下文,以及你实际接受了哪些编辑选项。

第二个原因更实用:简单的备份和本地搜索。在 Cursor 或 Trae 界面中查找三个月前的会话可能很困难,尤其是项目已关闭或迁移的情况下。

脚本集合能做什么

该项目是一组小型 Python 脚本。一个不错的细节是:没有外部依赖。你只需要标准的 Python 3.6+,脚本使用内置模块 sqlite3jsonpathlibos

该套件支持八种流行工具:

  • Cursor(包括旧版聊天版本、Composer v1 和 v2 以及表 cursorDiskKV
  • Claude Code 和 Claude Desktop
  • Windsurf
  • Trae
  • Continue
  • OpenCode(桌面 Tauri 版本和 CLI)
  • Google Gemini CLI
  • Codex

脚本自动检测操作系统(macOS、Linux 或 Windows),定位编辑器的工

相关项目