如何利用 LLM Zoomcamp 在自有数据上构建对话式 AI 助手
去年我尝试构建一个用于搜索内部文档的 RAG 系统。当时看起来只需要把文件发送给 OpenAI API 然后输出答案就行了。但在实际应用中,情况完全不同:模型经常产生幻觉,文本无法塞进上下文窗口,而且常规的向量搜索在处理技术术语和缩写时总是出错。
如果你也遇到过类似的问题,不妨看看 DataTalksClub 的项目。他们的 llm-zoomcamp 仓库是一个免费的 10 周开源课程,教授如何利用搜索、智能体和监控来构建可用的 AI 应用。

循序渐进的工程实践,而非枯燥理论
课程作者不会浪费时间去推导反向传播公式。这个项目的目标群体是需要构建生产级服务的开发者和数据工程师。
所有内容都拆分成实用的模块:
- 基础 RAG 和智能体。 基于文本搜索构建第一个流水线,并连接函数调用。
- 向量搜索。 生成嵌入向量,使用 minsearch、sqlitesearch 和 PostgreSQL 的 PGVector 扩展。
- 编排。 使用 Kestra 设置数据处理流水线。
- 数据收集。 使用 dlt 库、DuckDB 数据库和 marimo 笔记本分析 LLM 追踪记录。
- 质量评估。 离线与在线搜索评估指标,以及 LLM-as-a-Judge 模式。
- 监控与优化。 收集用户反馈、混合搜索和结果重排序以提高准确性。
最后,你需要完成自己的最终项目。从零开始构建一个服务:从数据清洗、使用 Streamlit 或 FastAPI 创建 UI,到部署和指标配置。
入门所需条件
不需要配备多块 GPU 的强大服务器。所有作业都设计为可以通过第三方 API 在普通笔记本电脑上运行。只要在你的 OpenAI 或其他提供商账户里充几美元就够了。
知识要求很低:
- 扎实的 Python 技能
- 命令行使用经验
- Docker 基础知识
如果你能在 Jupyter Notebook 里写函数、在终端运行容器,这就够了。
课程形式
所有材料都对外开放。你可以按自己的节奏独立学习:阅读仓库内容、在 YouTube 看视频、完成作业。
作者也会定期启动免费的互动学习班。课程录像会保留,但会有严格的截止日期、自动化的作业检查、参与者排名和项目互评。

成功完成学习班并审阅其他同学的作品后,你会获得一张可以添加到 LinkedIn 的证书。
为什么要收藏这个仓库
即使你不想完成全部 10 周课程,这个仓库也值得收藏。在各个模块文件夹中,你可以找到现成的 Jupyter 笔记本和集成示例脚本。
需要快速为 Postgres 添加混合搜索?打开向量搜索模块。想要设置模型响应评估?去评估部分。代码没有多余的抽象——全部用纯 Python 编写,注释清晰。
查看 01-agentic-rag 文件夹——你可以在几个小时内构建出第一个可用的文档搜索原型。
相关项目