LLM Zoomcampで自有データ上に会話型AIアシスタントを構築する方法
去年、社内ドキュメントを検索するためのRAGシステムを構築しようとしました。OpenAI APIにファイルを送信して回答を出力すれば万事OKのように思えました。実際の運用では状況は全く異なり、モデルは頻繁にハルシネーションを起こし、テキストがコンテキストウィンドウに収まらず、一般的なベクトル検索では技術用語や略語に 어려움을 겪었습니다。
同様の問題に遭遇したことがあるなら、DataTalksClubのプロジェクトをチェックしてみてください。彼らのllm-zoomcampリポジトリは、検索、エージェント、モニタリングを備えた実用的なAIアプリケーションの構築を教えてくれる無料の10週間オープンソースコースです。

乾燥した理論ではなく、ステップバイステップのエンジニアリング
コースの作成者はバックプロパゲーションの公式を導き出すことに時間を浪费しません。このプログラムは、本番環境でのサービスを構築する必要がある開発者とデータエンジニアを対象としています。
すべての教材は実用的なモジュールに分割されています:
- 基本的なRAGとエージェント。テキスト検索に基づく最初のパイプラインの構築と関数呼び出しの接続。
- ベクトル検索。エンベディングの生成、minsearch、sqlitesearch、PostgreSQL用のPGVector拡張機能での作業。
- オーケストレーション。Kestraを使用したデータ処理パイプラインの設定。
- データ収集。dltライブラリ、DuckDBデータベース、LLMトレースの分析のためのmarimoノートの使用。
- 品質評価。オフラインとオンラインの検索評価指標、LLM-as-a-Judgeパターン。
- モニタリングと最適化。ユーザーからのフィードバックの収集、ハイブリッド検索、結果のリランキングによる精度向上。
最後に、独自の最終プロジェクトに取り組みます。データのクリーニングからStreamlitまたはFastAPIでのUI作成、デプロイ、メトリクス設定まで、サービスをゼロから構築します。
始めるために必要なもの
複数のGPUを備えた強力なサーバーは必要ありません。すべての課題は、サードパーティのAPIを通じて通常のノートパソコンで実行できるように設計されています。OpenAI或其他のプロバイダーの残高に数ドルあれば十分です。
必要な知識は最小限です:
- 確かなPythonスキル
- コマンドラインの経験
- Dockerの基本的な理解
Jupyter Notebookで関数を書き、ターミナルでコンテナを実行できれば、それで十分です。
コースの形式
教材は誰でも公開されています。自分のペースで独立してコースを受けることができます:リポジトリを読み、YouTubeで動画を見、課題を完了します。
作成者はまた、定期的に無料のインタラクティブコホートを開始します。講義は録画のままですが、厳格な締め切り、自動的な課題チェック、参加者のランキング、プロジェクトの相互レビュー(ピアレビュー)があります。

コホートを正常に完了し、他の生徒の作品をレビューすると、LinkedInに追加できる証明書が授予されます。
このリポジトリをブックマークする理由
完全な10週間コースを受ける予定がなくても、このリポジトリはブックマークする価値があります。モジュールフォルダには、統合例を含む готовые Jupyterノートブックとスクリプトがあります。
Postgresにハイブリッド検索をすばやく追加する必要がありますか?ベクトル検索モジュールを開いてください。モデルの応答評価を設定したいですか?評価セクションに移動してください。コードには不必要な抽象化がされていません—すべてが明確なコメント付きの純粋なPythonで書かれています。
01-agentic-ragフォルダをチェックしてください—数時間で最初の動作するドキュメント検索プロトタイプを構築できます。
関連プロジェクト