なぜエージェントには特別な推論が必要か、そしてTokenSpeedがLLMを高速化する仕組み
テキストやコード生成のために標準的なニューラルネットワークを実行する場合、vLLMのようなエンジンは通常、十分な能力を持っています。しかし、自律型AIエージェントになると話は変わります。継続的なツール呼び出し、対話の分岐、繰り返されるコンテキスト渡し、成長し続けるKV-キャッシュにより、標準的な推論はあっと言う間に限界を迎えます。
ことし5月、LightSeekチームはGitHubでTokenSpeedをリリースしました。開発者たちは、TensorRT-LLMの高速性と明確でシンプルなPythonインターフェースを組み合わせた、エージェントワークロード向けの専門エンジンを構築することを決意しました。

エージェント使用時に標準エンジンで何が起きるか
エージェントシナリオはチャットボットの対話とは大きく異なります。ボットはリクエストを受け取り、単一のレスポンスを生成してリソースを解放します。一方、エージェントは以下のサイクルで動作します:
- 思考を形成し、ツールを選択する
- 外部APIやデータベースからのレスポンスを待つ
- 受信した結果を分析し、次のステップを実行する
これによりコンテキストが継続的に成長し、サーバーは長いトークン連鎖を再計算したり、KV-キャッシュのための大容量メモリを維持したりする必要があります。数十のエージェントを同時に実行すると、強力なアクセラレータでさえデータ転送を待ちながらアイドル状態になります。
TokenSpeedのアーキテクチャと解決策
TokenSpeedの開発者たちは、PyTorchの上に薄いラッパーを作るつもりはありませんでした。ハードウェアから最大限のパフォーマンスを引き出すために、重要なシステムコンポーネントを書き直しました。
まず、制御ループと実行を分離しました。リクエストスケジューラはC++で記述され、上位レベルの実行はPythonのままです。各リクエストの状態、KV-キャッシュの所有権移譲、タイミングは厳密な有限状態マシンに関連付けられています。C++の型システムはコンパイル時にキャッシュリソースの再利用安全性进行检查し、メモリリークを完全に排除します。
次に、分散計算用の静的コンパイラが含まれています。開発者は手動で並列ロジックを書く必要は一切ありません。モジュール境界にアノテーションを配置するだけで、コンパイラがプロセッサ間通信のコマンドを自動的に生成します。
第三に、低レベルカーネルを改良しました。著者はMulti-head Latent Attention(MLA)アルゴリズムの独自バージョンを実装し、NVIDIA HopperおよびBlackwellアーキテクチャに最適化されています。これにより、長いコンテキストでのアクティブワーク時のレイテンシを最小限に抑えます。
数値と実際のテスト
開発者は現在のモデルでの具体的なベンチマークを提供しています。5月、プロジェクトはQwen3.5-397B-A17Bモデルでエージェントタスクにおいて秒間580トークンの速度を達成しました。
NVIDIA B200チップでKimi K2.5モデルを実行した場合のTensorRT-LLMとの比較チャートを見ると、TokenSpeedは同じレイテンシレベルでスループットにおいて勝利しています。

プロジェクトが新しいリリースにどれほど迅速に対応しているかを見るのは興味深いです。例えば、Kimi K3モデルのサポートとNVIDIAおよびAMD GPU用のFP4推論は、公式リリース当日に追加されました。
既存のコードへの統合
エントリーポイントの観点から、TokenSpeedはAsyncLLMを使用します。アーキテクチャは着信HTTPリクエストの処理におけるCPUオーバーヘッドを最小限に抑え、サーバーは高RPSでもオーバーロードしません。
サーバー起動の例は、vLLMで作業したことのある人なら誰でも馴染み深いものになります:
python3 -m tokenspeed.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--port 8000
その後、標準のOpenAIクライアントを使用してサーバーに接続でき、AutoGen、CrewAI、LangChainなどの既存のエージェントフレームワークへの統合が簡素化されます。
本番環境に導入する価値はあるか
現在、リポジトリは約17,000個のスターとほぼ50個のオープンイシューを抱えています。これは若くダイナミックなプロジェクトであり、保守的な業界標準と呼ぶにはまだ早いです。
すでにAIエージェントインフラストラクチャを展開しており、長いコンテキストでvLLMのパフォーマンス限界に達しているなら、TokenSpeedを試す価値は十分あります。基本的なチャットボット用のシンプルなサーバーが必要な場合は、今のところ標準ツールで十分です。
関連プロジェクト