>_ DevTrendsja

言語

ホーム

言語

セクション

フロントエンド バックエンド モバイル DevOps AI / ML ゲーム開発 ブロックチェーン 組み込み セキュリティ
JavaScript

1つのウィンドウでローカルAIモデルをすべて活用 — Uncensored Local Studioのご紹介

ローカルAIスタックを構築しようとしたことがある人なら、その複雑さが分かるでしょう。テキスト用にOllamaやLM Studio、画像用にAutomatic1111やComfyUI、音声認識用に個別のWhisperスクリプト、テキスト読み上げ用に別のユーティリティをインストールする必要があります。結果は、ディスクに蓄積されるギガバイト単位のPython仮想環境、競合するポート、同時に複数のプロセスを実行してVRAMを消費することです。

最近、techjarves/Uncensored-Local-Studioリポジトリを見つけました。著者は散らばったユーティリティの問題を解決しようとし、主要なAIツールを1つのデスクトップクライアントにバンドルしました。

Uncensored Local Studioできること

これはWindows、Linux、またはmacOSでローカルに動作する完全自律型のスタジオです。このプロジェクトはGitHubで約800スターを獲得しており、MITライセンスを使用しています。

Webインターフェース内では、4つのタスクが組み合わされています:

  1. Stable Diffusionによる画像生成と編集(.safetensors、.gguf、.ckptファイル)。
  2. GGUF形式の言語モデルとの対話。
  3. マイクまたはオーディオファイルからのリアルタイム音声書き起こし。
  4. テキストから自然音声への変換。

主な利点は、クラウドAPI、外部サーバー、登録、サブスクリプションへの依存が完全にないことです。すべての計算は исключительноコンピュータ上で行われます。

ビデオを見る

アーキテクチャの動作

開発者の視点からすると、このプロジェクトは既存のハイパフォーマンスC++エンジンを興味深い方法で組み合わせています。

一般的な重いPythonとPyTorchスタックの代わりに、開発者はコンパイル済みC++バックエンドを使用しました。画像生成はstable-diffusion.cpp、テキストモデルのチャットはllama.cpp、音声書き起こしはwhisper.cpp、テキスト読み上げはKokoro-82Mニューラルネットワークを持つkokoro-jsによって処理されます。

フロントエンドはViteとReactで書かれています。WebサーバーとバックエンドのライフサイクルマネージャはNode.jsで実行されます。そのため、ユーザーは環境のセットアップに時間を費やす必要がなく、スタートアップスクリプトはNode.jsのポータブル版を直接アプリディレクトリにダウンロードします。システム変数はそのままです。

VRAM管理は興味深い方法で解決されています。チャットと画像ジェネレーターは相互排他原理で動作します。タブを切り替えると、アクティブなエンジンがビデオメモリを解放し、6〜8GBのVRAMを持つGPUでもアプリが適切に動作します。

ハードウェアアクセラレーションとモデルの操作

このアプリはインストールされているハードウェアを自動的に検出し、最適なバックエンド」を選択します:

  • NVIDIA:CUDA最適化が使用されます。
  • AMDとIntel Arc:計算はVulkan APIまたはROCm経由で実行されます。
  • Apple Silicon:Metalエンジンが使用されます(Intel Macプロセッサーはサポートされていません)。
  • Intel Core Ultra:OpenVINO経由で統合NPU上でモデルを実行する実験的機能があります。

Windowsの場合、起動はwindows.batを実行するだけです。LinuxとmacOSでは、コマンドスクリプトlinux.shmac.shが使用されます。

アプリディレクトリの構造は次のとおりです:

Uncensored-AI-Studio/
├── windows.bat                # Скрипт запуска для Windows
├── linux.sh                   # Скрипт запуска для Linux
├── mac.sh                     # Скрипт запуска для macOS
├── scripts/                   # Конфигураторы бэкендов и веб-сервера
└── app/
    ├── frontend/              # Исходный код интерфейса (Vite + React)
    ├── models/                # Модели Stable Diffusion (.safetensors, .ckpt)
    ├── llm-models/            # Текстовые модели (.gguf)
    ├── speech-models/         # Модели Whisper (.bin)
    └── outputs/               # Сохраненные генерации и метаданные JSON

組み込みのモデルマネージャはダウンロードを簡素化します:Hugging Faceの直接リンクを貼り付けると、ファイルが正しいフォルダに直接ダウンロードされます。すぐに使い始められる軽量モデル(チャット用のQwen2.5 Coderやアート生成用のDreamShaper 8など)がデフォルトで提供されます。

インターフェースには、CPU負荷、システムRAM、GPU、VRAMの使用状況をリアルタイムで表示する組み込みリソースモニターが表示されます。

制限事項と注意点

コンパクトさにはトレードオフがあります。ComfyUIのノードグラフ、ControlNet、LoRA、FluxやHunyuan用の複雑なパイプラインなど、専門的なツールに慣れている場合、このプロジェクトはそれらを置き換えません。ここではスタンドアロンのSD 1.5とSDXLチェックポイントのみがサポートされています。追加のVAEファイルやテキストエンコーダーは個別にロードされません。

2番目の点はLinuxシステムに関するものです。ビルド済みバックエンドバイナリは、glibc 2.38以上の比較的新しいディストリビューション(例:Ubuntu 24.04)用にコンパイルされています。Ubuntu 22.04などの古いディストリビューションで実行すると、バックエンドは動的リンカエラーをスローします。OSを更新するか、含まれているスクリプトscripts/build/build_from_source.shを使用してソースからバイナリをコンパイルする必要があります。

誰がこのプロジェクトを見つけるか

Uncensored Local Studioは、Python環境のセットアップをせずに1台のPCで汎用的なパーソナルアシスタントと画像生成器を必要とする人にとって素晴らしい発見です。

開発者にとって、このプロジェクトは、統一されたNode.js/Reactインターフェースにllama.cppstable-diffusion.cppを統合する明確な例として興味深いです。コードはオープンであり、アーキテクチャはギガバイトサイズの依存関係なしでレスポンシブなニューラルネットワークアプリケーションを構築する方法を示しています。

関連プロジェクト