How to Set Up Fast Inference for Voice and Multimodal Models with SGLang-Omni
SGLang-Omni provides a specialized runtime for multi-stage inference of voice and multimodal models, handling the complex pipeline from audio encoding to speech synthesis.
Idioma
InícioLinguagens
Seções
SGLang-Omni provides a specialized runtime for multi-stage inference of voice and multimodal models, handling the complex pipeline from audio encoding to speech synthesis.
Transforme um celular Android antigo em um sistema de vigilância inteligente com IA usando o Sentinel. Captura vídeo pela LAN, grava no PC e usa redes neurais multimodais para reconhecimento de eventos em tempo real.
Cansado de lidar com scripts de treinamento espalhados para modelos multimodais? lmms-engine é um motor modular que lida com treinamento distribuído, sequence packing e otimizações de GPU para você focar em config e dados.
Um plugin para Claude Code que converte vídeo em frames e transcrições com timestamps, permitindo que a IA analise gravações de tela e vídeos do YouTube diretamente no terminal.
A equipe do Firebase open-sourceou o Genkit, um framework para construir funcionalidades de IA. Ele ajuda a combinar Gemini, OpenAI e Ollama sem código espaguete?
Um guia prático para construir agentes de IA que realmente funcionam. O repositório ai-agent-book de Bojie Li cobre desde engenharia de contexto até auto-evolução sem fine-tuning.
MLX-Audio brings lightning-fast TTS, STT, and STS capabilities to Apple Silicon Macs. Built on Apple's MLX framework, it offers Whisper, Kokoro, voice cloning, and more—all running locally without cloud costs.
AnythingLLM transforma seus documentos em uma base de conhecimento inteligente com que você pode conversar. Suporta mais de 20 LLMs, agentes sem código e processamento multimodal.