Cómo configurar inferencia rápida para modelos de voz y multimodales con SGLang-Omni
SGLang-Omni es un runtime especializado para inferencia de modelos de voz y multimodales, gestionando el pipeline desde codificación de audio hasta síntesis.
Idioma
InicioLenguajes
Secciones
SGLang-Omni es un runtime especializado para inferencia de modelos de voz y multimodales, gestionando el pipeline desde codificación de audio hasta síntesis.
Convierte un teléfono Android antiguo en un sistema de vigilancia inteligente con IA usando Sentinel. Captura video a través de LAN, graba en PC y utiliza redes neuronales multimodales para el reconocimiento de eventos en tiempo real.
¿Cansado de manejar scripts de entrenamiento dispersos para modelos multimodales? lmms-engine es un motor modular que maneja el entrenamiento distribuido, el empaquetamiento de secuencias y las optimizaciones de GPU para que puedas concentrarte en la configuración y los datos.
Un plugin para Claude Code que convierte vídeo en fotogramas y transcripciones con marcas de tiempo, permitiendo que la IA analice grabaciones de pantalla y vídeos de YouTube directamente en el terminal.
El equipo de Firebase liberó Genkit como código abierto, un framework para construir funcionalidades de IA. ¿Ayuda a combinar Gemini, OpenAI y Ollama sin código espagueti?
Guía práctica para construir agentes de IA funcionales. El repositorio ai- agent-book de Bojie Li cubre ingeniería de contexto y auto-evolución sin ajuste fino.
MLX-Audio ofrece capacidades ultrarrápidas de TTS, STT y STS para Macs con Apple Silicon. Construido sobre el framework MLX de Apple, ofrece Whisper, Kokoro, clonación de voz y más, todo ejecutándose localmente sin costos en la nube.
AnythingLLM transforma tus documentos en una base de conocimiento inteligente con la que puedes chatear. Soporta más de 20 LLMs, agentes sin código y procesamiento multimodal.