Cómo entrenar agentes basados en LLMs con RL en tus propias GPUs
El entrenamiento de modelos de lenguaje con Aprendizaje por Refuerzo siempre se ha asociado con grandes clusters y laboratorios cerrados. Mientras que el SFT (Supervised Fine-Tuning) se ha vuelto rutinario para los ingenieros de ML, ejecutar de manera confiable PPO o GRPO para agentes multi-paso siempre ha sido un desafío considerable. Tenías que escribir tu propio código wrapper alrededor de vLLM y DeepSpeed, o conformarte con las limitaciones de los frameworks ya disponibles.
Los investigadores del Berkeley Sky Computing Lab decidieron simplificar este proceso y liberaron el proyecto SkyRL como código abierto. Este es un framework completo que cubre todo el ciclo de fine-tuning con RL: desde la generación de trayectorias de forma aislada hasta la actualización de los pesos del modelo durante la ejecución.
De qué consiste el framework
Los desarrolladores no construyeron un sistema monolítico. En cambio, dividieron el proyecto en varias capas independientes que pueden combinarse fácilmente para tus tareas específicas.
La capa central skyrl maneja la orquestación del entrenamiento en tu hardware. Combina un motor de entrenamiento con inferencia distribuida. La característica principal de esta capa es el soporte para el estándar abierto de API Tinker. Puedes escribir un script de entrenamiento una vez y luego ejecutarlo en un servidor local con GPUs NVIDIA o AMD, así como en la nube.
La capa skyrl-gym proporciona una interfaz para crear entornos de entrenamiento. A diferencia del clásico Gymnasium para robótica, aquí los entornos están adaptados para interacciones de texto y código. Desde el primer momento, tienes soporte para bases de datos SQL, intérpretes de Python, motores de búsqueda y terminal Linux.
La capa skyrl-agent se enfoca en tareas de horizonte largo. Ayuda a entrenar agentes que realizan docenas de pasos secuenciales, llaman utilidades externas y ajustan sus acciones basándose en las respuestas del entorno.
Resultados en la práctica
Un framework de calidad no se define por el número de abstracciones sino por métricas reales. El equipo del proyecto demostró las capacidades de la librería en la tarea de Text-to-SQL.
Los autores tomaron un modelo estándar de 7 mil millones de parámetros y realizaron entrenamiento con RL a través del pipeline SkyRL-SQL. El conjunto de datos contenía solo 653 ejemplos de entrenamiento. El modelo no solo memorizó consultas SQL correctas—aprendió a ejecutarlas en un DBMS real, recibir errores de ejecución y corregir la sintaxis en el siguiente paso. Como resultado, este modelo pequeño superó a los servicios comerciales GPT-4o y o4-mini en precisión de generación en benchmarks especializados.
Otro ejemplo interesante es la integración con el entorno Harbor para entrenar agentes de línea de comandos. El modelo aprende a trabajar en una terminal real: editar archivos, ejecutar pruebas, encontrar errores en repositorios y desplegar entornos sin intervención humana.
Detalles de implementación técnica
En el entrenamiento tradicional con RL de modelos, la inferencia y el entrenamiento frecuentemente se bloquean entre sí. El modelo genera respuestas, el proceso se detiene, se calculan los gradientes, se actualizan los pesos, y solo entonces comienza una nueva iteración. SkyRL implementa un modo completamente asíncrono con las llamadas actualizaciones de pesos en vuelo.
Mientras el actor genera nuevos tokens e interactúa con el entorno, el proceso de entrenamiento actualiza simultáneamente los parámetros del modelo. Los nuevos pesos se transmiten al servicio de inferencia sobre la marcha, lo que reduce drásticamente el tiempo de inactividad de los aceleradores costosos.
La librería no intenta reinventar la rueda desde cero. Internamente, utiliza soluciones probadas de la comunidad de código abierto: ideas de veRL, OpenRLHF y Search-R1.
Dónde el proyecto ya ha encontrado aplicación
A pesar de su corta edad, el framework ya se ha convertido en la base para varios proyectos de investigación de terceros.
Un equipo de Stanford usó SkyRL para crear Biomni-R0. Este es un agente capaz de resolver tareas biomédicas complejas y construir cadenas lógicas a nivel de experto. El proyecto CodeScout aplicó el framework para la localización precisa de errores en código dentro del benchmark SWE-Bench. Proyectos como OpenThoughts-Agent y Endless Terminals también se están desarrollando sobre la librería, donde RL se usa para la generación procedimental de tareas en terminales Linux sin etiquetado manual de datos.
Dónde comenzar los experimentos
Necesitarás un servidor Linux con múltiples GPUs y PyTorch instalado. El proceso de instalación es estándar para proyectos Python:
git clone https://github.com/NovaSky-AI/SkyRL.git
cd SkyRL
pip install -e .
Luego puedes ejecutar una de las recetas de entrenamiento listas para usar. Por ejemplo, para lanzar el bucle de RL más simple en tareas de matemáticas o SQL, solo tienes que llamar al script correspondiente desde la carpeta de ejemplos:
python -m skyrl.train --config-name=math_ppo
Si quieres integrar tu propio entorno, simplemente hereda de la clase de la API de Gymnasium y define los métodos step() y reset(). El modelo recibirá las observaciones como texto o respuestas del sistema y devolverá texto generado como acción.
¿Vale la pena adoptarlo para tus proyectos?
SkyRL será útil para equipos de I+D e ingenieros que han superado el SFT estándar y quieren exprimir el máximo rendimiento de modelos de tamaño medio. Enseñar a un LLM a usar herramientas en un área de dominio específica a través de RL es una forma viable de superar a los modelos propietarios de propósito general en precisión y costo de consulta.
La principal advertencia: el proyecto está en desarrollo activo. El repositorio tiene alrededor de 400 issues abiertos, y la arquitectura de los módulos individuales continúa evolucionando. Si necesitas una solución llave en mano lista para usar con un botón de "simplemente funciona", quizás quieras esperar un poco. Pero si estás dispuesto a profundizar en el código y buscas una base flexible para tus propios agentes de RL, SkyRL te ahorrará meses de desarrollo.
Proyectos relacionados