Cómo el Asistente de Guardia de Ongrid Investiga Incidentes Directamente en Mensajería
Imagina un escenario típico de guardia. A las tres de la mañana, suena una alerta: los tiempos de respuesta de la API se han quintuplicado. Abres tu laptop medio dormido, entrecierras los ojos ante una docena de dashboards en Grafana, luego te conectas por SSH a los nodos a través de un host bastión y buscas frenéticamente en los logs. Encontrar la causa raíz lleva media hora, cuando el problema era solo un pod caído o una transacción bloqueada.
Los autores del proyecto de código abierto Ongrid decidieron delegar esta rutina a una combinación de agentes de IA especializados y un stack de observabilidad listo para usar.
Qué puede hacer el sistema
Ongrid funciona como un ingeniero de guardia autónomo. Se conecta a mensajeros como Telegram o Slack, escucha alertas entrantes e inmediatamente comienza a investigar.
El sistema está construido sobre una arquitectura de coordinador y especialistas estrechos. Cuando llega una alerta, el agente principal crea un worker para el análisis de causa raíz. Este worker consulta a agentes de bases de datos, redes o SRE, recopila métricas, logs y trazas, construye un mapa de dependencias y entrega un reporte listo en el chat señalando la línea de código específica o el servicio fallando.
Seguridad y control de acceso
La peor pesadilla de todo sysadmin al escuchar "un agente en producción" es la alucinación del modelo que ejecuta un comando peligroso y tumba la base de datos. Los desarrolladores de Ongrid abordaron esto de manera pragmática.
Primero, las utilidades del host y el sandbox de bash se ejecutan en modo solo lectura por defecto. El agente puede ejecutar comandos de diagnóstico, verificar el estado de procesos o inspeccionar estados de sockets, pero no reiniciará silenciosamente el servidor.
Segundo, todas las acciones potencialmente destructivas están protegidas por una puerta de aprobación especial. Antes de aplicar una corrección, el bot solicitará aprobación del ingeniero de guardia en el chat o la interfaz web.
Tercero, los hosts no necesitan ningún puerto abierto entrante. Un Edge agent ligero se instala en los servidores objetivo, que establece una conexión saliente al propio servidor de Ongrid. El acceso SSH a través del terminal web funciona sobre un túnel reverso, sin reenviar el puerto 22 hacia afuera y sin tocar claves en hosts bastión. Cada invocación se registra con fines de auditoría.
Observabilidad, topología y Kubernetes
Dentro de la caja, ya está configurado un stack preconfigurado de Prometheus, Loki, Tempo y Grafana. La diferencia es que el propio agente escribe consultas en ellos, correlacionando marcas de tiempo de eventos con trazas de OpenTelemetry.
La gestión de clústeres Kubernetes se agregó recientemente al proyecto. El agente conecta clústeres a través de Edge, rastrea eventos de workloads, ayuda a gestionar actualizaciones y proyecta pods en un mapa topológico compartido.
El mapa topológico ayuda a evaluar el radio de impacto de un incidente. Si un switch de red o base de datos cae, el sistema visualiza todos los servicios dependientes, filtrando falsos positivos.
Base de conocimientos y expansión de habilidades
Cualquier LLM es inútil sin contexto sobre tu infraestructura. Ongrid incluye una bóveda de conocimiento donde puedes subir runbooks, postmortems anteriores y repositorios de código. La búsqueda vectorial basada en Qdrant encuentra instrucciones relevantes y las proporciona al agente durante el análisis de incidentes.
Si las herramientas estándar no son suficientes, puedes agregar más a través del MCP (Model Context Protocol) o construir tu propio escenario en el editor visual de flujos de trabajo.
Los informes y dashboards generados se guardan en el centro de artefactos, donde son fáciles de compartir con el equipo durante los postmortems.
Bajo el capó y stack de modelos
El backend de la plataforma está escrito en Go, y el frontend está construido con React y TypeScript. La solución puede desplegarse completamente en tus propios servidores bajo la licencia AGPLv3.
En cuanto a modelos de lenguaje, el proyecto no está atado a un solo proveedor. Puedes usar Claude de Anthropic, OpenAI, DeepSeek, Gemini o instancias locales, cambiando el enrutamiento de modelos sobre la marcha dependiendo de la complejidad de la tarea.
Cómo desplegar en tu propio servidor
La instalación en Ubuntu, Debian o Rocky Linux se realiza con un script listo para usar:
# Для архитектуры AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.12.0/ongrid-v0.12.0-linux-amd64.tar.xz
tar -xf ongrid-v0.12.0-linux-amd64.tar.xz && cd ongrid-v0.12.0-linux-amd64
sudo ./install.sh
Para ARM64, simplemente reemplaza el nombre del archivo con la versión correspondiente. El script levantará el componente servidor y la interfaz web, después solo necesitas configurar la conexión del mensajero e instalar el Edge agent en los hosts.
Quién debería probarlo
Ongrid es útil para equipos operativos pequeños y medianos donde no hay un centro de operaciones de red (NOC) las 24 horas, y los desarrolladores se turnan para estar de guardia. Elimina el borde de la ola inicial de pánico durante un incidente al recopilar inmediatamente logs y localizar el problema hasta un resumen claro.
El proyecto aún es joven (alrededor de 700 estrellas en GitHub), pero arquitecturalmente se ve maduro gracias a su enfoque en seguridad y uso de estándares de telemetría abierta.
Proyectos relacionados