>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Go

Cómo el Asistente de Guardia de Ongrid Investiga Incidentes Directamente en Mensajería

Imagina un escenario típico de guardia. A las tres de la mañana, suena una alerta: los tiempos de respuesta de la API se han quintuplicado. Abres tu laptop medio dormido, entrecierras los ojos ante una docena de dashboards en Grafana, luego te conectas por SSH a los nodos a través de un host bastión y buscas frenéticamente en los logs. Encontrar la causa raíz lleva media hora, cuando el problema era solo un pod caído o una transacción bloqueada.

Los autores del proyecto de código abierto Ongrid decidieron delegar esta rutina a una combinación de agentes de IA especializados y un stack de observabilidad listo para usar.

Ongrid demo

Qué puede hacer el sistema

Ongrid funciona como un ingeniero de guardia autónomo. Se conecta a mensajeros como Telegram o Slack, escucha alertas entrantes e inmediatamente comienza a investigar.

El sistema está construido sobre una arquitectura de coordinador y especialistas estrechos. Cuando llega una alerta, el agente principal crea un worker para el análisis de causa raíz. Este worker consulta a agentes de bases de datos, redes o SRE, recopila métricas, logs y trazas, construye un mapa de dependencias y entrega un reporte listo en el chat señalando la línea de código específica o el servicio fallando.

Informe de análisis de causa raíz

Seguridad y control de acceso

La peor pesadilla de todo sysadmin al escuchar "un agente en producción" es la alucinación del modelo que ejecuta un comando peligroso y tumba la base de datos. Los desarrolladores de Ongrid abordaron esto de manera pragmática.

Primero, las utilidades del host y el sandbox de bash se ejecutan en modo solo lectura por defecto. El agente puede ejecutar comandos de diagnóstico, verificar el estado de procesos o inspeccionar estados de sockets, pero no reiniciará silenciosamente el servidor.

Segundo, todas las acciones potencialmente destructivas están protegidas por una puerta de aprobación especial. Antes de aplicar una corrección, el bot solicitará aprobación del ingeniero de guardia en el chat o la interfaz web.

Aprobación y puerta de escritura

Tercero, los hosts no necesitan ningún puerto abierto entrante. Un Edge agent ligero se instala en los servidores objetivo, que establece una conexión saliente al propio servidor de Ongrid. El acceso SSH a través del terminal web funciona sobre un túnel reverso, sin reenviar el puerto 22 hacia afuera y sin tocar claves en hosts bastión. Cada invocación se registra con fines de auditoría.

Observabilidad, topología y Kubernetes

Dentro de la caja, ya está configurado un stack preconfigurado de Prometheus, Loki, Tempo y Grafana. La diferencia es que el propio agente escribe consultas en ellos, correlacionando marcas de tiempo de eventos con trazas de OpenTelemetry.

Monitoreo

La gestión de clústeres Kubernetes se agregó recientemente al proyecto. El agente conecta clústeres a través de Edge, rastrea eventos de workloads, ayuda a gestionar actualizaciones y proyecta pods en un mapa topológico compartido.

Gestión del ciclo de vida de Kubernetes

El mapa topológico ayuda a evaluar el radio de impacto de un incidente. Si un switch de red o base de datos cae, el sistema visualiza todos los servicios dependientes, filtrando falsos positivos.

Mapa topológico

Base de conocimientos y expansión de habilidades

Cualquier LLM es inútil sin contexto sobre tu infraestructura. Ongrid incluye una bóveda de conocimiento donde puedes subir runbooks, postmortems anteriores y repositorios de código. La búsqueda vectorial basada en Qdrant encuentra instrucciones relevantes y las proporciona al agente durante el análisis de incidentes.

Bóveda de conocimiento

Si las herramientas estándar no son suficientes, puedes agregar más a través del MCP (Model Context Protocol) o construir tu propio escenario en el editor visual de flujos de trabajo.

Servidores MCP

Catálogo de habilidades

Constructor de flujos de trabajo

Los informes y dashboards generados se guardan en el centro de artefactos, donde son fáciles de compartir con el equipo durante los postmortems.

Centro de artefactos

Bajo el capó y stack de modelos

El backend de la plataforma está escrito en Go, y el frontend está construido con React y TypeScript. La solución puede desplegarse completamente en tus propios servidores bajo la licencia AGPLv3.

En cuanto a modelos de lenguaje, el proyecto no está atado a un solo proveedor. Puedes usar Claude de Anthropic, OpenAI, DeepSeek, Gemini o instancias locales, cambiando el enrutamiento de modelos sobre la marcha dependiendo de la complejidad de la tarea.

Cómo desplegar en tu propio servidor

La instalación en Ubuntu, Debian o Rocky Linux se realiza con un script listo para usar:

# Для архитектуры AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.12.0/ongrid-v0.12.0-linux-amd64.tar.xz
tar -xf ongrid-v0.12.0-linux-amd64.tar.xz && cd ongrid-v0.12.0-linux-amd64
sudo ./install.sh

Para ARM64, simplemente reemplaza el nombre del archivo con la versión correspondiente. El script levantará el componente servidor y la interfaz web, después solo necesitas configurar la conexión del mensajero e instalar el Edge agent en los hosts.

Quién debería probarlo

Ongrid es útil para equipos operativos pequeños y medianos donde no hay un centro de operaciones de red (NOC) las 24 horas, y los desarrolladores se turnan para estar de guardia. Elimina el borde de la ola inicial de pánico durante un incidente al recopilar inmediatamente logs y localizar el problema hasta un resumen claro.

El proyecto aún es joven (alrededor de 700 estrellas en GitHub), pero arquitecturalmente se ve maduro gracias a su enfoque en seguridad y uso de estándares de telemetría abierta.

Proyectos relacionados