>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Go

Como o Assistente de Plantão do Ongrid Investiga Incidentes Diretamente nos Mensageiros

Imagine um cenário típico de plantão. Às três da manhã, um alerta dispara: os tempos de resposta da API aumentaram cinco vezes. Você abre o laptop sonolento, franze os olhos diante de uma dúzia de dashboards no Grafana, então acessa os nodes via SSH através de um bastion host e procura freneticamente nos logs. Encontrar a causa raiz leva meia hora, quando o problema era apenas um pod travado ou uma transação presa.

Os autores do projeto open-source Ongrid decidiram delegar essa rotina a uma combinação de agentes de IA especializados e uma stack de observabilidade pronta para uso.

Demo do Ongrid

O que o sistema pode fazer

Ongrid funciona como um engenheiro de plantão autônomo. Ele se conecta a mensageiros como Telegram ou Slack, escuta alertas recebidos e começa a investigar imediatamente.

O sistema é construído em uma arquitetura de coordenador e especialistas restritos. Quando um alerta chega, o agente principal cria um worker para análise de causa raiz. Esse worker consulta agentes de bancos de dados, redes ou SRE, coleta métricas, logs e traces, constrói um mapa de dependências e entrega um relatório pronto no chat apontando para a linha específica de código ou serviço com falha.

Relatório de análise de causa raiz

Segurança e controle de acesso

O pior pesadelo de todo sysadmin ao ouvir "um agente em produção" é a alucinação do modelo que executa um comando perigoso e derruba o banco de dados. Os desenvolvedores do Ongrid abordaram isso de forma pragmática.

Primeiro, os utilitários do host e o sandbox bash são executados em modo somente leitura por padrão. O agente pode executar comandos de diagnóstico, verificar status de processos ou inspecionar estados de sockets, mas não reiniciará o servidor silenciosamente.

Segundo, todas as ações potencialmente destrutivas são protegidas por um gateway de aprovação especial. Antes de aplicar um correção, o bot solicitará aprovação do engenheiro de plantão no chat ou na interface web.

Aprovação e gateway de escrita

Terceiro, os hosts não precisam de nenhuma porta de entrada aberta. Um Edge agent leve é instalado nos servidores alvo, que estabelece uma conexão de saída para o próprio servidor Ongrid. O acesso SSH via terminal web funciona sobre um túnel reverso, sem encaminhar a porta 22 para fora e sem mexer com chaves em bastion hosts. Cada invocação é registrada para fins de auditoria.

Observabilidade, topologia e Kubernetes

Lá dentro, uma stack pré-configurada de Prometheus, Loki, Tempo e Grafana já está configurada. A diferença é que o próprio agente escreve consultas neles, correlacionando timestamps de eventos com traces do OpenTelemetry.

Monitoramento

O gerenciamento de clusters Kubernetes foi adicionado recentemente ao projeto. O agente conecta clusters via Edge, rastreia eventos de workloads, ajuda a gerenciar upgrades e projeta pods em um mapa de topologia compartilhado.

Gerenciamento do ciclo de vida do Kubernetes

O mapa de topologia ajuda a avaliar o raio de impacto de um incidente. Se um switch de rede ou banco de dados cair, o sistema visualiza todos os serviços dependentes, filtrando falsos positivos.

Mapa de topologia

Base de conhecimento e expansão de habilidades

Qualquer LLM é inútil sem contexto sobre sua infraestrutura. Ongrid inclui um cofre de conhecimento onde você pode fazer upload de runbooks, postmortems anteriores e repositórios de código. A busca vetorial baseada em Qdrant encontra instruções relevantes e as alimenta ao agente durante a análise de incidentes.

Cofre de conhecimento

Se as ferramentas padrão não forem suficientes, você pode adicionar mais via MCP (Model Context Protocol) ou construir seu próprio cenário no editor visual de workflows.

Servidores MCP

Catálogo de habilidades

Construtor de workflows

Relatórios gerados e dashboards são salvos no centro de artefatos, onde são fáceis de compartilhar com a equipe durante postmortems.

Centro de artefatos

Por baixo dos panos e stack de modelos

O backend da plataforma é escrito em Go, e o frontend é construído com React e TypeScript. A solução pode ser implantada inteiramente em seus próprios servidores sob a licença AGPLv3.

Quanto aos modelos de linguagem, o projeto não está vinculado a um único fornecedor. Você pode usar Claude da Anthropic, OpenAI, DeepSeek, Gemini ou instâncias locais, alternando o roteamento de modelos em tempo real dependendo da complexidade da tarefa.

Como implantar no seu próprio servidor

A instalação no Ubuntu, Debian ou Rocky Linux é feita com um script pronto:

# Для архитектуры AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.12.0/ongrid-v0.12.0-linux-amd64.tar.xz
tar -xf ongrid-v0.12.0-linux-amd64.tar.xz && cd ongrid-v0.12.0-linux-amd64
sudo ./install.sh

Para ARM64, basta substituir o nome do archive pela release correspondente. O script irá iniciar o componente servidor e a interface web, após o que você só precisa configurar a conexão do mensageiro e instalar o Edge agent nos hosts.

Quem deveria experimentar

Ongrid é útil para equipes de operações pequenas e médias onde não há um centro de operações de rede (NOC) 24 horas, e os desenvolvedores se revezam no plantão. Ele tira a tensão da onda inicial de pânico durante um incidente ao coletar imediatamente logs e localizar o problema até um resumo claro.

O projeto ainda é jovem (cerca de 700 estrelas no GitHub), mas arquiteturalmente parece maduro graças ao seu foco em segurança e uso de padrões de telemetria aberta.

Projetos relacionados