>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Go

Hoe Ongrid's On-Call Assistant Incidenten Direct in Messengers Onderzoekt

Stel je een typisch on-call scenario voor. Om drie uur 's nachts gaat er een alarm af: API-reactietijden zijn vijfvoudig gestegen. Je opent slaperig je laptop, tuurt door een dozijn dashboards in Grafana, SSH't via een bastion host naar nodes en greppan door logs. Het vinden van de root cause duurt een half uur, terwijl het probleem slechts een crashed pod of een vastgelopen transactie was.

De auteurs van het open-source project Ongrid besloten deze routineuze taken uit te besteden aan een combinatie van gespecialiseerde AI-agents en een kant-en-klare observability stack.

Ongrid demo

Wat het systeem kan doen

Ongrid werkt als een autonome on-call engineer. Het verbindt met messengers zoals Telegram of Slack, luistert naar inkomende alerts en begint onmiddellijk met onderzoeken.

Het systeem is gebouwd op een coordinator- en narrow-specialists architectuur. Wanneer een alert binnenkomt, creëert het hoofdagent een worker voor root cause analysis. Deze worker bevraagt agents voor databases, netwerken of SRE, verzamelt metrics, logs en traces, bouwt een dependency map en levert een kant-en-klaar rapport in de chat, wijzend naar de specifieke coderegel of falende service.

Root cause analysis report

Beveiliging en toegangscontrole

Het ergste nachtmerrie van elke sysadmin bij het horen van "een agent in productie" is modelhallucinatie die een gevaarlijk commando uitvoert en de database platlegt. De ontwikkelaars van Ongrid hebben hier pragmatisch mee omgegaan.

Ten eerste draaien host utilities en de bash sandbox standaard in read-only modus. De agent kan diagnostische commando's uitvoeren, processtatus controleren of socket states inspecteren, maar zal niet stilzwijgend de server herstarten.

Ten tweede zijn alle potentieel destructieve acties beschermd door een speciaal goedkeuringsgateway. Voordat een fix wordt toegepast, vraagt de bot goedkeuring aan de on-call engineer in de chat of web interface.

Approval and write gate

Ten derde hebben hosts helemaal geen open inbound poorten nodig. Een lichtgewicht Edge agent wordt op target servers geïnstalleerd, die een uitgaande verbinding naar de Ongrid server zelf tot stand brengt. SSH-toegang via web terminal werkt via een reverse tunnel, zonder poort 22 outward te forwarden en zonder te pielen met keys op bastion hosts. Elke aanroep wordt gelogd voor audit-doeleinden.

Observability, topologie en Kubernetes

Binnenin zit een vooraf geconfigureerde stack van Prometheus, Loki, Tempo en Grafana. Het verschil is dat de agent zelf queries naar ze schrijft, waarbij event timestamps worden gecorreleerd met OpenTelemetry traces.

Monitoring

Kubernetes cluster management is recent toegevoegd aan het project. De agent verbindt clusters via Edge, volgt workload events, helpt bij het beheren van upgrades en projecteert pods op een gedeelde topologiekaart.

Kubernetes lifecycle management

De topologiekaart helpt bij het inschatten van de blast radius van een incident. Als een netwerkswitch of database uitvalt, visualiseert het systeem alle afhankelijke services en filtert false positives eruit.

Topology map

Kennisbank en uitbreiding van vaardigheden

Elke LLM is nutteloos zonder context over je infrastructuur. Ongrid bevat een knowledge vault waar je runbooks, eerdere postmortems en code repositories kunt uploaden. Qdrant-based vector search vindt relevante instructies en voedt ze aan de agent tijdens incidentanalyse.

Knowledge vault

Als standaard tools niet genoeg zijn, kun je er meer toevoegen via MCP (Model Context Protocol) of je eigen scenario bouwen in de visuele workflow editor.

MCP servers

Skills catalog

Workflow builder

Gegenereerde rapporten en dashboards worden opgeslagen in het artifacts center, waar ze gemakkelijk te delen zijn met het team tijdens postmortems.

Artifacts center

Onder de motorkap en model stack

Het platform backend is geschreven in Go en de frontend is gebouwd met React en TypeScript. De oplossing kan volledig op je eigen servers worden gedployd onder de AGPLv3 licentie.

Qua taalmodellen is het project niet gebonden aan één leverancier. Je kunt Claude van Anthropic, OpenAI, DeepSeek, Gemini of lokale instances gebruiken, met dynamische model routing afhankelijk van de taakcomplexiteit.

Hoe te deployen op je eigen server

Installatie op Ubuntu, Debian of Rocky Linux wordt gedaan met een kant-en-klaar script:

# Для архитектуры AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.12.0/ongrid-v0.12.0-linux-amd64.tar.xz
tar -xf ongrid-v0.12.0-linux-amd64.tar.xz && cd ongrid-v0.12.0-linux-amd64
sudo ./install.sh

Voor ARM64 vervang je simpelweg de archiefnaam met de bijbehorende release. Het script zal de server component en web interface opstarten, waarna je alleen nog de messenger verbinding hoeft te configureren en de Edge agent op de hosts hoeft te installeren.

Voor wie is het de moeite waard

Ongrid is nuttig voor kleine en middelgrote operations teams waar geen 24/7 network operations center (NOC) is, en developers elkaar afwisselen voor on-call. Het haalt de scherpe randjes van de initiële paniekgolf tijdens een incident door onmiddellijk logs te verzamelen en het probleem te lokaliseren tot een duidelijke samenvatting.

Het project is nog jong (ongeveer 700 sterren op GitHub), maar architectonisch ziet het er volwassen uit dankzij de focus op beveiliging en het gebruik van open telemetry standaarden.

Gerelateerde projecten