Jak asystent On-Call od Ongrid bada incydenty bezpośrednio w komunikatorach
Wyobraź sobie typowy scenariusz on-call. O trzeciej w nocy odzywa się alert: czasy odpowiedzi API wzrosły pięciokrotnie. Zaspany otwierasz laptopa, mrużysz oczy przed tuzinem dashboardów w Grafanie, a potem SSHujesz się przez bastion host i gorączkowo grepujesz logi. Znalezienie przyczyny źródłowej zajmuje pół godziny, podczas gdy problem to tylko crashnący pod lub zawieszona transakcja.
Autorzy open-source'owego projektu Ongrid postanowili odciążyć się od tej rutyny, łącząc wyspecjalizowane agenty AI z gotowym stosem observability.
Co potrafi system
Ongrid działa jako autonomiczny inżynier on-call. Łączy się z komunikatorami takimi jak Telegram czy Slack, nasłuchuje przychodzących alertów i natychmiast rozpoczyna badanie.
System jest zbudowany na architekturze koordynatora i wąskich specjalistów. Gdy przychodzi alert, główny agent tworzy workera do analizy przyczyn źródłowych. Worker ten odpytuje agentów od baz danych, sieci czy SRE, zbiera metryki, logi i trace'y, buduje mapę zależności i dostarcza gotowy raport na czacie, wskazując konkretną linię kodu lub zawodzącą usługę.
Bezpieczeństwo i kontrola dostępu
Najgorszy koszmar każdego admina, gdy słyszy „agent w produkcji
Powiązane projekty