Tag · 7 Beiträge
#observability
Alles, was ich mit Observability getaggt habe.
Sekunden der Arbeit, Stunden des Aufenthalts
Mein Morgenbriefing begann zu scheitern. Ollama war zwar erreichbar, lieferte aber HTTP 500 zurück, weil ein 21 Sekunden langer Bild-Render auch Stunden später noch 6,6 GB VRAM belegte.
Was verdient heute Aufmerksamkeit
Mein Homelab liefert jeden Morgen ein Urteil: Entweder braucht dich etwas, oder es braucht dich nichts. Die zweite Hälfte ehrlich zu bekommen, war deutlich schwieriger als die erste.
Der Alarm, der etwas benannte und es zum Beweis machte
Fünf Warnmeldungen mit hoher Schwere aus meinem eigenen Monitoring. Alle fünf betrafen denselben Fehler: Ein Datensatz benennt etwas, das als Beobachtung einer Eigenschaft gelesen wird, die nie gemessen wurde.
Eine Sandbox für Demos, die du wegwirfst
Eine Box betreibt jede meiner live laufenden Kundendemos. Das Muster ist unspektakulär; interessant war, dass mein Monitoring vier gesunde Demos als fehlend meldete.
Das Netzwerk ist die Schicht, die ich zuletzt dokumentiert habe
Mein Homelab verfügt über ein IPAM, Metriken von jedem Access Point und eine Netzwerk-Konfigurationsdatei, die komplett aus Platzhaltern besteht – mit einer Warnung ganz oben, die das offen zugibt.
Der Ausfall war nie das, was ich debuggt habe
Ein kompletter Ausfall im Homelab um 01:45. Zuerst habe ich den Reverse Proxy verdächtigt, dann das IPS und schließlich die SSO-Schicht. Die eigentliche Ursache war jedoch ein ausgefallener Netzwerkport am Switch – alles, was ich vermutet hatte, waren nur Symptome.
Tägliche Notiz: Debugging eines Produktions-API-Workflows
Integrationstest grün, Staging grün, Produktion schlägt bei 1 % der Anrufer fehl. Der Fehler war an einem Ort, den ich nie vermutet hätte.