Etiqueta · 7 publicaciones
#observability
Todo lo que he escrito etiquetado como Observability.
Segundos de trabajo, horas de residencia
Mi informe matutino empezó a fallar. Ollama estaba activo y devolvía un HTTP 500, porque una renderización de imagen de 21 segundos seguía ocupando 6.6 GB de VRAM horas después.
¿Qué Merece Atención Hoy?
Mi homelab genera un veredicto cada mañana: algo te necesita, o nada lo hace. Conseguir que la segunda parte fuera honesta fue mucho más difícil que la primera.
La alerta que nombró algo y lo presentó como evidencia
Cinco alertas de alta severidad de mi propio monitoreo. Las cinco fueron por el mismo defecto: un registro que nombra algo se leía como una observación de una propiedad que nunca midió.
Un Sandbox para Demos que Desechas
Una sola caja ejecuta todas las demos en vivo para clientes que tengo. El patrón no es nada fuera de lo común; lo interesante fue que mi monitoreo reportó cuatro demos saludables como desaparecidas.
La red es la capa que documenté al final
Mi homelab cuenta con un IPAM, métricas de cada punto de acceso y un archivo de configuración para la red que está completamente lleno de marcadores de posición, con una advertencia al inicio que lo admite.
La caída nunca fue lo que estaba depurando
Una caída total del homelab a la 01:45. Primero culpé al reverse proxy, luego al IPS y después a la capa de SSO. La causa raíz fue un puerto de red caído en el switch; todo lo que sospeché era solo un síntoma.
Nota diaria: Depurando un flujo de API en producción
La prueba de integración pasó, el entorno de staging está en verde, pero en producción falla para el 1% de los llamadores. El error estaba en un lugar que nunca habría adivinado.