Segundo nivel de diagnóstico y restauración. Toma los casos que el primer nivel no resolvió con runbook, determina en qué capa está la causa y devuelve el servicio sin necesidad de modificar código.
RESPONSABILIDADES
Reconstruir el recorrido de la petición con la traza distribuida e identificar la capa donde se rompió.
Determinar si la causa es dato, configuración, un tercero o código.
Restablecer el servicio mediante parámetros, catálogos, banderas de funcionalidad, compensación de operaciones colgadas, o reinicio y reversión de despliegues.
Armar el caso con evidencia — mensaje enviado, respuesta, marcas de tiempo y código del proveedor — cuando la causa está fuera del perímetro del servicio.
Ejecutar y mantener los runbooks de restauración.
REQUISITOS TÉCNICOS
Observabilidad: consulta y correlación entre trazas (Tempo), bitácoras (Loki) y métricas (Prometheus) desde Grafana.
Kubernetes/Rancher a nivel operador: estado de pods, eventos, bitácoras, reinicio y reversión de despliegues.
Kafka: retraso de consumidor, reequilibrios y mensajes atorados.
Redis en modo Sentinel: identificar un failover y revisar el estado de sesión y caché.
Resilience4j: leer el estado de los circuit breakers, timeouts y reintentos.
SQL Server: consulta de bitácora y de datos replicados del core.
DESEABLES O FORMABLES DURANTE LA TRANSICIÓN
Diagnóstico de rutas de Apache Camel y del patrón Saga: compensaciones no ejecutadas y sagas sin cerrar.
Sensedia API Gateway: políticas, control de tráfico y enrutamiento.
HashiCorp Vault: diagnóstico de fallas por secreto vencido o rotado.
Interpretación de códigos de respuesta de plataformas de identidad y de token.
📌 Platform Owner Ciudad De México
🏢 NOVA SOLUTION SYSTEMS, S.A. DE
📍 Ciudad de México
Postulate a este anuncio
Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.