13 ago
|
AvantGarde Human Capital Reclutamiento
|
Ciudad de México
13 ago
AvantGarde Human Capital Reclutamiento
Ciudad de México
DESCRIPCIóN
Empresa del sector financiero busca un(a) Site Reliability Engineer (SRE) & Observability Engineer con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.
¿Cuál será tu misión?
Serás responsable de asegurar la estabilidad y observabilidad de servicios críticos mediante prácticas de Site Reliability Engineering (SRE), liderando iniciativas de monitoreo proactivo, automatización, gestión de incidentes, análisis de causa raíz y mejora continua.
Responsabilidades principales
- Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas).
- Definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets.
- Liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2).
- Realizar análisis de causa raíz (RCA) y conducir post-mortems.
- Automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores.
- Implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios.
- Colaborar con equipos de desarrollo, infraestructura y operaciones para fortalecer la confiabilidad de las plataformas.
REQUISITOS
Buscamos profesionales con:
- Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín. (Título indispensable)
- 7 años de experiencia en: Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.
Conocimientos técnicos
- Herramientas de observabilidad: Prometheus, Grafana, ELK / OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry y AxonOps (deseable).
- Tecnologías: Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL
- Automatización: Python, Bash, Go, Ansible, Terraform y CI/CD
- Gestión de confiabilidad: SLIs / SLOs, Error Budgets, PagerDuty u Opsgenie, ITIL v4, ISO 20000
- Inglés
📌 Ingeniero de Confiabilidad de Sitio (Ciudad de México)
🏢 AvantGarde Human Capital Reclutamiento
📍 Ciudad de México