Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad (México)

Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad (México)

03 ago
|
AvantGarde Human Capital Reclutamiento
|
México

03 ago

AvantGarde Human Capital Reclutamiento

México

DESCRIPCIóN

Empresa del sector financiero busca un(a) Site Reliability Engineer (SRE) & Observability Engineer con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.

¿Cuál será tu misión?

Serás responsable de asegurar la estabilidad y observabilidad de servicios críticos mediante prácticas de Site Reliability Engineering (SRE), liderando iniciativas de monitoreo proactivo, automatización, gestión de incidentes, análisis de causa raíz y mejora continua.

Responsabilidades principales

- Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas).
- Definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets.
- Liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2).
- Realizar análisis de causa raíz (RCA) y conducir post-mortems.
- Automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores.




- Implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios.
- Colaborar con equipos de desarrollo, infraestructura y operaciones para fortalecer la confiabilidad de las plataformas.

REQUISITOS

Buscamos profesionales con:

- Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín. (Título indispensable)
- 7 años de experiencia en: Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.

Conocimientos técnicos

- Herramientas de observabilidad: Prometheus, Grafana, ELK / OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry y AxonOps (deseable).

- Tecnologías: Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL

- Automatización: Python, Bash, Go, Ansible, Terraform y CI/CD

- Gestión de confiabilidad: SLIs / SLOs, Error Budgets, PagerDuty u Opsgenie, ITIL v4, ISO 20000

- Inglés intermedio-avanzado.

📌 Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad (México)
🏢 AvantGarde Human Capital Reclutamiento
📍 México

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: ingeniero de confiabilidad de sitio (sre) y observabilidad (méxico) / méxico

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: ingeniero de confiabilidad de sitio (sre) y observabilidad (méxico) / méxico