Site Reliability Engineering (Monterrey)

Site Reliability Engineering (Monterrey)

02 sep
|
Infinita Consulting
|
Monterrey

02 sep

Infinita Consulting

Monterrey

Buscamos un/a

SRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.

La posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.

Responsabilidades

- Liderar la operación

NOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. - Gestionar incidentes críticos

P1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. - Implementar y evolucionar prácticas de

Site Reliability Engineering , incluyendo

SLI, SLO, Error Budgets y reducción de toil . - Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes. - Liderar procesos de

RCA, Problem Management y blameless postmortems , asegurando acciones preventivas. - Fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. - Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. - Impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y MTTR. - Evaluar e implementar capacidades de

AIOps , correlación de eventos y detección de anomalías.



- Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. - Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. - Desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua .

Experiencia requerida

Buscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.

Es indispensable contar con experiencia real en:

- Liderazgo de equipos

NOC, SRE, Production Operations o similares . - Operación de aplicaciones y/o infraestructura de misión crítica. - Incident, Problem y Major Incident Management . - RCA y postmortems. - Observabilidad con herramientas como

Dynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, CloudWatch o equivalentes . - Métricas de confiabilidad:

SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad . - Automatización mediante

Python, Bash, PowerShell, APIs, scripts o herramientas equivalentes . - Ambientes cloud/híbridos/multicloud : AWS, Azure y/o GCP. - Contenedores y plataformas modernas como

Docker/Kubernetes . - Herramientas ITSM y gestión como

ServiceNow, Jira, Azure DevOps o similares .

Muy deseable

Experiencia en

AIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas DevOps/DevSecOps .

📌 Site Reliability Engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (monterrey) / monterrey

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (monterrey) / monterrey