02 sep
|
Infinita Consulting
|
Monterrey
02 sep
Infinita Consulting
Monterrey
Buscamos un/a
SRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.
La posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades
- Liderar la operación
NOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. - Gestionar incidentes críticos
P1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. - Implementar y evolucionar prácticas de
Site Reliability Engineering , incluyendo
SLI, SLO, Error Budgets y reducción de toil . - Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes. - Liderar procesos de
RCA, Problem Management y blameless postmortems , asegurando acciones preventivas. - Fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. - Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. - Impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y MTTR. - Evaluar e implementar capacidades de
AIOps , correlación de eventos y detección de anomalías.
- Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. - Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. - Desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua .
Experiencia requerida
Buscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.
Es indispensable contar con experiencia real en:
- Liderazgo de equipos
NOC, SRE, Production Operations o similares . - Operación de aplicaciones y/o infraestructura de misión crítica. - Incident, Problem y Major Incident Management . - RCA y postmortems. - Observabilidad con herramientas como
Dynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, CloudWatch o equivalentes . - Métricas de confiabilidad:
SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad . - Automatización mediante
Python, Bash, PowerShell, APIs, scripts o herramientas equivalentes . - Ambientes cloud/híbridos/multicloud : AWS, Azure y/o GCP. - Contenedores y plataformas modernas como
Docker/Kubernetes . - Herramientas ITSM y gestión como
ServiceNow, Jira, Azure DevOps o similares .
Muy deseable
Experiencia en
AIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas DevOps/DevSecOps .
📌 Site Reliability Engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey