29 ago
|
Infinita Consulting
|
Monterrey
29 ago
Infinita Consulting
Monterrey
Buscamos un/a SRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.
La posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica, liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades
- Liderar la operación NOC/SRE 24x7, asegurando continuidad y estabilidad de servicios críticos.
- Gestionar incidentes críticos P1/P0, coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio.
- Implementar y evolucionar prácticas de Site Reliability Engineering, incluyendo SLI, SLO, Error Budgets y reducción de toil.
- Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes.
- Liderar procesos de RCA, Problem Management y blameless postmortems, asegurando acciones preventivas.
- Fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable.
- Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones.
- Impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y MTTR.
- Evaluar e implementar capacidades de AIOps, correlación de eventos y detección de anomalías.
- Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores.
- Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR.
- Desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua.
Experiencia requeridaBuscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability, incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7. Es indispensable contar con experiencia real en:
- Liderazgo de equipos NOC, SRE, Production Operations o similares.
- Operación de aplicaciones y/o infraestructura de misión crítica.
- Incident, Problem y Major Incident Management.
- RCA y postmortems.
- Observabilidad con herramientas como Dynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, CloudWatch o equivalentes.
- Métricas de confiabilidad: SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad.
- Automatización mediante Python, Bash, PowerShell, APIs, scripts o herramientas equivalentes.
- Ambientes cloud/híbridos/multicloud: AWS, Azure y/o GCP.
- Contenedores y plataformas modernas como Docker/Kubernetes.
- Herramientas ITSM y gestión como ServiceNow, Jira, Azure DevOps o similares.
Muy deseableExperiencia en AIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas DevOps/DevSecOps.
📌 Site Reliability Engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey