30 ago
|
Infinita Consulting
|
Monterrey
30 ago
Infinita Consulting
Monterrey
Buscamos un/a SRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala. La posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades Liderar la operación NOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos.
Gestionar incidentes críticos P1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio.
Implementar y evolucionar prácticas de Site Reliability Engineering , incluyendo SLI, SLO, Error Budgets y reducción de toil .
Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes.
Liderar procesos de RCA, Problem Management y blameless postmortems , asegurando acciones preventivas.
Fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable.
Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones.
Impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y MTTR.
Evaluar e implementar capacidades de AIOps , correlación de eventos y detección de anomalías.
Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores.
Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR.
Desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua .
Experiencia requerida Buscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.
Es indispensable contar con experiencia real en:
Liderazgo de equipos NOC, SRE, Production Operations o similares .
Operación de aplicaciones y/o infraestructura de misión crítica.
Incident, Problem y Major Incident Management .
RCA y postmortems.
Observabilidad con herramientas como Dynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, CloudWatch o equivalentes .
Métricas de confiabilidad: SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad .
Automatización mediante Python, Bash, PowerShell, APIs, scripts o herramientas equivalentes .
Ambientes cloud/híbridos/multicloud : AWS, Azure y/o GCP.
Contenedores y plataformas modernas como Docker/Kubernetes .
Herramientas ITSM y gestión como ServiceNow, Jira, Azure DevOps o similares .
Muy deseable Experiencia en AIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas DevOps/DevSecOps .
📌 Site Reliability Engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey