06 sep
|
Infinita Consulting
|
Monterrey
06 sep
Infinita Consulting
Monterrey
Buscamos un/aSRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.
La posición será responsable de garantizar ladisponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades Liderar la operaciónNOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. Gestionar incidentes críticosP1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. Implementar y evolucionar prácticas deSite Reliability Engineering , incluyendoSLI, SLO, Error Budgets y reducción de toil . Liderar procesos deRCA, Problem Management y blameless postmortems , asegurando acciones preventivas. Fortalecer la estrategia deobservabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. Impulsarautomatización, auto-remediation y self-healing para disminuir intervención manual y MTTR. Evaluar e implementar capacidades deAIOps , correlación de eventos y detección de anomalías. Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. Desarrollar al equipo técnico y fomentar una cultura deownership, prevención y mejora continua .
Buscamos un/aSRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.
La posición será responsable de garantizar ladisponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades Liderar la operaciónNOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. Gestionar incidentes críticosP1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. Implementar y evolucionar prácticas deSite Reliability Engineering , incluyendoSLI, SLO, Error Budgets y reducción de toil . Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes. Liderar procesos deRCA, Problem Management y blameless postmortems , asegurando acciones preventivas. Fortalecer la estrategia deobservabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. Impulsarautomatización,
auto-remediation y self-healing para disminuir intervención manual y MTTR. Evaluar e implementar capacidades deAIOps , correlación de eventos y detección de anomalías. Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. Desarrollar al equipo técnico y fomentar una cultura deownership, prevención y mejora continua .
Experiencia requerida
Buscamos un perfil senior con aproximadamente8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.
Es indispensable contar con experiencia real en:
Liderazgo de equiposNOC, SRE, Production Operations o similares . Operación de aplicaciones y/o infraestructura de misión crítica. Incident, Problem y Major Incident Management . RCA y postmortems. Observabilidad con herramientas comoDynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, Cloud Watch o equivalentes . Métricas de confiabilidad:SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad . Automatización mediantePython, Bash, Power Shell, APIs, scripts o herramientas equivalentes . Ambientescloud/híbridos/multicloud : AWS, Azure y/o GCP. Contenedores y plataformas modernas comoDocker/Kubernetes . Herramientas ITSM y gestión comoService Now, Jira, Azure Dev Ops o similares .
Muy deseable
Experiencia enAIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas Dev Ops/Dev Sec Ops . #J-18808-Ljbffr
📌 Site reliability engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey