Site reliability engineering (Monterrey)

Site reliability engineering (Monterrey)

06 sep
|
Infinita Consulting
|
Monterrey

06 sep

Infinita Consulting

Monterrey

Buscamos un/aSRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.

La posición será responsable de garantizar ladisponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades Liderar la operaciónNOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. Gestionar incidentes críticosP1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. Implementar y evolucionar prácticas deSite Reliability Engineering , incluyendoSLI, SLO, Error Budgets y reducción de toil . Liderar procesos deRCA, Problem Management y blameless postmortems , asegurando acciones preventivas. Fortalecer la estrategia deobservabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. Impulsarautomatización, auto-remediation y self-healing para disminuir intervención manual y MTTR. Evaluar e implementar capacidades deAIOps , correlación de eventos y detección de anomalías. Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. Desarrollar al equipo técnico y fomentar una cultura deownership, prevención y mejora continua .





Buscamos un/aSRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.

La posición será responsable de garantizar ladisponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.
Responsabilidades Liderar la operaciónNOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. Gestionar incidentes críticosP1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. Implementar y evolucionar prácticas deSite Reliability Engineering , incluyendoSLI, SLO, Error Budgets y reducción de toil . Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes. Liderar procesos deRCA, Problem Management y blameless postmortems , asegurando acciones preventivas. Fortalecer la estrategia deobservabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. Impulsarautomatización,



auto-remediation y self-healing para disminuir intervención manual y MTTR. Evaluar e implementar capacidades deAIOps , correlación de eventos y detección de anomalías. Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. Desarrollar al equipo técnico y fomentar una cultura deownership, prevención y mejora continua .
Experiencia requerida

Buscamos un perfil senior con aproximadamente8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.

Es indispensable contar con experiencia real en:

Liderazgo de equiposNOC, SRE, Production Operations o similares . Operación de aplicaciones y/o infraestructura de misión crítica. Incident, Problem y Major Incident Management . RCA y postmortems. Observabilidad con herramientas comoDynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, Cloud Watch o equivalentes . Métricas de confiabilidad:SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad . Automatización mediantePython, Bash, Power Shell, APIs, scripts o herramientas equivalentes . Ambientescloud/híbridos/multicloud : AWS, Azure y/o GCP. Contenedores y plataformas modernas comoDocker/Kubernetes . Herramientas ITSM y gestión comoService Now, Jira, Azure Dev Ops o similares .
Muy deseable

Experiencia enAIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas Dev Ops/Dev Sec Ops . #J-18808-Ljbffr

📌 Site reliability engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (monterrey) / monterrey

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (monterrey) / monterrey