Site Reliability Engineering (Monterrey)

Site Reliability Engineering (Monterrey)

31 ago
|
Infinita Consulting
|
Monterrey

31 ago

Infinita Consulting

Monterrey

Buscamos un/a SRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala. La posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua. Responsabilidades - Liderar la operación NOC/SRE 24x7 , asegurando continuidad y estabilidad de servicios críticos. - Gestionar incidentes críticos P1/P0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio. - Implementar y evolucionar prácticas de Site Reliability Engineering , incluyendo SLI, SLO, Error Budgets y reducción de toil . - Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes. - Liderar procesos de RCA, Problem Management y blameless postmortems , asegurando acciones preventivas. - Fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable. - Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones. - Impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y MTTR. - Evaluar e implementar capacidades de AIOps , correlación de eventos y detección de anomalías.



- Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores. - Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR. - Desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua . Experiencia requerida Buscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7. Es indispensable contar con experiencia real en: - Liderazgo de equipos NOC, SRE, Production Operations o similares . - Operación de aplicaciones y/o infraestructura de misión crítica. - Incident, Problem y Major Incident Management . - RCA y postmortems. - Observabilidad con herramientas como Dynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, CloudWatch o equivalentes . - Métricas de confiabilidad: SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad . - Automatización mediante Python, Bash, PowerShell, APIs, scripts o herramientas equivalentes . - Ambientes cloud/híbridos/multicloud : AWS, Azure y/o GCP. - Contenedores y plataformas modernas como Docker/Kubernetes . - Herramientas ITSM y gestión como ServiceNow, Jira, Azure DevOps o similares . Muy deseable Experiencia en AIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas DevOps/DevSecOps .

📌 Site Reliability Engineering (Monterrey)
🏢 Infinita Consulting
📍 Monterrey

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (monterrey) / monterrey

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (monterrey) / monterrey