Site Reliability Engineering (Nuevo León)

Site Reliability Engineering (Nuevo León)

31 ago
|
Infinita Consulting
|
Nuevo León

31 ago

Infinita Consulting

Nuevo León

Buscamos un/a SRE & NOC Manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.La posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica, liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica SRE más preventiva, automatizada y orientada a la mejora continua.ResponsabilidadesLiderar la operación NOC/SRE 24x7, asegurando continuidad y estabilidad de servicios críticos.Gestionar incidentes críticos P1/P0, coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio.Implementar y evolucionar prácticas de Site Reliability Engineering, incluyendo SLI, SLO, Error Budgets y reducción de toil.Definir y monitorear indicadores como disponibilidad, SLA/SLO, MTTR, MTBF, recurrencia e incidentes.Liderar procesos de RCA, Problem Management y blameless postmortems, asegurando acciones preventivas.Fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable.Reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones.Impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y MTTR.Evaluar e implementar capacidades de AIOps,



correlación de eventos y detección de anomalías.Coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores.Asegurar resiliencia, alta disponibilidad, capacidad, continuidad y DR.Desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua.Experiencia requeridaBuscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de TI, infraestructura, producción o reliability, incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.Es indispensable contar con experiencia real en:Liderazgo de equipos NOC, SRE, Production Operations o similares.Operación de aplicaciones y/o infraestructura de misión crítica.Incident, Problem y Major Incident Management.RCA y postmortems.Observabilidad con herramientas como Dynatrace, Datadog, Grafana, Prometheus, Splunk, ELK, Zabbix, CloudWatch o equivalentes.Métricas de confiabilidad: SLI, SLO, SLA, Error Budgets, MTTR y disponibilidad.Automatización mediante Python, Bash, PowerShell, APIs, scripts o herramientas equivalentes.Ambientes cloud/híbridos/multicloud: AWS, Azure y/o GCP.Contenedores y plataformas modernas como Docker/Kubernetes.Herramientas ITSM y gestión como ServiceNow, Jira, Azure DevOps o similares.Muy deseableExperiencia en AIOps, auto-healing, auto-remediation, Infrastructure as Code, CI/CD, Terraform/Ansible, Kubernetes y prácticas DevOps/DevSecOps.

📌 Site Reliability Engineering (Nuevo León)
🏢 Infinita Consulting
📍 Nuevo León

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (nuevo león) / nuevo león

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineering (nuevo león) / nuevo león