Gerente NOC & SRE (Monterrey)

Gerente NOC & SRE (Monterrey)

31 jul
|
Infinita Consulting
|
Monterrey

31 jul

Infinita Consulting

Monterrey

Objetivo del puesto

Liderar el Centro de Operaciones (NOC) y la función de Site Reliability Engineering (SRE), garantizando la disponibilidad, estabilidad y rendimiento de los servicios críticos de TI. Será responsable de combinar la operación con la mejora continua, la automatización, la observabilidad y la implementación de prácticas de Inteligencia Artificial, alineando el área con los objetivos estratégicos del negocio y los compromisos de nivel de servicio establecidos con clientes internos y externos.

Responsabilidades principales

Definir y ejecutar la estrategia operativa del NOC y SRE, asegurando la continuidad y confiabilidad de los servicios tecnológicos.

Garantizar el cumplimiento de los acuerdos de niveles de servicio (SLA), objetivos de nivel de servicio (SLO) e indicadores de nivel de servicio (SLI).

Liderar equipos multidisciplinarios de NOC, SRE, observabilidad y automatización promoviendo una cultura de colaboración, innovación y mejora continua.

Implementar modelos operativos basados en confiabilidad, resiliencia, automatización y prevención proactiva de incidentes.

Diseñar e implementar estrategias de observabilidad integral que permitan la correlación de eventos, el monitoreo proactivo y el análisis predictivo del contexto tecnológico.

Definir e impulsar iniciativas de automatización operativa utilizando prácticas de DevOps, SRE y AIOps para reducir actividades manuales y mejorar los tiempos de respuesta.

Establecer estrategias de gestión de capacidad, disponibilidad y continuidad operativa para servicios críticos.

Liderar los procesos de gestión de incidentes mayores, análisis de causa raíz y planes de remediación permanente.

Coordinar la evolución tecnológica de las plataformas de monitoreo y observabilidad para soportar arquitecturas híbridas y ambientes multicloud.

Desarrollar tableros ejecutivos con indicadores operativos y estratégicos que permitan medir el desempeño del servicio y la experiencia del usuario final.

Funciones del puestoOperación NOC

Administrar la operación 24x7 del Centro de Operaciones.

Garantizar el monitoreo continuo de aplicaciones, infraestructura, servicios digitales, APIs, redes y componentes tecnológicos.

Supervisar los procesos de gestión de eventos,



alertamiento y escalamiento operativo.

Definir procedimientos operativos, runbooks y playbooks para la atención de incidentes.

Gestionar la disponibilidad y continuidad operativa de los servicios críticos.

Site Reliability Engineering (SRE)

Definir y administrar los indicadores de confiabilidad de los servicios tecnológicos.

Establecer y dar seguimiento a los SLI, SLO y SLA de las plataformas críticas.

Implementar estrategias de reducción del Error Budget para mejorar la estabilidad de los servicios.

Promover la adopción de prácticas SRE en coordinación con las áreas de infraestructura, desarrollo y operaciones.

Liderar iniciativas de ingeniería de confiabilidad y resiliencia tecnológica.

Observabilidad y AIOps

Diseñar la estrategia de observabilidad integral para aplicaciones, infraestructura y experiencia digital.

Implementar soluciones de monitoreo inteligente basadas en analítica avanzada y correlación automática de eventos.

Liderar proyectos de AIOps orientados a la detección temprana de anomalías, automatización de respuestas operativas y análisis predictivo.

Desarrollar mecanismos de autosanación (Self-Healing) y automatización para procesos repetitivos.

Implementar estrategias de monitoreo de experiencia digital (DEM), monitoreo sintético y monitoreo de usuarios reales.

Gestión de incidentes y mejora continua

Liderar la atención de incidentes críticos y coordinar las mesas de crisis tecnológicas.

Realizar análisis de causa raíz y definir acciones correctivas y preventivas.

Implementar programas permanentes de mejora continua enfocados en disponibilidad, rendimiento y experiencia del usuario.

Gestionar planes de capacidad, resiliencia y recuperación ante desastres.

Impulsar iniciativas de reducción del MTTR y mejora del MTBF.

Perfil requeridoEscolaridad





Ingeniería en Sistemas Computacionales, Tecnologías de Información, Telecomunicaciones o afín.

Deseable Maestría en Tecnologías de Información, Administración de Servicios o Transformación Digital.

Experiencia

Más de 8 años de experiencia en áreas de Operaciones de TI, Infraestructura o Servicios Tecnológicos.

Al menos 5 años liderando equipos de NOC, SRE, Observabilidad o Gestión de Operaciones.

Experiencia comprobable administrando operaciones críticas 24x7.

Experiencia liderando iniciativas de automatización y transformación operativa.

Deseable experiencia en ambientes híbridos y multicloud.

Conocimientos técnicos

Site Reliability Engineering (SRE).

DevOps y prácticas CI/CD.

Observabilidad y monitoreo integral.

AIOps.

Gestión de Incidentes y Problem Management.

Arquitecturas Cloud y Multicloud.

Gestión de capacidad y disponibilidad.

Gestión de continuidad del negocio y recuperación ante desastres.

Automatización operativa y scripting.

ITIL.

Gestión de servicios tecnológicos.

Herramientas deseables

Experiencia administrando herramientas como:

Dynatrace.

Grafana.

Zabbix.

Microsoft Azure

GitHub

ServiceNow.

Azure DevOps

Amazon Cloud.

Kubernetes.

Docker.

Python, Bash o PowerShell para automatización.

CompetenciasLiderazgo

Liderazgo de equipos multidisciplinarios.

Gestión del cambio organizacional.

Pensamiento estratégico.

Negociación e influencia.

Orientación al cliente.

Técnicas

Resolución de problemas complejos.

Pensamiento analítico.

Gestión de crisis tecnológicas.

Toma de decisiones basada en datos.

Gestión de riesgos tecnológicos.

Mejora continua.

Indicadores de desempeño (KPIs)

Disponibilidad de servicios críticos.

Cumplimiento de SLA y SLO.

MTTR (Mean Time to Resolution).

MTBF (Mean Time Between Failures).

Porcentaje de automatización operativa implementada.

Reducción de incidentes recurrentes.

Tiempo promedio de detección de incidentes.

Cumplimiento del Error Budget.

Nivel de satisfacción de clientes internos.

Porcentaje de alertas correlacionadas mediante AIOps.

Reducción de actividades operativas manuales.

Cumplimiento del plan anual de mejora continua.

📌 Gerente NOC & SRE (Monterrey)
🏢 Infinita Consulting
📍 Monterrey

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: gerente noc & sre (monterrey) / monterrey

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: gerente noc & sre (monterrey) / monterrey