02 sep
|
Infinita Consulting
|
México
02 sep
Infinita Consulting
México
buscamos un/a sre & noc manager para liderar la operación y evolución de servicios tecnológicos críticos dentro de una organización enterprise de gran escala.
la posición será responsable de garantizar la disponibilidad, confiabilidad, resiliencia y desempeño de aplicaciones e infraestructura crítica , liderando una operación 24x7 y evolucionando el modelo de monitoreo tradicional hacia una práctica sre más preventiva, automatizada y orientada a la mejora continua.
responsabilidades
- liderar la operación noc/sre 24x7 , asegurando continuidad y estabilidad de servicios críticos.
- gestionar incidentes críticos p1/p0 , coordinando war rooms, escalaciones, comunicación con stakeholders y recuperación del servicio.
- implementar y evolucionar prácticas de site reliability engineering , incluyendo sli, slo, error budgets y reducción de toil .
- definir y monitorear indicadores como disponibilidad, sla/slo, mttr, mtbf, recurrencia e incidentes.
- liderar procesos de rca, problem management y blameless postmortems , asegurando acciones preventivas.
- fortalecer la estrategia de observabilidad mediante métricas, logs, traces, dashboards y alertamiento accionable.
- reducir alert noise y evolucionar de monitoreo reactivo hacia detección preventiva de degradaciones.
- impulsar automatización, auto-remediation y self-healing para disminuir intervención manual y mttr.
- evaluar e implementar capacidades de aiops , correlación de eventos y detección de anomalías.
- coordinar equipos de infraestructura, aplicaciones, desarrollo, cloud, seguridad y proveedores.
- asegurar resiliencia, alta disponibilidad, capacidad, continuidad y dr.
- desarrollar al equipo técnico y fomentar una cultura de ownership, prevención y mejora continua .
experiencia requerida
buscamos un perfil senior con aproximadamente 8+ años de experiencia en operaciones de ti, infraestructura, producción o reliability , incluyendo experiencia comprobable liderando equipos y servicios críticos 24x7.
es indispensable contar con experiencia real en:
- liderazgo de equipos noc, sre, production operations o similares .
- operación de aplicaciones y/o infraestructura de misión crítica.
- incident, problem y major incident management .
- rca y postmortems.
- observabilidad con herramientas como dynatrace, datadog, grafana, prometheus, splunk, elk, zabbix, cloudwatch o equivalentes .
- métricas de confiabilidad: sli, slo, sla, error budgets, mttr y disponibilidad .
- automatización mediante python, bash, powershell, apis, scripts o herramientas equivalentes .
- ambientes cloud/híbridos/multicloud : aws, azure y/o gcp.
- contenedores y plataformas modernas como docker/kubernetes .
- herramientas itsm y gestión como servicenow, jira, azure devops o similares .
muy deseable
experiencia en aiops, auto-healing, auto-remediation, infrastructure as code, ci/cd, terraform/ansible, kubernetes y prácticas devops/devsecops .
📌 Site reliability engineering (México)
🏢 Infinita Consulting
📍 México