Líder de Incidentes (México)

Líder de Incidentes (México)

03 ago
|
Dna
|
México

03 ago

Dna

México

Objetivo del puesto

Liderar la atención de incidentes críticos que afecten la operación tecnológica de tiendas, centros de distribución, plataformas digitales y servicios corporativos, participando activamente en el análisis técnico, la coordinación de equipos multidisciplinarios y la toma de decisiones durante eventos de alta criticidad. Será responsable de asegurar la restauración del servicio en el menor tiempo posible, minimizar el impacto al negocio y promover acciones de mejora continua que incrementen la estabilidad de las plataformas.

Responsabilidades principalesGestión de Incidentes

- Liderar de extremo a extremo la atención de Major Incidents (P1/P0).
- Participar activamente en el diagnóstico técnico junto con los equipos especialistas.
- Coordinar War Rooms con Infraestructura, Redes, Desarrollo, Cloud, Base de Datos, Seguridad y proveedores.
- Priorizar actividades de recuperación con base en el impacto al negocio.
- Validar hipótesis técnicas y proponer estrategias de mitigación mientras se identifica la causa raíz.
- Dar seguimiento puntual hasta la restauración total del servicio.

Coordinación Operativa

- Actuar como punto central de coordinación durante incidentes críticos.
- Tomar decisiones de escalamiento técnico y operativo.
- Coordinar equipos distribuidos en diferentes tecnologías.
- Gestionar proveedores cuando el incidente involucre soluciones de terceros.
- Asegurar que todas las áreas trabajen bajo un mismo plan de acción.

Comunicación

- Mantener comunicación continua con las áreas de negocio.
- Elaborar actualizaciones ejecutivas durante la contingencia.
- Comunicar riesgos, avances y tiempos estimados de recuperación.
- Preparar el cierre ejecutivo del incidente.

Análisis Técnico





No se espera que resuelva todos los incidentes directamente, pero sí que tenga la capacidad de:

- Interpretar métricas de monitoreo.
- Analizar logs.
- Comprender arquitecturas distribuidas.
- Identificar patrones de falla.
- Cuestionar diagnósticos técnicos.
- Validar planes de recuperación.
- Entender dependencias entre aplicaciones e infraestructura.

Debe ser un líder que pueda hablar el mismo lenguaje que los ingenieros.

Mejora Continua

- Liderar sesiones de Post Incident Review.
- Elaborar Root Cause Analysis.
- Identificar incidentes repetitivos.
- Dar seguimiento a acciones correctivas.
- Proponer mejoras operativas para disminuir el MTTR.

Experiencia requeridaIndispensable

Más de 5 años en al menos uno de los siguientes roles:

- Major Incident Manager
- Incident Manager
- Site Reliability Engineer (SRE)
- Production Support Lead
- Application Support Lead
- NOC Lead
- Operations Engineer
- Technical Operations Lead

Con experiencia atendiendo ambientes productivos 24x7.

Conocimientos TécnicosGestión de Servicios

- ITIL v4
- Incident Management
- Problem Management
- Change Management
- SLA / OLA
- RCA

Infraestructura

Debe comprender:

- Windows Server
- Linux
- Active Directory
- VMware
- Storage
- DNS
- DHCP
- Balanceadores
- VPN
- TCP/IP

Cloud

Experiencia en:

- Azure
- AWS

Conocimiento de:

- Kubernetes
- Docker
- Contenedores
- Microservicios

Monitoreo





Experiencia utilizando herramientas como:

- Dynatrace
- Splunk
- Datadog
- Grafana
- AppDynamics
- Azure Monitor
- CloudWatch

Debe saber interpretar dashboards, métricas y alertas.

ITSM

Experiencia administrando incidentes mediante:

- ServiceNow (altamente deseable)
- Jira Service Management
- Remedy
- ManageEngine

Retail

Deseable experiencia con plataformas como:

- POS
- ERP (SAP)
- Inventarios
- Logística
- Supply Chain
- eCommerce
- Medios de pago
- Omnicanalidad

Competencias

Buscamos una persona que sea:

- Muy operativa.
- Resolutiva.
- Analítica.
- Capaz de tomar decisiones bajo presión.
- Con excelente comunicación.
- Técnica, sin necesidad de ser especialista en todas las tecnologías.
- Orientada al negocio.
- Acostumbrada a ambientes de alta disponibilidad.

Perfil Idóneo

No buscamos únicamente un coordinador de reuniones o un administrador de tickets. Buscamos un líder operativo que pueda integrarse rápidamente durante un incidente crítico, comprender el contexto técnico, cuestionar hipótesis, facilitar la colaboración entre equipos y mantener el enfoque en la restauración del servicio. Debe sentirse cómodo trabajando en entornos de alta presión, con múltiples frentes abiertos y decisiones que impactan directamente la operación del negocio.

Requisitos deseables

- Experiencia en empresas de retail, e-commerce, logística, banca o telecomunicaciones.
- Haber trabajado con plataformas críticas de alta disponibilidad.
- Conocimiento de arquitecturas distribuidas y servicios en la nube.
- Experiencia en operaciones 24x7 y esquemas de guardias.

Sueldo: $30,000.00 - $40,000.00 al mes

Lugar de trabajo: Empleo presencial

📌 Líder de Incidentes (México)
🏢 Dna
📍 México

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: líder de incidentes (méxico) / méxico

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: líder de incidentes (méxico) / méxico