Asegurar la confiabilidad, disponibilidad y desempeño de los servicios productivos mediante el monitoreo continuo, la automatización de procesos operativos y la gestión productivo de incidentes, para contribuir a la mejora continua de la plataforma tecnológica y a la estabilidad del servicio
ACTIVIDADES
Monitorear la disponibilidad, desempeño y estabilidad de los servicios en producción para garantizar su operación continua
Implementar y administrar herramientas de monitoreo y observabilidad para asegurar la visibilidad de los servicios
Definir y dar seguimiento a SLIs, SLOs y SLAs para medir y garantizar los niveles de servicio
Configurar y optimizar alertas mediante criterios de monitoreo para detectar incidentes de forma oportuna
Atender y coordinar la resolución de incidentes en ambientes productivos mediante actividades de diagnóstico, escalación y seguimiento para restablecer la continuidad de los servicios
Analizar métricas, registros y trazas de operación mediante herramientas de monitoreo para identificar fallas, degradaciones y anomalías en los servicios
Realizar análisis de causa raíz y documentar incidentes a través de metodologías de postmortem para prevenir su recurrencia y fortalecer la confiabilidad operativa
Implementar automatizaciones de tareas operativas y procesos de recuperación mediante scripts y procedimientos estandarizados para optimizar la gestión de los servicios
Ejecutar pruebas de resiliencia, carga y estrés mediante escenarios controlados para validar la estabilidad y disponibilidad de los servicios
Monitorear y administrar la capacidad de la infraestructura CPU, memoria, red, almacenamiento mediante el seguimiento de recursos de procesamiento, memoria, red y almacenamiento para garantizar un desempeño adecuado de la operación
Identificar cuellos de botella mediante el análisis del comportamiento de los sistemas para proponer mejoras de rendimiento y confiabilidad
REQUISITOS
Licenciatura Ingeniería en Sistemas, Tecnologías de la Información, Computación o a fin
Experiencia de 1 año en operación de sistemas productivos
Manejo de Ambientes críticos alta disponibilidad
Manejo de incidentes y soporte avanzado
Experiencia en Streaming o servicios de alto tráfico Deseable
Conocimiento en Monitoreo y observabilidad avanzado
Manejo de Sistemas Linux diagnóstico de performance y fallas
Redes conectividad, latencia, balanceo de carga
Automatización scripting
Ingles Tecnico Avanzado
Bolsa de trabajo México ofrecemos puesto de Site Reliability Engineer SRE para el sector de Informatica Telecomunicaciones en la empresa Megacable de Guadalajara. Salario acorde a tu experiencia y al salario medio del sector. Actualiza ahora tu currículum vitae y postúlate a este empleo. Tipo de empleo Tiempo Completo.
📌 Site Reliability Engineer SRE (Guadalajara)
🏢 Megacable
📍 Guadalajara
Postulate a este anuncio
Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.