15 sep
|
WEIRDNEUTRINO
|
Ciudad de México
15 sep
WEIRDNEUTRINO
Ciudad de México
Site Reliability Engineer (SRE) – Mid Level
Ubicación: Presencial – Santa Fe, CDMX
Experiencia: 3 a 6 años
Modalidad: Tiempo completo
Sobre la posición
En Picaio buscamos un/a Site Reliability Engineer (SRE) con experiencia en operación, infraestructura cloud y automatización, que quiera contribuir a la estabilidad, escalabilidad y confiabilidad de plataformas tecnológicas críticas.
Esta posición está dirigida a perfiles con entre 3 y 6 años de experiencia en áreas como SRE, DevOps, Cloud, Platform Engineering o Infraestructura, que disfruten resolver problemas complejos, optimizar ambientes productivos y trabajar de manera cercana con equipos de Desarrollo y Arquitectura.
El rol tiene un enfoque aproximado de 80% operaciones e infraestructura y 20% automatización/desarrollo, por lo que buscamos a alguien técnico, hands-on y con fuerte capacidad de troubleshooting.
Responsabilidades
- Garantizar la disponibilidad, estabilidad y rendimiento de aplicaciones, servicios e infraestructura crítica.
- Monitorear ambientes productivos e identificar riesgos, degradaciones o posibles puntos de falla.
- Diseñar y mejorar estrategias de monitoreo, observabilidad y alertamiento.
- Gestionar incidentes productivos, realizar análisis de causa raíz (RCA) y dar seguimiento a acciones de remediación.
- Automatizar tareas y procesos operativos para reducir intervención manual y minimizar riesgos.
- Optimizar la escalabilidad, resiliencia y eficiencia de la infraestructura.
- Definir, monitorear y dar seguimiento a SLIs, SLOs y SLAs.
- Colaborar con equipos de Desarrollo y Arquitectura para incorporar prácticas de confiabilidad desde el diseño de las soluciones.
- Participar en iniciativas de mejora continua relacionadas con disponibilidad, performance y operación de los servicios.
Requisitos
- Entre 3 y 6 años de experiencia en posiciones como SRE, DevOps Engineer, Cloud Engineer, Platform Engineer, Infrastructure Engineer o similares.
- Experiencia práctica operando y dando soporte a ambientes productivos.
- Conocimiento de infraestructura cloud en AWS, GCP y/o Azure.
- Experiencia con Docker y Kubernetes.
- Conocimiento de herramientas de monitoreo y observabilidad como Datadog, Grafana, Prometheus, New Relic o similares.
- Experiencia en automatización e Infrastructure as Code, utilizando herramientas como Terraform, Ansible o equivalentes.
- Conocimientos sólidos de Linux, redes e infraestructura.
- Experiencia en troubleshooting, gestión de incidentes y resolución de problemas en sistemas productivos.
- Conocimiento de prácticas de alta disponibilidad, escalabilidad y resiliencia.
Deseable
- Experiencia trabajando con pipelines de CI/CD.
- Scripting en Python, Bash o Shell.
- Experiencia con microservicios y arquitecturas distribuidas.
- Conocimiento de prácticas de FinOps, seguridad cloud o DevSecOps.
- Experiencia trabajando en empresas de tecnología, startups o equipos orientados a producto.
Perfil que buscamos
Buscamos a una persona:
- Hands-on y con gusto por involucrarse directamente en la operación.
- Analítica y con resistente capacidad de troubleshooting.
- Orientada a automatización y mejora continua.
- Cómoda trabajando con métricas, monitoreo y observabilidad.
- Capaz de priorizar incidentes y problemas técnicos en entornos dinámicos.
- Interesada en construir plataformas resilientes, escalables y de alto desempeño.
- Con buena comunicación y capacidad para colaborar con diferentes equipos técnicos.
Si tienes experiencia en DevOps, Cloud, Infraestructura o Platform Engineering y quieres seguir desarrollándote hacia SRE, también nos interesa conocer tu perfil.
📌 Site Reliability Engineer (SRE) – Mid Level | DCO (Ciudad de México)
🏢 WEIRDNEUTRINO
📍 Ciudad de México