Site Reliability Engineer (SRE) – Mid Level
Ubicación:
Presencial – Santa Fe, CDMX
Experiencia:
3 a 6 años
Sobre la posición
En Picaio buscamos un/a
Site Reliability Engineer (SRE)
con experiencia en operación, infraestructura cloud y automatización, que quiera contribuir a la estabilidad, escalabilidad y confiabilidad de plataformas tecnológicas críticas.
Esta posición está dirigida a perfiles con entre
3 y 6 años de experiencia
en áreas como
SRE, DevOps, Cloud, Platform Engineering o Infraestructura
, que disfruten resolver problemas complejos, optimizar ambientes productivos y trabajar de manera cercana con equipos de Desarrollo y Arquitectura.
El rol tiene un enfoque aproximado de
80% operaciones e infraestructura y 20% automatización/desarrollo
, por lo que buscamos a alguien técnico, hands-on y con fuerte capacidad de troubleshooting.
Responsabilidades
Garantizar la disponibilidad, estabilidad y rendimiento de aplicaciones, servicios e infraestructura crítica.
Monitorear ambientes productivos e identificar riesgos, degradaciones o posibles puntos de falla.
Diseñar y mejorar estrategias de
monitoreo, observabilidad y alertamiento
.
Gestionar incidentes productivos, realizar análisis de causa raíz (
RCA
) y dar seguimiento a acciones de remediación.
Automatizar tareas y procesos operativos para reducir intervención manual y minimizar riesgos.
Optimizar la escalabilidad, resiliencia y eficiencia de la infraestructura.
Definir, monitorear y dar seguimiento a
SLIs, SLOs y SLAs
.
Colaborar con equipos de Desarrollo y Arquitectura para incorporar prácticas de confiabilidad desde el diseño de las soluciones.
Participar en iniciativas de mejora continua relacionadas con disponibilidad, performance y operación de los servicios.
Requisitos
Entre
3 y 6 años de experiencia
en posiciones como SRE, DevOps Engineer, Cloud Engineer, Platform Engineer, Infrastructure Engineer o similares.
Experiencia práctica operando y dando soporte a
ambientes productivos
.
Conocimiento de infraestructura cloud en
AWS, GCP y/o Azure
.
Experiencia con
Docker y Kubernetes
.
Conocimiento de herramientas de monitoreo y observabilidad como
Datadog, Grafana, Prometheus, New Relic
o similares.
Experiencia en automatización e
Infrastructure as Code
, utilizando herramientas como
Terraform, Ansible
o equivalentes.
Conocimientos sólidos de
Linux, redes e infraestructura
.
Experiencia en troubleshooting, gestión de incidentes y resolución de problemas en sistemas productivos.
Conocimiento de prácticas de alta disponibilidad, escalabilidad y resiliencia.
Deseable
Experiencia trabajando con pipelines de
CI/CD
.
Scripting en
Python, Bash o Shell
.
Experiencia con microservicios y arquitecturas distribuidas.
Conocimiento de prácticas de FinOps, seguridad cloud o DevSecOps.
Experiencia trabajando en empresas de tecnología, startups o equipos orientados a producto.
Perfil que buscamos
Buscamos a una persona:
Hands-on y con gusto por involucrarse directamente en la operación.
Analítica y con resistente capacidad de troubleshooting.
Orientada a automatización y mejora continua.
Cómoda trabajando con métricas, monitoreo y observabilidad.
Capaz de priorizar incidentes y problemas técnicos en entornos dinámicos.
Interesada en construir plataformas resilientes, escalables y de alto desempeño.
Con buena comunicación y capacidad para colaborar con diferentes equipos técnicos.
Si tienes experiencia en
DevOps, Cloud, Infraestructura o Platform Engineering
y quieres seguir desarrollándote hacia SRE, también nos interesa conocer tu perfil.
📌 Site Reliability Engineer (Sre) (Xico)
🏢 PICAIO
📍 Xico