28 ago
|
Acute-Talent
|
México
28 ago
Acute-Talent
México
DESCRIPCIóN
Objetivo del Puesto:
Buscamos un MLOps Engineer especializado en infraestructura y orquestación para liderar la automatización, escalabilidad y confiabilidad del ciclo de vida de nuestras soluciones de Machine Learning. Serás el puente entre los equipos de Data Science y Platform Engineering, construyendo la arquitectura necesaria para llevar modelos desde la fase de experimentación hasta un entorno de producción altamente disponible, confiable y monitoreado.
Responsabilidades Principales
- Pipelines de ML y CI/CD/CT:
- Diseñar, construir y mantener pipelines automatizados de entrenamiento, validación y despliegue continuo de modelos (Continuous Training & Deployment).
- Implementar prácticas avanzadas de CI/CD adaptadas al ciclo de vida de Machine Learning utilizando GitHub Actions, GitLab CI o herramientas similares.
- Infraestructura como Código (IaC) y Gestión Cloud:
- Provisionar, escalar y mantener infraestructura en la nube (AWS/GCP/Azure) utilizando Terraform o CloudFormation.
- Administrar clústeres de Kubernetes (EKS/GKE/AKS) optimizados para cargas de trabajo de IA/ML, gestionando el cómputo en CPU/GPU de forma eficiente.
- Versionado de Artefactos:
- Garantizar la trazabilidad y reproducibilidad total del ciclo de aprendizaje mediante el versionado de código, datos (Data Versioning) y modelos (usando herramientas como DVC, MLflow o similares).
- Monitoreo, Observabilidad y Calidad:
- Implementar sistemas de monitoreo en tiempo real para detectar Data Drift, Concept Drift y degradación del rendimiento de los modelos en producción.
- Configurar alertas proactivas y tableros de métricas para garantizar SLAs operativos exigentes.
- Gobernanza, Seguridad y Colaboración:
- Integrar políticas de seguridad,
gestión de identidades y accesos (IAM), cifrado de datos y cumplimiento normativo en los pipelines.
- Colaborar de cerca con Data Scientists, Data Engineers y Cloud/DevOps Engineers para definir estándares arquitectónicos y reducir el tiempo de salida al mercado (Time-to-Market).
REQUISITOS
Técnicos (Obligatorios)
- Experiencia: 3+ años en roles de MLOps, DevOps enfocado en Datos, o Cloud Infrastructure Engineer en entornos de producción.
- Plataformas Cloud: Dominio sólido en al menos una nube principal (AWS, GCP o Azure) y sus servicios administrados de datos/ML.
- Orquestación y MLOps: Experiencia práctica en MLflow, Kubeflow, Apache Airflow, Prefect o Ray.
- Contenedores y Serverless: Experiencia avanzada en Docker y orquestación con Kubernetes.
- Infraestructura como Código: Dominio de Terraform o CloudFormation.
- Lenguajes de Programación: Nivel avanzado de Python y manejo de scripts en Bash.
- Bases de Datos y Datos: Familiaridad con arquitecturas de datos (Feature Stores, Data Lakes) y consulta de bases de datos relacionales y NoSQL.
Deseables (Plus)
- Certificación oficial en la nube (ej. AWS Certified Machine Learning / DevOps Engineer, GCP Professional ML Engineer).
- Experiencia trabajando con Feature Stores (Feast, Hopsworks, Tecton).
- Conocimiento en la optimización e inferencia de modelos de lenguaje masivos (LLMs) o arquitecturas Deep Learning.
- Manejo de KServe, Triton Inference Server o Ray Serve para inferencias a baja latencia.
Habilidades Blandas
- Mentalidad orientada a la automatización y la mejora continua.
- Excelentes habilidades de comunicación técnica para traducir necesidades entre Data Science y Platform Operations.
- Capacidad analítica y resolución de problemas bajo presión en entornos de producción.
📌 MLOps Engineer (México)
🏢 Acute-Talent
📍 México