11 ago
|
Acute-Talent
|
Ciudad de México
11 ago
Acute-Talent
Ciudad de México
Objetivo del Puesto:
Buscamos un MLOps Engineer especializado en infraestructura y orquestación para liderar la automatización, escalabilidad y confiabilidad del ciclo de vida de nuestras soluciones de Machine Learning. Serás el puente entre los equipos de Data Science y Platform Engineering, construyendo la arquitectura necesaria para llevar modelos desde la fase de experimentación hasta un entorno de producción altamente disponible, seguro y monitoreado.
Responsabilidades Principales Pipelines de ML y CI/CD/CT:
Diseñar, construir y mantener pipelines automatizados de entrenamiento, validación y despliegue continuo de modelos ( Continuous Training & Deployment ).
Implementar prácticas avanzadas de CI/CD adaptadas al ciclo de vida de Machine Learning utilizando GitHub Actions, GitLab CI o herramientas similares.
Infraestructura como Código (IaC) y Gestión Cloud:
Provisionar, escalar y mantener infraestructura en la nube (AWS/GCP/Azure) utilizando Terraform o CloudFormation .
Administrar clústeres de Kubernetes (EKS/GKE/AKS) optimizados para cargas de trabajo de IA/ML, gestionando el cómputo en CPU/GPU de forma productivo.
Versionado de Artefactos:
Garantizar la trazabilidad y reproducibilidad total del ciclo de aprendizaje mediante el versionado de código, datos ( Data Versioning ) y modelos (usando herramientas como DVC, MLflow o similares).
Monitoreo, Observabilidad y Calidad:
Implementar sistemas de monitoreo en tiempo real para detectar Data Drift , Concept Drift y degradación del rendimiento de los modelos en producción.
Configurar alertas proactivas y tableros de métricas para garantizar SLAs operativos exigentes.
Gobernanza, Seguridad y Colaboración:
Integrar políticas de seguridad,
gestión de identidades y accesos (IAM), cifrado de datos y cumplimiento normativo en los pipelines.
Colaborar de cerca con Data Scientists, Data Engineers y Cloud/DevOps Engineers para definir estándares arquitectónicos y reducir el tiempo de salida al mercado ( Time-to-Market ).
Requisitos:
Técnicos (Obligatorios) Experiencia: 3+ años en roles de MLOps, DevOps enfocado en Datos, o Cloud Infrastructure Engineer en entornos de producción.
Plataformas Cloud: Dominio sólido en al menos una nube principal ( AWS, GCP o Azure ) y sus servicios administrados de datos/ML.
Orquestación y MLOps: Experiencia práctica en MLflow, Kubeflow, Apache Airflow, Prefect o Ray .
Contenedores y Serverless: Experiencia avanzada en Docker y orquestación con Kubernetes .
Infraestructura como Código: Dominio de Terraform o CloudFormation .
Lenguajes de Programación: Nivel avanzado de Python y manejo de scripts en Bash.
Bases de Datos y Datos: Familiaridad con arquitecturas de datos (Feature Stores, Data Lakes) y consulta de bases de datos relacionales y NoSQL.
Deseables (Plus) Certificación oficial en la nube (ej. AWS Certified Machine Learning / DevOps Engineer, GCP Professional ML Engineer).
Experiencia trabajando con Feature Stores (Feast, Hopsworks, Tecton).
Conocimiento en la optimización e inferencia de modelos de lenguaje masivos ( LLMs ) o arquitecturas Deep Learning.
Manejo de KServe, Triton Inference Server o Ray Serve para inferencias a baja latencia.
Habilidades Blandas Mentalidad orientada a la automatización y la mejora continua.
Excelentes habilidades de comunicación técnica para traducir necesidades entre Data Science y Platform Operations.
Capacidad analítica y resolución de problemas bajo presión en entornos de producción.
📌 MLOps Engineer (Ciudad de México)
🏢 Acute-Talent
📍 Ciudad de México