Senior ML Engineer - Voz, Audio y Video
Autómata · Ciudad de México · Presencial · Jornada completa
Sobre Autómata
Construimos infraestructura de inteligencia artificial para empresas e instituciones de industrias reguladas en América Latina. Nuestros sistemas operan donde la seguridad, la privacidad y la trazabilidad son condiciones de entrada.
El rol
Buscamos a una persona que lleve modelos de voz, audio, imagen y video desde la experimentación hasta la operación productiva. Es un rol de ownership completo: diseñas la arquitectura, implementas los pipelines, validas los modelos y respondes por ellos en producción.
El proyecto es confidencial y sus detalles se comparten durante el proceso, bajo acuerdo de confidencialidad. Lo que sí podemos decir es que trabajarás con audio y video en condiciones reales, muy lejos de los datasets limpios, sobre infraestructura on-premise con GPUs dedicadas, sin servicios administrados ni APIs externas, y con fechas de entrega.
Qué vas a hacer
- Diseñar e implementar pipelines de procesamiento de audio, voz, imágenes y video, de la ingesta a la exposición de resultados.
- Integrar modelos de transcripción, diarización, reconocimiento de hablantes, visión computacional, LLMs y modelos multimodales.
- Desarrollar APIs y servicios productivos en Python (FastAPI, Pydantic, SQLAlchemy).
- Implementar procesamiento paralelo y distribuido con workers, colas y DAGs.
- Desplegar y optimizar inferencia en CPU y GPU, cuidando latencia, capacidad y consumo de recursos.
- Administrar el ciclo de vida de los modelos con MLflow: versionamiento, registro, despliegue, monitoreo y rollback.
- Validar con golden sets y métricas como WER, DER, EER, FAR/FRR, IoU y mAP; implementar pruebas de regresión y reproducibilidad.
- Monitorear drift, degradación y comportamiento ante datos fuera de distribución.
- Aplicar prácticas SRE: métricas, logs, trazas, alertas, SLIs y SLOs, atención de incidentes y análisis de causa raíz.
- Documentar arquitecturas, contratos, flujos técnicos y runbooks.
Lo que necesitas
- Más de 5 años en Machine Learning o ingeniería de software, con modelos operando en producción.
- Dominio avanzado de Python; experiencia con PyTorch o TensorFlow, OpenCV, MLflow y CUDA.
- Experiencia práctica en procesamiento de audio, video o señales digitales.
- Experiencia desplegando y operando modelos en infraestructura on-premise con GPU.
- Docker, Kubernetes, microservicios y sistemas orientados a eventos.
- MLOps y CI/CD; orquestación con Airflow, Prefect, Dagster o Celery.
- Criterio para evaluar trade-offs entre precisión, latencia, escalabilidad, seguridad y costo.
- Manejo responsable de audio, video, biometría y datos sensibles.
Suma puntos
- Visión por computadora: OCR, detección y seguimiento de objetos.
- Sistemas RAG, búsqueda semántica y métricas de similaridad.
- Algoritmos de grafos.
- Gobierno de datos: calidad, metadatos, linaje y control de acceso.
- Maestría en IA, Machine Learning, Ciencias Computacionales o Matemáticas Aplicadas.
Formación Licenciatura o ingeniería en Software, Sistemas, Ciencias Computacionales, IA, Ciencia de Datos, Matemáticas Aplicadas o afín.
Cómo aplicar
Envíanos un correo a
[email protected] con tu CV
📌 Ingeniero de aprendizaje automático (Miguel Hidalgo)
🏢 Automata
📍 Miguel Hidalgo