Buscamos un(a) Ingeniero(a) PySpark Senior responsable de diseñar, desarrollar y optimizar procesos de ingeniería y transformación de datos utilizando Python y PySpark, asegurando la calidad, disponibilidad y eficiencia de grandes volúmenes de información.
La persona seleccionada participará en proyectos de Data Engineering, Big Data y procesamiento distribuido, colaborando con equipos de desarrollo, arquitectura, analítica y negocio para construir soluciones escalables y de alto rendimiento.
Responsabilidades
- Diseñar, desarrollar y mantener procesos de ETL/ELT utilizando PySpark y Python.
- Procesar y transformar grandes volúmenes de datos mediante arquitecturas distribuidas.
- Desarrollar pipelines de datos robustos, escalables y eficientes.
- Optimizar jobs de Spark, consultas y procesos de transformación para mejorar tiempos de ejecución y consumo de recursos.
- Trabajar con fuentes de datos estructuradas y no estructuradas.
- Integrar información proveniente de bases de datos, APIs, archivos y diferentes fuentes de información.
- Implementar procesos de validación, limpieza y transformación de datos.
- Participar en el diseño de arquitecturas de datos y soluciones Big Data.
- Monitorear y solucionar errores en pipelines y procesos de procesamiento de datos.
- Implementar buenas prácticas de desarrollo, control de versiones y documentación.
- Colaborar con Data Engineers, Data Scientists, DevOps, arquitectos y equipos de negocio.
- Participar en procesos de automatización y mejora continua de las plataformas de datos.
Requisitos técnicos
- +2 años de experiencia en Data Engineering o desarrollo de soluciones de procesamiento de datos.
- Experiencia sólida con PySpark y Python.
- Conocimiento de Apache Spark y procesamiento distribuido.
- Experiencia desarrollando procesos ETL/ELT.
- Manejo avanzado de SQL.
- Experiencia con bases de datos relacionales y/o NoSQL.
- Conocimiento de formatos como Parquet, JSON, CSV y Avro.
- Experiencia con herramientas de control de versiones, principalmente Git.
- Conocimiento de ambientes Linux/Unix.
- Experiencia con alguna plataforma Cloud como AWS, Azure o GCP.
- Deseable experiencia con servicios de datos como Databricks, AWS Glue, EMR, Azure Databricks, Synapse o similares.
- Deseable conocimiento de herramientas de orquestación como Airflow.
- Deseable experiencia con Docker y CI/CD.
We may use artificial intelligence (AI) tools to support parts of the hiring process, such as reviewing applications, analyzing resumes, or assessing responses and identifying potential inconsistencies or verification signals in application materials based on available information. These tools assist our recruitment team but do not replace human judgment. Final hiring decisions are ultimately made by humans. If you would like more information about how your data is processed, please contact us.
📌 Ingeniero PySpark (México)
🏢 Icodde
📍 México