09 sep
|
Bluetab, an IBM
|
Xico
09 sep
Bluetab, an IBM
Xico
No solo buscamos talento, buscamos mentes curiosas que disfruten aprender y transformar el futuro.
Somos tech, somos exigentes y sí, vamos rápido. Pero nadie compite solo. Trabajamos en equipo y si buscas retos que te saquen de la zona cómoda (porque ahí no crece nadie), estás en el lugar correcto. Aquí aprenderás con expertos, participarás en proyectos de alto impacto y estarás siempre un paso adelante en tecnología.
Buscamos un
Data Engineer
con más de 3 años de experiencia en el desarrollo y mantenimiento de pipelines de datos en entornos
cloud
(AWS). El candidato será responsable de construir procesos ETL/ELT robustos, aplicar buenas prácticas de calidad de datos y colaborar con el equipo técnico para asegurar que la información esté disponible, limpia y optimizada para los productos analíticos.
1. Experiencia y Requisitos Generales
Experiencia Profesional:
3+ años de experiencia profesional trabajando como Data Engineer, construyendo y operando
data pipelines
en la nube con volúmenes de datos medianos y grandes.
Trabajo en Equipo:
Experiencia colaborando en equipos multidisciplinarios bajo metodologías ágiles y capacidad para entender requerimientos técnicos brindados por arquitectos o líderes de equipo.
Idiomas:
Inglés Intermedio (capacidad para leer documentación técnica y participar en comunicaciones escritas/reuniones de equipo).
2. Hard Skills (Competencias Técnicas)
1) Servicios AWS y Conceptos de Data Mesh
Descripción:
Manejo práctico de servicios de almacenamiento, cómputo y bases de datos en AWS, interactuando con arquitecturas orientadas a productos de datos.
Nivel Mínimo:
Experiencia operativa y de desarrollo en AWS usando Amazon S3, AWS Glue, Amazon Redshift, Athena, AWS Lambda y Step Functions.
Nivel Ideal:
Capacidad para desplegar y configurar componentes de datos en AWS siguiendo las arquitecturas y patrones definidos por el equipo.
Nivel Ideal Plus:
Familiaridad con conceptos de
Data Mesh
, uso de AWS Lake Formation y nociones de optimización de costos en la nube.
2) Data Pipelines y Procesamiento Distribuido
Descripción:
Construcción, orquestación y monitoreo de
data pipelines
(ETL/ELT) para la ingestión,
transformación y carga de datos.
Nivel Mínimo:
Experiencia creando pipelines productivos con procesos
batch
e incrementales, manejo de dependencias y control de errores.
Nivel Ideal:
Dominio de
Python
y
PySpark/Spark
para transformaciones distribuidas; experiencia con AWS Glue o EMR, manejo de particiones y reintentos.
Nivel Ideal Plus:
Experiencia optimizando el rendimiento de jobs en Spark y consumo en pipelines
near real-time
o guiados por eventos (
event-driven
).
3) SQL Avanzado y Consultas
Descripción:
Escritura y optimización de consultas SQL para transformación, validación y análisis de datos.
Nivel Mínimo:
Dominio de SQL intermedio-avanzado (
joins
, CTEs,
window functions
, agregaciones) y experiencia trabajando con Amazon Redshift u otros
data warehouses
.
Nivel Ideal:
Habilidad para diagnosticar consultas lentas, entender planes de ejecución simples y aplicar buenas prácticas de modelado y particionamiento.
Nivel Ideal Plus:
Optimización activa de
sort/distribution keys
en Redshift y sintonización de consultas para reducción de tiempos de ejecución.
4) Data Quality y Monitoreo
Descripción:
Implementación de validaciones y controles para garantizar la calidad y consistencia de la información en los pipelines.
Nivel Mínimo:
Experiencia aplicando reglas de validación de calidad de datos (duplicados, nulos, formatos) dentro de los flujos de transformación.
Nivel Idóneo:
Implementación de alertas automatizadas y registro de métricas de calidad para la detección oportuna de fallos.
Nivel Ideal Plus:
Uso e integración de
frameworks
de Data Quality (ej. Great Expectations, Deequ) y seguimiento de linaje de datos.
5) GitHub y Prácticas de Desarrollo (CI/CD)
Descripción:
Aplicación de buenas prácticas de desarrollo de software para el control de versiones y despliegue de código.
Nivel Mínimo:
Manejo cotidiano de Git/GitHub (
branching
,
pull requests
, resolución de conflictos) y documentación de código.
Nivel Ideal:
Participación activa en revisiones de código (
code reviews
) e integración de pipelines de datos en flujos básicos de CI/CD.
Nivel Ideal Plus:
Creación y mantenimiento de scripts de automatización para pruebas y despliegues en distintos ambientes (Dev/QA/Prod).4. Responsabilidades Principales
Desarrollo de Pipelines:
Construir, probar y mantener pipelines ETL/ELT en AWS utilizando Python, PySpark y SQL.
Transformación y Optimización:
Implementar transformaciones de datos eficientes asegurando el correcto particionamiento y manejo de errores.
Calidad de Datos:
Aplicar reglas de validación y monitoreo para asegurar la integridad y exactitud de las tablas y Data Products.
Mantenimiento y Soporte:
Investigar y resolver fallos o incidencias en los pipelines de producción de manera oportuna.
Buenas Prácticas:
Versionar el código en GitHub, participar en revisiones de código y documentar los flujos desarrollados.
Colaboración:
Trabajar de la mano con analistas de datos, científicos de datos y arquitectos para entender las necesidades de integración.
¿Qué tenemos para ti?
Apoyamos tu crecimiento personal y profesional con planes de desarrollo individual, donde tu eres dueñ@ de tu carrera y hasta dónde quieres llegar.
Días de descanso superiores a los de la ley: No es necesario esperar un año para disfrutar de tus días de vacaiones, además de días adicionales por tipos de eventos especiales y festividades.
Beneficios económicos adicionales a tu salario: Vales de despensa, fondo de ahorro, bolsa de capacitación, bono de bienestar, convenios y descuentos.
Apoyo emocional, queremos tu estabilidad en salud fisica y mental, por ello tenemos diversos beneficios que cubren aspectos de equilibrio personal para ti y salud para tu familia. ¡Queremos cuidar de ti y los tuyos!
Aquí hay espacio para gente buena... como tú, ¡Queremos conocerte!
📌 Aws Data Engineer (Xico)
🏢 Bluetab, an IBM
📍 Xico