13 ago
|
Invest in Quality
|
Heroica Puebla de Zaragoza
13 ago
Invest in Quality
Heroica Puebla de Zaragoza
fecha de publicación: 02 agosto 2026
somos una empresa de software en crecimiento y estamos construyendo el núcleo analítico de inteligencia artificial de una plataforma institucional en méxico. Buscamos a alguien que ya haya trabajado con modelos de lenguaje fuera de la nube y quiera hacerlo a escala real. Lo distintivo del proyecto: todo corre on-premise. Ningún dato sale del servidor, no hay llamadas a apis de terceros y el modelo nunca toca la base de datos directamente — consulta a través de herramientas acotadas con filtrado por rol. Si te interesa el reto de hacer que un llm sea beneficioso, rápido y auditable dentro de un entorno cerrado, esta plaza es para ti.
- ingeniería en sistemas, computación, ciencia de datos o campo relacionado (titulado o últimos semestres con experiencia demostrable).
- mínimo 2 años con python en producción, con fastapi o framework equivalente.
- haber desplegado un modelo open-weights de forma local en un proyecto real - vllm, ollama, llama.cpp, tgi o similar. Nos interesa que puedas explicar qué modelo elegiste, con qué cuantización y cómo resolviste el consumo de memoria.
- haber construido algo con agentes o tool calling que haya llegado a manos de usuarios: langchain, llamaindex, function calling directo o rag en producción.
- saber medir un sistema de ia, no solo correrlo. Que puedas contarnos cómo supiste que tu solución funcionaba: qué mediste, contra qué, y qué hiciste con los casos en que falló.
- git, docker y soltura trabajando sobre servidores linux.
- criterio ético y discreción absoluta en el manejo de información confidencial.
- despliegue y operación del motor de inferencia local con modelos de arquitectura abierta cuantizados: selección de modelo, ajuste de memoria y contexto, monitoreo de latencia.
- construcción del agente conversacional en español: orquestación, memoria de sesión y un conjunto acotado de herramientas con sql parametrizado - el modelo nunca genera sql.
- implementación de las restricciones de acceso dentro de las herramientas, no en el prompt: el filtrado por rol y ubicación no debe poder evadirse reformulando la consulta.
- servicio de detección de patrones de riesgo sobre texto, con nivel de confianza por resultado y trazabilidad de los campos que lo activaron.
- pipeline de voz local: reconocimiento, traducción bidireccional y síntesis para español lengua originaria.
- pipeline de ocr de identificaciones oficiales,
con preprocesamiento de imagen y umbrales de confianza por campo.
- exposición de todos los componentes como microservicios en fastapi, con logs estructurados y registro de cada inferencia.
- colaboración con el equipo de backend y con el especialista en entrenamiento de modelos que acompaña el proyecto.
- modelos de voz y traducción (whisper, nllb, tts de código abierto).
- ocr y visión por computadora (tesseract, opencv).
- postgresql, incluido pgvector.
- seguridad de agentes: prompt injection, exfiltración vía herramientas.
lugar: hybrid (puebla)
skills
- ingeniería en sistemas, computación, ciencia de datos o campo relacionado (titulado o últimos semestres con experiencia demostrable).
- mínimo 2 años con python en producción, con fastapi o framework equivalente.
- haber desplegado un modelo open-weights de forma local en un proyecto real - vllm, ollama, llama.cpp, tgi o similar. Nos interesa que puedas explicar qué modelo elegiste, con qué cuantización y cómo resolviste el consumo de memoria.
- haber construido algo con agentes o tool calling que haya llegado a manos de usuarios: langchain, llamaindex, function calling directo o rag en producción.
- saber medir un sistema de ia, no solo correrlo. Que puedas contarnos cómo supiste que tu solución funcionaba: qué mediste, contra qué, y qué hiciste con los casos en que falló.
- git, docker y soltura trabajando sobre servidores linux.
- criterio ético y discreción absoluta en el manejo de información confidencial.
- despliegue y operación del motor de inferencia local con modelos de arquitectura abierta cuantizados: selección de modelo, ajuste de memoria y contexto, monitoreo de latencia.
- construcción del agente conversacional en español: orquestación, memoria de sesión y un conjunto acotado de herramientas con sql parametrizado - el modelo nunca genera sql.
- implementación de las restricciones de acceso dentro de las herramientas, no en el prompt: el filtrado por rol y ubicación no debe poder evadirse reformulando la consulta.
- servicio de detección de patrones de riesgo sobre texto, con nivel de confianza por resultado y trazabilidad de los campos que lo activaron.
- pipeline de voz local: reconocimiento, traducción bidireccional y síntesis para español lengua originaria.
- pipeline de ocr de identificaciones oficiales, con preprocesamiento de imagen y umbrales de confianza por campo.
- exposición de todos los componentes como microservicios en fastapi, con logs estructurados y registro de cada inferencia.
- colaboración con el equipo de backend y con el especialista en entrenamiento de modelos que acompaña el proyecto.
- modelos de voz y traducción (whisper, nllb, tts de código abierto).
- ocr y visión por computadora (tesseract, opencv).
- postgresql, incluido pgvector.
- seguridad de agentes: prompt injection, exfiltración vía herramientas.
- inglés b1- b2
actividades
- despliegue y operación del motor de inferencia local con modelos de arquitectura abierta cuantizados: selección de modelo, ajuste de memoria y contexto, monitoreo de latencia.
- construcción del agente conversacional en español: orquestación, memoria de sesión y un conjunto acotado de herramientas con sql parametrizado - el modelo nunca genera sql.
- implementación de las restricciones de acceso dentro de las herramientas, no en el prompt: el filtrado por rol y ubicación no debe poder evadirse reformulando la consulta.
- servicio de detección de patrones de riesgo sobre texto, con nivel de confianza por resultado y trazabilidad de los campos que lo activaron.
- pipeline de voz local: reconocimiento, traducción bidireccional y síntesis para español lengua originaria.
- pipeline de ocr de identificaciones oficiales, con preprocesamiento de imagen y umbrales de confianza por campo.
- exposición de todos los componentes como microservicios en fastapi, con logs estructurados y registro de cada inferencia.
- colaboración con el equipo de backend y con el especialista en entrenamiento de modelos que acompaña el proyecto.
deseable
- fine-tuning con lora/qlora (transformers, peft, trl).
- modelos de voz y traducción (whisper, nllb, tts de código abierto).
- ocr y visión por computadora (tesseract, opencv).
- postgresql, incluido pgvector.
- seguridad de agentes: prompt injection, exfiltración vía herramientas.
beneficios
- 100% nómina
- prestaciones de ley
#j-18808-ljbffr
📌 Ingeniero/a de ia - llms on-premise & agentes (Heroica Puebla de Zaragoza)
🏢 Invest in Quality
📍 Heroica Puebla de Zaragoza