Ingeniero/a de IA - LLMs on-premise & Agentes (Heroica Puebla de Zaragoza)

Ingeniero/a de IA - LLMs on-premise & Agentes (Heroica Puebla de Zaragoza)

03 sep
|
Invest In Quality S. A. De C. V.
|
Heroica Puebla de Zaragoza

03 sep

Invest In Quality S. A. De C. V.

Heroica Puebla de Zaragoza

Fecha de publicación: 02 Agosto 2026

Somos una empresa de software en crecimiento y estamos construyendo el núcleo analítico de inteligencia artificial de una plataforma institucional en México. Buscamos a alguien que ya haya trabajado con modelos de lenguaje fuera de la nube y quiera hacerlo a escala real. Lo distintivo del proyecto: todo corre on-premise. Ningún dato sale del servidor, no hay llamadas a APIs de terceros y el modelo nunca toca la base de datos directamente — consulta a través de herramientas acotadas con filtrado por rol. Si te interesa el reto de hacer que un LLM sea útil, rápido y auditable dentro de un ambiente cerrado, esta plaza es para ti.

Ingeniería en Sistemas, Computación, Ciencia de Datos o campo relacionado (titulado o últimos semestres con experiencia demostrable).

Mínimo 2 años con Python en producción, con FastAPI o framework equivalente.

Haber desplegado un modelo open-weights de forma local en un proyecto real - vLLM, Ollama, llama.cpp, TGI o similar. Nos interesa que puedas explicar qué modelo elegiste, con qué cuantización y cómo resolviste el consumo de memoria.

Haber construido algo con agentes o tool calling que haya llegado a manos de usuarios: LangChain, LlamaIndex, function calling directo o RAG en producción.

Saber medir un sistema de IA, no solo correrlo. Que puedas contarnos cómo supiste que tu solución funcionaba: qué mediste, contra qué, y qué hiciste con los casos en que falló.

Git, Docker y soltura trabajando sobre servidores Linux.

Criterio ético y discreción absoluta en el manejo de información confidencial.

Despliegue y operación del motor de inferencia local con modelos de arquitectura abierta cuantizados: selección de modelo, ajuste de memoria y contexto, monitoreo de latencia.

Construcción del agente conversacional en español: orquestación, memoria de sesión y un conjunto acotado de herramientas con SQL parametrizado - el modelo nunca genera SQL.

Implementación de las restricciones de acceso dentro de las herramientas, no en el prompt: el filtrado por rol y ubicación no debe poder evadirse reformulando la consulta.

Servicio de detección de patrones de riesgo sobre texto, con nivel de confianza por resultado y trazabilidad de los campos que lo activaron.

Pipeline de voz local: reconocimiento, traducción bidireccional y síntesis para español lengua originaria.

Pipeline de OCR de identificaciones oficiales,



con preprocesamiento de imagen y umbrales de confianza por campo.

Exposición de todos los componentes como microservicios en FastAPI, con logs estructurados y registro de cada inferencia.

Colaboración con el equipo de backend y con el especialista en entrenamiento de modelos que acompaña el proyecto.

Modelos de voz y traducción (Whisper, NLLB, TTS de código abierto).

OCR y visión por computadora (Tesseract, OpenCV).

PostgreSQL, incluido pgvector.

Seguridad de agentes: prompt injection, exfiltración vía herramientas.

Lugar: Hybrid (Puebla)
Skills

Ingeniería en Sistemas, Computación, Ciencia de Datos o campo relacionado (titulado o últimos semestres con experiencia demostrable).

Mínimo 2 años con Python en producción, con FastAPI o framework equivalente.

Haber desplegado un modelo open-weights de forma local en un proyecto real - vLLM, Ollama, llama.cpp, TGI o similar. Nos interesa que puedas explicar qué modelo elegiste, con qué cuantización y cómo resolviste el consumo de memoria.

Haber construido algo con agentes o tool calling que haya llegado a manos de usuarios: LangChain, LlamaIndex, function calling directo o RAG en producción.

Saber medir un sistema de IA, no solo correrlo. Que puedas contarnos cómo supiste que tu solución funcionaba: qué mediste, contra qué, y qué hiciste con los casos en que falló.

Git, Docker y soltura trabajando sobre servidores Linux.

Criterio ético y discreción absoluta en el manejo de información confidencial.

Despliegue y operación del motor de inferencia local con modelos de arquitectura abierta cuantizados: selección de modelo, ajuste de memoria y contexto, monitoreo de latencia.

Construcción del agente conversacional en español: orquestación, memoria de sesión y un conjunto acotado de herramientas con SQL parametrizado - el modelo nunca genera SQL.

Implementación de las restricciones de acceso dentro de las herramientas, no en el prompt: el filtrado por rol y ubicación no debe poder evadirse reformulando la consulta.





Servicio de detección de patrones de riesgo sobre texto, con nivel de confianza por resultado y trazabilidad de los campos que lo activaron.

Pipeline de voz local: reconocimiento, traducción bidireccional y síntesis para español lengua originaria.

Pipeline de OCR de identificaciones oficiales, con preprocesamiento de imagen y umbrales de confianza por campo.

Exposición de todos los componentes como microservicios en FastAPI, con logs estructurados y registro de cada inferencia.

Colaboración con el equipo de backend y con el especialista en entrenamiento de modelos que acompaña el proyecto.

Modelos de voz y traducción (Whisper, NLLB, TTS de código abierto).

OCR y visión por computadora (Tesseract, OpenCV).

PostgreSQL, incluido pgvector.

Seguridad de agentes: prompt injection, exfiltración vía herramientas.

Inglés B1- B2

Actividades

Despliegue y operación del motor de inferencia local con modelos de arquitectura abierta cuantizados: selección de modelo, ajuste de memoria y contexto, monitoreo de latencia.

Construcción del agente conversacional en español: orquestación, memoria de sesión y un conjunto acotado de herramientas con SQL parametrizado - el modelo nunca genera SQL.

Implementación de las restricciones de acceso dentro de las herramientas, no en el prompt: el filtrado por rol y ubicación no debe poder evadirse reformulando la consulta.

Servicio de detección de patrones de riesgo sobre texto, con nivel de confianza por resultado y trazabilidad de los campos que lo activaron.

Pipeline de voz local: reconocimiento, traducción bidireccional y síntesis para español lengua originaria.

Pipeline de OCR de identificaciones oficiales, con preprocesamiento de imagen y umbrales de confianza por campo.

Exposición de todos los componentes como microservicios en FastAPI, con logs estructurados y registro de cada inferencia.

Colaboración con el equipo de backend y con el especialista en entrenamiento de modelos que acompaña el proyecto.

Deseable

Fine-tuning con LoRA/QLoRA (transformers, peft, TRL).

Modelos de voz y traducción (Whisper, NLLB, TTS de código abierto).

OCR y visión por computadora (Tesseract, OpenCV).

PostgreSQL, incluido pgvector.

Seguridad de agentes: prompt injection, exfiltración vía herramientas.

Beneficios

100% nómina

Prestaciones de ley

#J-18808-Ljbffr

📌 Ingeniero/a de IA - LLMs on-premise & Agentes (Heroica Puebla de Zaragoza)
🏢 Invest In Quality S. A. De C. V.
📍 Heroica Puebla de Zaragoza

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: ingeniero/a de ia - llms on-premise & agentes (heroica puebla de zaragoza) / heroica puebla de zaragoza

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: ingeniero/a de ia - llms on-premise & agentes (heroica puebla de zaragoza) / heroica puebla de zaragoza