Cómo construir un asistente de IA conversacional con tus propios datos usando LLM Zoomcamp
El año pasado intenté construir un sistema RAG para buscar en documentación interna. Parecía que todo lo que necesitabas era enviar archivos a la API de OpenAI y obtener respuestas. En la práctica, las cosas fueron diferentes: el modelo regularmente alucinaba, el texto no cabía en la ventana de contexto, y la búsqueda vectorial común tropezaba con términos técnicos y abreviaturas.
Si has encontrado problemas similares, échale un vistazo al proyecto de DataTalksClub. Su repositorio llm-zoomcamp es un curso gratuito de código abierto de 10 semanas que te enseña cómo construir aplicaciones de IA viables con búsqueda, agentes y monitoreo.

Ingeniería Paso a Paso en Lugar de Teoría Seca
Los autores del curso no pierden tiempo derivando fórmulas de retropropagación. El programa está dirigido a desarrolladores e ingenieros de datos que necesitan construir servicios de producción.
Todo el material está dividido en módulos prácticos:
- RAG básico y agentes. Construir tu primera pipeline basada en búsqueda de texto y conectar function calling.
- Búsqueda vectorial. Generar embeddings, trabajar con minsearch, sqlitesearch y la extensión PGVector para PostgreSQL.
- Orquestación. Configurar pipelines de procesamiento de datos usando Kestra.
- Recopilación de datos. Usar la librería dlt, la base de datos DuckDB y los notebooks de marimo para analizar trazas de LLM.
- Evaluación de calidad. Métricas de evaluación de búsqueda offline y online, así como el patrón LLM-as-a-Judge.
- Monitoreo y optimización. Recopilar comentarios de usuarios, búsqueda híbrida y reranking de resultados para mejorar la precisión.
Al final, trabajas en tu propio proyecto final. Construyes un servicio desde cero: desde la limpieza de datos y la creación de una UI con Streamlit o FastAPI hasta el despliegue y la configuración de métricas.
Lo Que Necesitas para Empezar
No se requiere un servidor potente con múltiples GPUs. Todas las tareas están diseñadas para ejecutarse en una laptop común a través de APIs de terceros. Unos pocos dólares en tu saldo de OpenAI u otro proveedor son suficientes.
Los requisitos de conocimiento son mínimos:
- Dominio sólido de Python
- Experiencia con línea de comandos
- Comprensión básica de Docker
Si puedes escribir una función en Jupyter Notebook y ejecutar un contenedor en la terminal, eso es suficiente.
Formatos del Curso
Los materiales están abiertos para todos. Puedes tomar el curso de forma independiente a tu propio ritmo: leer el repositorio, ver videos en YouTube y completar las tareas.
Los autores también lanzan regularmente cohortes interactivas gratuitas. Las clases quedan grabadas, pero hay fechas límite estrictas, verificación automática de tareas, clasificaciones de participantes y revisión cruzada de proyectos (peer review).

Al completar exitosamente la cohorte y revisar el trabajo de otros estudiantes, recibes un certificado que puedes agregar a LinkedIn.
Por Qué Marcar Este Repositorio
Incluso si no planeas tomar el curso completo de 10 semanas, el repositorio vale la pena marcarlo. En las carpetas de los módulos encontrarás notebooks de Jupyter y scripts listos para usar con ejemplos de integración.
¿Necesitas agregar rápidamente búsqueda híbrida a Postgres? Abre el módulo de búsqueda vectorial. ¿Quieres configurar la evaluación de respuestas del modelo? Ve a la sección de evaluación. El código no tiene abstracción innecesaria—todo está escrito en Python puro con comentarios claros.
Echa un vistazo a la carpeta 01-agentic-rag—ahí puedes construir tu primer prototipo funcional de búsqueda de documentos en un par de horas.
Proyectos relacionados