
INNOSFERA #24 | RAG, Fine-tuning y salida estructurada: la guía que faltaba | Pablo García
Sobre este episodio
Un modelo entrenado con medio internet no sabe absolutamente nada de tu empresa. RAG o fine-tuning: dos palabras que aparecen en todas las reuniones y que casi nadie sabe cuándo usar. Cerramos temporada con el primer invitado que repite en Innosfera para resolverlo de una vez.
Pablo García vuelve después del episodio 5, donde desmontamos los Transformers pieza a pieza, y esta vez bajamos del "cómo funciona" al "cómo se implementa". Recorremos RAG de principio a fin —embeddings de documento, chunking, bases vectoriales, búsqueda híbrida— y entramos en el fine-tuning por la puerta buena: qué descubrieron en el paper de LoRA al comparar las matrices de pesos antes y después de reentrenar.
También dedicamos un bloque a algo que se explica poco y resuelve muchísimo: la salida estructurada. Si alguna vez has hecho fine-tuning solo para que un modelo te devolviera un JSON válido, este tramo te va a doler. Cerramos con cuatro casos prácticos para decidir qué técnica usar y con una reflexión sobre por dónde debería empezar de verdad una empresa que quiere implementar IA. Spoiler: no es por el fine-tuning.
Un episodio técnico, sin humo, contado desde dentro por alguien que implementa esto a diario.
⏱️ Capítulos
00:00 — Avance
01:14 — Intro
01:50 — Vuelve Pablo García
03:57 — ¿Qué problema resuelven RAG y fine-tuning?
05:54 — Qué es RAG
08:45 — Embeddings de documento
10:50 — Chunking: trocear, solapar y no perder el contexto
12:46 — Estrategias avanzadas y GraphRAG
14:13 — Bases de datos vectoriales y búsqueda aproximada
18:58 — El pipeline completo, paso a paso
21:03 — Búsqueda híbrida: BM25 y fusión de rankings
23:17 — Datos frescos y trazabilidad
24:08 — Permisos: por qué no se los das nunca al LLM
27:12 — Fine-tuning: por qué nadie entrena desde cero
30:36 — LoRA: la aproximación por bajo rango
35:11 — ¿Cuánto cambia realmente un modelo?
39:03 — RAG vs Fine-tuning: cuándo usar cada uno
40:35 — Salida estructurada: el problema del JSON válido
43:31 — Compiladores, gramáticas y análisis sintáctico
46:22 — Cómo se bloquean los tokens inválidos
49:02 — El formato TOON
50:57 — Cuatro casos prácticos: ¿qué usarías tú?
53:37 — Cómo montar tu primer RAG gastando céntimos
55:56 — Reflexión final: los datos primero
58:11 — Cierre de temporada
🛠️ Recursos mencionados
- n8n — RAG sin escribir código
- LangChain y LangGraph
- Ollama — embeddings en local
- vLLM — motor de inferencia
- ChromaDB — vectorial en memoria
- pgvector — vectores en PostgreSQL
- FAISS y Pinecone
- Paper original de LoRA
- Innosfera #5 — Transformers: lo que hay detrás de ChatGPT. Encuéntralo en innosferapodcast.com.
👤 Invitado
Pablo García — Data Scientist e ingeniero de IA
LinkedIn
🎧 Innosfera
innosferapodcast.com