¿Cómo chatear con tus PDF y documentos con IA en local?

Qué es RAG explicado fácil y cómo preguntar a tus PDF y documentos con IA en local usando herramientas como Open WebUI o AnythingLLM, sin subir nada a la nube.

E
Publicado el 5 de octubre de 2026

Este artículo contiene enlaces de afiliado: si compras a través de ellos podemos recibir una comisión, sin coste para ti. Más información.

En 30 segundos

Se hace con una técnica llamada RAG: la herramienta trocea tus documentos, busca los fragmentos relevantes para cada pregunta y se los pasa al modelo para que responda. Con aplicaciones como Open WebUI, AnythingLLM o LM Studio, conectadas a un modelo local, todo el proceso ocurre en tu ordenador.

Contratos, manuales, apuntes, facturas, actas de la comunidad de vecinos: casi todos tenemos documentos a los que nos gustaría poder preguntarles cosas sin leerlos enteros. Con un modelo de IA en tu propio ordenador puedes hacerlo sin subir ni una página a internet. La técnica que lo hace posible se llama RAG, y hoy viene integrada en varias aplicaciones gratuitas.

¿Qué es RAG explicado fácil?

Imagina que le haces una pregunta a alguien muy listo pero que no ha leído tus documentos. RAG consiste en que, antes de que responda, un ayudante busque en tus archivos las páginas que hablan del tema y se las ponga delante. Así responde con tu información, no con lo que “recuerda”.

Por dentro, el proceso tiene dos fases:

Paso Qué ocurre
1. Subes documentos PDF, Word, texto, Markdown… a la herramienta
2. Troceado Se extrae el texto y se divide en fragmentos
3. Embeddings Cada fragmento se convierte en un vector que representa su significado
4. Pregunta Tu pregunta también se convierte en vector
5. Búsqueda Se recuperan los fragmentos más parecidos
6. Respuesta El modelo responde usando esos fragmentos como contexto

Los pasos 1 a 3 se hacen una sola vez, al subir los documentos. Los pasos 4 a 6 se repiten con cada pregunta.

Esquema de RAG en dos fases: los documentos se trocean y se convierten en vectores que se guardan en una base local; cada pregunta se convierte en vector, se buscan los fragmentos más parecidos y el modelo responde con ellos citando las fuentes
RAG en dos fases: preparar los documentos una vez y, con cada pregunta, buscar los fragmentos útiles y dárselos al modelo.

De ahí salen dos ideas clave:

  • El modelo no aprende tus documentos. No hay entrenamiento: solo recibe fragmentos en cada pregunta.
  • La calidad depende de la búsqueda. Si el ayudante trae las páginas equivocadas, la respuesta será mala aunque el modelo sea bueno.

¿Por qué no pegar el documento entero en el chat?

Con documentos cortos puedes hacerlo, y a veces es la opción más sencilla. De hecho, LM Studio lo hace solo: si el archivo cabe en el contexto del modelo, lo añade entero a la conversación, y si es largo, recurre a RAG. Open WebUI también permite elegir, archivo por archivo, entre usar el documento completo o solo los fragmentos relevantes.

El límite es la ventana de contexto, es decir, cuánto texto puede tener delante el modelo a la vez. En local suele ser más pequeña de lo que parece: Ollama usa por defecto 4.096 tokens en equipos con menos de 24 GiB de VRAM, unas pocas páginas de texto. Ampliarla es posible, pero consume más memoria y hace las respuestas más lentas. Lo explicamos en cuánta VRAM necesito.

Comparación de la ventana de contexto por defecto de Ollama según la VRAM (4K, 32K y 256K tokens) y del reparto recomendado en local: 3 a 5 fragmentos de unos 1.000 tokens más la pregunta y la respuesta
Con el contexto por defecto en una gráfica doméstica, solo caben unos pocos fragmentos. Por eso RAG elige qué texto entra.
CuidadoSi usas Ollama con una gráfica de menos de 24 GB, el contexto por defecto es de 4.096 tokens. Con documentos o con muchos fragmentos, súbelo en los ajustes de Ollama o del modelo; si no, parte del texto recuperado puede quedarse fuera sin que lo notes.

¿Qué herramientas puedo usar?

Herramienta Qué es Instalación habitual Ideal para
Open WebUI Interfaz web tipo ChatGPT para modelos locales, con bases de conocimiento, citas y búsqueda híbrida Docker o pip (Python 3.11 o 3.12) Usarlo desde el navegador, también varias personas de casa
AnythingLLM Aplicación organizada en “espacios de trabajo” con sus documentos App de escritorio (Windows, macOS, Linux) o Docker Empezar rápido con documentos sin complicaciones
LM Studio App de escritorio para descargar y usar modelos locales Instalador Adjuntar documentos puntuales (PDF, DOCX, TXT) en el chat

Algunos detalles que marcan la diferencia:

  • AnythingLLM trae de serie un modelo de embeddings y una base de datos vectorial (LanceDB) locales, así que funciona sin servicios externos desde el primer momento. Tiene un modo Query que solo responde con lo que hay en tus documentos y avisa si no encuentra nada.
  • Open WebUI usa por defecto el modelo de embeddings all-MiniLM-L6-v2, que funciona en local sin configurar nada. En el chat, escribes # para elegir el documento o la colección a la que quieres preguntar, y las respuestas incluyen citas.
  • LM Studio hace todo el procesado de documentos en local y puede funcionar sin conexión una vez descargado el modelo.

Open WebUI y AnythingLLM se conectan habitualmente a Ollama como motor; si dudas entre motores, mira Ollama vs LM Studio, y si aún no lo tienes, la guía para instalar Ollama en Windows. Las funciones de estas herramientas cambian a menudo, así que conviene revisar su documentación oficial antes de decidir.

¿Cómo lo monto paso a paso?

El esquema general es el mismo en todas:

  1. Instala el motor (por ejemplo, Ollama) y descarga un modelo de chat que quepa en tu equipo. Puedes orientarte con ¿qué IA puedo ejecutar?.
  2. Elige un modelo de embeddings, el que convierte texto en vectores. Open WebUI y AnythingLLM traen uno por defecto; Ollama también ofrece varios en su biblioteca, como nomic-embed-text, mxbai-embed-large o bge-m3.
  3. Instala la interfaz (Open WebUI o AnythingLLM) y conéctala al motor local.
  4. Crea una colección o espacio de trabajo y sube tus documentos.
  5. Pregunta y revisa las citas o fuentes que muestra la herramienta para comprobar de dónde sale la respuesta.
ConsejoDecide el modelo de embeddings antes de subir muchos documentos. Si lo cambias después, hay que volver a procesarlos todos: AnythingLLM recomienda no cambiarlo una vez empezado y Open WebUI pide reindexar los documentos.

¿Cómo consigo mejores respuestas?

  • Documentos limpios: PDF con texto real, no imágenes escaneadas. Si son escaneos, pásalos antes por OCR o activa un motor de extracción con OCR.
  • Preguntas concretas: “¿Qué dice el contrato sobre la renovación?” funciona mejor que “resúmeme todo”. LM Studio recomienda incluir en la pregunta las palabras que esperas encontrar en el documento.
  • Ajusta el troceado: fragmentos demasiado pequeños pierden contexto; demasiado grandes meten ruido. Para modelos locales con contexto de hasta 8K tokens, la guía de Open WebUI sugiere fragmentos de unos 1.000 tokens y entre 3 y 5 resultados.
  • Elige un modelo de embeddings multilingüe si tus documentos están en español. El que trae Open WebUI por defecto, all-MiniLM-L6-v2, está entrenado solo con textos en inglés; en la biblioteca de Ollama, bge-m3, nomic-embed-text-v2-moe o snowflake-arctic-embed2 admiten varios idiomas.
  • Usa un modelo de chat adecuado: uno mediano bien cuantizado suele bastar. Si no conoces los formatos, lee qué es la cuantización.
  • Pide que cite las fuentes y comprueba siempre los datos importantes.

¿Qué limitaciones tiene?

  • Puede equivocarse o inventar si no encuentra el fragmento correcto. La documentación de Open WebUI lo resume bien: el modelo suele fallar porque nunca recibió el contenido correcto. No lo uses como única fuente para decisiones legales, médicas o económicas.
  • Tablas, gráficos y maquetaciones complejas se extraen mal en muchos PDF.
  • Preguntas globales (“¿cuál es la idea principal de estos 200 documentos?”) funcionan peor que las concretas, porque solo se recuperan unos pocos fragmentos.
  • El rendimiento depende de tu hardware: si el modelo no cabe en la gráfica, las respuestas serán lentas.

¿Es realmente privado?

Si el motor, el modelo de embeddings y la interfaz se ejecutan en tu equipo, tus documentos no salen de casa. Pero revisa la configuración: estas herramientas también permiten conectar proveedores en la nube (OpenAI, Anthropic y otros), y si eliges uno de ellos para el chat o para los embeddings, los fragmentos se enviarán fuera. Comparamos ambos enfoques en IA local vs ChatGPT.

¿Cuál elegimos? Nuestra recomendación

Si quieres empezar en una tarde y preguntar a unos cuantos PDF, AnythingLLM con Ollama es probablemente el camino más directo: app de escritorio, embeddings y base vectorial incluidos, y un modo que solo responde con tus documentos. Si buscas una interfaz web completa, tipo ChatGPT, que puedan usar varias personas de casa desde el navegador, Open WebUI con Ollama es más potente y configurable, aunque pide algo más de trabajo. Y si solo necesitas consultar un documento de vez en cuando, LM Studio ya lo resuelve adjuntándolo en el chat. Sea cual sea tu elección, cuida la calidad de los documentos, haz preguntas concretas y revisa siempre las fuentes que cita la respuesta.

Según los usuarios que comparten sus ajustes en el debate sobre RAG del repositorio de Open WebUI en GitHub, lo que más mejora los resultados es trocear en fragmentos más pequeños (algunos usan 512 tokens), activar la búsqueda híbrida con un modelo de reranking y usar embeddings multilingües; también señalan como limitación que la configuración es global y no se puede adaptar a cada tipo de documento.

Preguntas frecuentes

¿Qué significa RAG?+

Retrieval-Augmented Generation, o generación aumentada por recuperación. La IA primero recupera fragmentos relevantes de tus documentos y luego genera la respuesta basándose en ellos.

¿El modelo aprende de mis documentos?+

No. Con RAG el modelo no se reentrena: simplemente recibe los fragmentos relevantes junto a tu pregunta. Si borras los documentos de la herramienta, el modelo no conserva nada.

¿Funciona con PDF escaneados?+

Solo si se puede extraer el texto. Un PDF escaneado como imagen necesita OCR antes. Open WebUI permite usar motores de extracción con OCR, como Docling o Apache Tika; en otras herramientas conviene pasar el PDF por un programa de OCR antes de subirlo.

¿Por qué a veces responde mal aunque la información está en el documento?+

Normalmente porque la búsqueda no ha encontrado el fragmento correcto, porque el texto se extrajo mal del PDF o porque el contexto del modelo es demasiado corto. Revisar la extracción, ajustar el tamaño de los fragmentos y el número de resultados, o cambiar el modelo de embeddings suele mejorar mucho.

Fuentes

  1. Open WebUI: RAG (documentación)
  2. Open WebUI: solución de problemas de RAG
  3. Open WebUI: inicio rápido
  4. AnythingLLM: documentación
  5. AnythingLLM: modos de chat
  6. AnythingLLM: configuración del embedder
  7. LM Studio: chatear con documentos
  8. LM Studio: uso sin conexión
  9. Hugging Face: all-MiniLM-L6-v2
  10. Ollama: modelos de embeddings (blog)
  11. Ollama: catálogo de modelos de embeddings
  12. Ollama: longitud de contexto
  13. GitHub: debate sobre la calidad del RAG en Open WebUI

Sigue leyendo