Expansión TI
Insights

IA

RAG empresarial en 2026: guía práctica de implementación

Cómo montar un sistema RAG (Retrieval-Augmented Generation) sobre su base documental sin sobrecostos: elección de embedding, vector store, reranker y evaluación con RAGAS.

Rodrigo Roncancio··11 min de lectura

Si en su empresa ya usan ChatGPT o Claude pero sienten que "no sabe lo nuestro" — que pide contexto una y otra vez sobre sus procesos, contratos, políticas, manual de operaciones — la respuesta técnica se llama RAG: Retrieval-Augmented Generation.

Un sistema RAG recupera fragmentos relevantes de sus documentos y los inyecta al prompt del modelo para que responda con contexto real. Bien montado ahorra 20-40% del tiempo de un empleado en tareas de búsqueda + redacción. Mal montado quema plata en tokens sin mejorar precisión.

Esta guía cubre las 6 decisiones técnicas que definen si el proyecto RAG paga o no.

Arquitectura mínima

Documentos → Chunking → Embeddings → Vector Store → Retriever → Reranker → LLM → Respuesta

Cada eslabón es una decisión de costo y calidad.

Decisión 1: Chunking

¿Cómo dividir sus documentos? Opciones:

  • Fixed size (500-1000 tokens con overlap 100): rápido, funciona para docs uniformes.
  • Semantic chunking: divide por cambio de tema (usando embeddings). Mejor para papers, contratos largos.
  • Structure-aware: respeta H1/H2/H3 de Markdown/HTML, headers de PDF. Recomendado para manuales corporativos.

Regla: fixed size 500 tokens con overlap 15% es baseline que funciona en 80% de casos. Optimice solo si retrieval falla.

Decisión 2: Embedding

Modelo que convierte texto en vector. Los serios en 2026:

ModeloDimsCosto / 1M tokensCuando usar
OpenAI text-embedding-3-small1536$0.02Baseline barato
OpenAI text-embedding-3-large3072$0.13Precisión importa
Voyage-3-large1024$0.18Multilenguaje serio
Cohere embed-multilingual-v31024$0.10Español + inglés mixto
BGE-M3 (open source)1024Self-hostDatos sensibles on-prem

Para español colombiano: Cohere multilingual-v3 gana en pruebas propias. OpenAI 3-large es segundo.

Decisión 3: Vector Store

Dónde guardar los vectores + hacer búsqueda por similaridad.

  • pgvector (Postgres extension): 90% de casos. Ya tiene Postgres, ya tiene backups, ya sabe operarlo. Escalable hasta ~10M vectores sin fricción.
  • Qdrant: si necesita filtros complejos + escala mayor. Deploy self-host trivial en Docker.
  • Pinecone: managed, sin fricción. Cara a $70/mes por índice small.
  • Weaviate: si combina búsqueda vectorial + BM25 nativo.

Recomendación empresa colombiana mediana: pgvector. Si ya tiene Supabase o RDS, más aún.

Decisión 4: Retriever

Cuántos chunks devolver y cómo mezclar señales.

  • Top-K = 10 baseline. Menos pierde recall, más satura contexto.
  • Hybrid search (vector + BM25 keyword): +15% de recall típico. Todos los vector stores serios lo soportan.
  • Query rewriting: usar LLM para expandir/reformular pregunta antes de buscar. Especialmente útil para queries cortas o ambiguas.

Decisión 5: Reranker (el que casi nadie usa)

Después de recuperar 20-50 candidatos, un modelo especializado los reordena por relevancia real. Cohere Rerank y BAAI/bge-reranker-v2 son opciones. Costo: $0.02/1000 rerankings.

Impacto real: en pruebas propias sobre docs corporativos, +20-30% de precisión@5 sin cambiar más nada. Es la mejora de mayor ROI en RAG.

Decisión 6: LLM final

Con contexto bien recuperado, el LLM final es menos crítico de lo que parece. Opciones actuales:

  • Claude Sonnet 4.5: mejor razonamiento sobre documentos largos.
  • GPT-4o-mini: 20x más barato, calidad suficiente en 70% de casos.
  • Gemini 2.5 Flash: barato + rápido, calidad decente.
  • Llama 3.3 70B (self-host): datos sensibles + volumen alto justifica infra.

Evaluación con RAGAS

Métricas serias, no vibes:

  • Context Recall: ¿el retriever trajo la info necesaria?
  • Context Precision: ¿lo que trajo es relevante?
  • Faithfulness: ¿la respuesta se apega a los docs, sin alucinar?
  • Answer Relevance: ¿la respuesta atiende la pregunta?

Necesita un dataset de 30-50 preguntas anotadas de ejemplo para iterar. Sin dataset no hay evaluación seria.

Errores frecuentes que matan el ROI

  • Chunk sizes gigantes (2000+ tokens): retriever regresa docs enteros, LLM se pierde.
  • No usar reranker: pierde 25% de precisión de forma trivial.
  • Todo con GPT-4: costo se dispara sin justificación. GPT-4o-mini con buen retrieval + reranker suele ser mejor tradeoff.
  • Reindexar todo cada semana: costoso. Incremental update es un problema resuelto (metadata timestamps).
  • Sin logging: sin trazabilidad de qué chunks se usaron, imposible depurar respuestas incorrectas.

El sistema RAG que sí paga: pgvector + Cohere multilingual-v3 + Cohere Rerank + GPT-4o-mini para 90% de queries, escalado a Claude Sonnet cuando la pregunta requiere razonamiento largo. Costo mensual empresa 100 personas usando activamente: ~$150-400 USD.

¿Cómo ayudamos?

En nuestra práctica de Asesoría IA hacemos diseño, POC en 3-4 semanas, evaluación con RAGAS y transferencia técnica. Alineado con controles de ISO 42001 desde el arranque.

¿Listo para dar el siguiente paso?

Agende una consultoría inicial gratuita. Le enviamos un diagnóstico rápido sin compromiso.