Si en su empresa ya usan ChatGPT o Claude pero sienten que "no sabe lo nuestro" — que pide contexto una y otra vez sobre sus procesos, contratos, políticas, manual de operaciones — la respuesta técnica se llama RAG: Retrieval-Augmented Generation.
Un sistema RAG recupera fragmentos relevantes de sus documentos y los inyecta al prompt del modelo para que responda con contexto real. Bien montado ahorra 20-40% del tiempo de un empleado en tareas de búsqueda + redacción. Mal montado quema plata en tokens sin mejorar precisión.
Esta guía cubre las 6 decisiones técnicas que definen si el proyecto RAG paga o no.
Arquitectura mínima
Documentos → Chunking → Embeddings → Vector Store → Retriever → Reranker → LLM → RespuestaCada eslabón es una decisión de costo y calidad.
Decisión 1: Chunking
¿Cómo dividir sus documentos? Opciones:
- Fixed size (500-1000 tokens con overlap 100): rápido, funciona para docs uniformes.
- Semantic chunking: divide por cambio de tema (usando embeddings). Mejor para papers, contratos largos.
- Structure-aware: respeta H1/H2/H3 de Markdown/HTML, headers de PDF. Recomendado para manuales corporativos.
Regla: fixed size 500 tokens con overlap 15% es baseline que funciona en 80% de casos. Optimice solo si retrieval falla.
Decisión 2: Embedding
Modelo que convierte texto en vector. Los serios en 2026:
| Modelo | Dims | Costo / 1M tokens | Cuando usar |
|---|---|---|---|
| OpenAI text-embedding-3-small | 1536 | $0.02 | Baseline barato |
| OpenAI text-embedding-3-large | 3072 | $0.13 | Precisión importa |
| Voyage-3-large | 1024 | $0.18 | Multilenguaje serio |
| Cohere embed-multilingual-v3 | 1024 | $0.10 | Español + inglés mixto |
| BGE-M3 (open source) | 1024 | Self-host | Datos sensibles on-prem |
Para español colombiano: Cohere multilingual-v3 gana en pruebas propias. OpenAI 3-large es segundo.
Decisión 3: Vector Store
Dónde guardar los vectores + hacer búsqueda por similaridad.
- pgvector (Postgres extension): 90% de casos. Ya tiene Postgres, ya tiene backups, ya sabe operarlo. Escalable hasta ~10M vectores sin fricción.
- Qdrant: si necesita filtros complejos + escala mayor. Deploy self-host trivial en Docker.
- Pinecone: managed, sin fricción. Cara a $70/mes por índice small.
- Weaviate: si combina búsqueda vectorial + BM25 nativo.
Recomendación empresa colombiana mediana: pgvector. Si ya tiene Supabase o RDS, más aún.
Decisión 4: Retriever
Cuántos chunks devolver y cómo mezclar señales.
- Top-K = 10 baseline. Menos pierde recall, más satura contexto.
- Hybrid search (vector + BM25 keyword): +15% de recall típico. Todos los vector stores serios lo soportan.
- Query rewriting: usar LLM para expandir/reformular pregunta antes de buscar. Especialmente útil para queries cortas o ambiguas.
Decisión 5: Reranker (el que casi nadie usa)
Después de recuperar 20-50 candidatos, un modelo especializado los reordena por relevancia real. Cohere Rerank y BAAI/bge-reranker-v2 son opciones. Costo: $0.02/1000 rerankings.
Impacto real: en pruebas propias sobre docs corporativos, +20-30% de precisión@5 sin cambiar más nada. Es la mejora de mayor ROI en RAG.
Decisión 6: LLM final
Con contexto bien recuperado, el LLM final es menos crítico de lo que parece. Opciones actuales:
- Claude Sonnet 4.5: mejor razonamiento sobre documentos largos.
- GPT-4o-mini: 20x más barato, calidad suficiente en 70% de casos.
- Gemini 2.5 Flash: barato + rápido, calidad decente.
- Llama 3.3 70B (self-host): datos sensibles + volumen alto justifica infra.
Evaluación con RAGAS
Métricas serias, no vibes:
- Context Recall: ¿el retriever trajo la info necesaria?
- Context Precision: ¿lo que trajo es relevante?
- Faithfulness: ¿la respuesta se apega a los docs, sin alucinar?
- Answer Relevance: ¿la respuesta atiende la pregunta?
Necesita un dataset de 30-50 preguntas anotadas de ejemplo para iterar. Sin dataset no hay evaluación seria.
Errores frecuentes que matan el ROI
- Chunk sizes gigantes (2000+ tokens): retriever regresa docs enteros, LLM se pierde.
- No usar reranker: pierde 25% de precisión de forma trivial.
- Todo con GPT-4: costo se dispara sin justificación. GPT-4o-mini con buen retrieval + reranker suele ser mejor tradeoff.
- Reindexar todo cada semana: costoso. Incremental update es un problema resuelto (metadata timestamps).
- Sin logging: sin trazabilidad de qué chunks se usaron, imposible depurar respuestas incorrectas.
El sistema RAG que sí paga: pgvector + Cohere multilingual-v3 + Cohere Rerank + GPT-4o-mini para 90% de queries, escalado a Claude Sonnet cuando la pregunta requiere razonamiento largo. Costo mensual empresa 100 personas usando activamente: ~$150-400 USD.
¿Cómo ayudamos?
En nuestra práctica de Asesoría IA hacemos diseño, POC en 3-4 semanas, evaluación con RAGAS y transferencia técnica. Alineado con controles de ISO 42001 desde el arranque.
