Saltar al contenido

RAG-Syntec — EN CURSO

Responde preguntas sobre el convenio colectivo Syntec y rechaza las que están fuera de tema antes de llamar al LLM. 172 documentos, 8,447 chunks, recuperación densa sobre Chroma.

En resumen
  • 172 docs · 8,447 chunks
  • 55 preguntas etiquetadas

Mi contribuciónIngesta y troceado: chunks de 500 caracteres con 100 caracteres de solapamiento.

ROL
Solo
CONTEXTO
Proyecto personal, a partir de un esqueleto de prueba técnica
ESTADO
En curso
RESULTADO
Solo calibración del umbral: las preguntas en tema se mantuvieron por debajo de una distancia de 0.701, las de fuera de tema por encima de 0.780; el umbral se sitúa en 0.74.
ACTUALIZADO
26 sept 2026
questionPOST /queryretrieve top-3Chroma · 8,447 chunksguardrailnearest distance ≤ 0.74?answerOllama or gpt-4o-minirefuseno LLM callyesno
Fig. — cómo funciona
1

Datos

El convenio colectivo Syntec (IDCC 1486) de Légifrance: 172 documentos divididos en 8,447 chunks, versionados en un manifiesto con hash.

2

Lo que construí

Solo

  1. Ingesta y troceado: chunks de 500 caracteres con 100 caracteres de solapamiento.
  2. Un índice Chroma con recuperación densa top-3, embeddings de un modelo local (Ollama) o de OpenAI.
  3. Generación con un modelo local o con gpt-4o-mini tras la misma interfaz.
  4. Un endpoint /query en FastAPI, Docker Compose y 30 tests de pytest.
  5. Un conjunto etiquetado de 55 preguntas en cuatro clases, más 20 reservadas, y las métricas recall@k, precision@k y MRR.
3

Decisiones clave

Rechazar antes de generar
Si el chunk más cercano está más lejos que una distancia calibrada, la API rechaza la petición sin llamar al LLM.
Corpus versionado
Un manifiesto con hash vincula cada chunk a una versión del documento.
Modelos locales o alojados
El mismo pipeline funciona sobre Ollama o sobre OpenAI.
4

Resultados

0.6 0.9 En tema, mayor distancia0.701Umbral de rechazo0.740Fuera de tema, menor distancia0.780
Script de calibración sobre 3 preguntas en tema y 3 fuera de tema (8 sept. 2026). Una muestra demasiado pequeña para fiarse del límite exacto.

Solo calibración del umbral: las preguntas en tema se mantuvieron por debajo de una distancia de 0.701, las de fuera de tema por encima de 0.780; el umbral se sitúa en 0.74.

5

Límites

  • Todavía no se ha ejecutado ninguna evaluación de la recuperación: el conjunto de preguntas y las métricas existen, el ejecutor no.
  • Solo recuperación densa: la búsqueda híbrida y el reranking están planificados, no construidos.
  • El umbral de rechazo se apoya en seis preguntas.

¿Preguntas sobre este proyecto? → Escríbeme