Clasificador Inteligente de Documentos con NLP

Comparación rigurosa de tres arquitecturas de clasificación: baseline TF-IDF/FastText, red BiLSTM y fine-tuning de BETO (BERT en español). Protocolo LOSO para evaluar generalización real en producción.

📋 Descripción del Proyecto

Proyecto académico orientado a seleccionar la mejor arquitectura de clasificación automática de documentos para integrarse en una plataforma de gestión documental en producción (TejuFiles), con foco en generalización real más allá del mejor ajuste en split aleatorio.

Se comparan tres arquitecturas: (1) un baseline con representaciones TF-IDF y FastText (embeddings preentrenados en español); (2) una red neuronal recurrente BiLSTM con mecanismo de atención; y (3) fine-tuning de BETO (dccuchile/bert-base-spanish-wwm-cased), el modelo BERT más utilizado para español. El protocolo de evaluación incluye la métrica estándar macro-F1 y un protocolo LOSO (leave-one-source-out) que evalúa el desempeño cuando se excluye completamente una fuente de documentos del entrenamiento, simulando la generalización a categorías nuevas.

La integración con TejuFiles se realiza exclusivamente vía su API REST, sin acceder directamente a su base de datos ni a su infraestructura interna. El clasificador mantiene su propia base de datos (PostgreSQL + pgvector) para almacenar embeddings y entidades NER extraídas de los documentos. Este diseño desacoplado permite actualizar el modelo de clasificación sin afectar la plataforma principal.

Características y Funcionalidades

Baseline TF-IDF/FastText

Representaciones clásicas con TF-IDF y embeddings FastText preentrenados en español.

Red BiLSTM con atención

Red neuronal recurrente bidireccional con mecanismo de atención para clasificación de texto.

Fine-tuning de BETO

Ajuste del modelo BERT en español (dccuchile/bert-base-spanish-wwm-cased) para la tarea de clasificación.

Protocolo LOSO

Leave-One-Source-Out: evalúa generalización excluyendo completamente una fuente de documentos del entrenamiento.

Integración desacoplada vía API REST

Conexión con TejuFiles exclusivamente por API, sin exposición de datos ni infraestructura interna.

pgvector para embeddings y NER

Base de datos propia (PostgreSQL + pgvector) para embeddings de documentos y entidades NER extraídas.