Volver al post · Materiales

Materiales del reto de Feijoo

Selección de código, datos y pruebas que acompaña al post. Recuento de esta versión: diez casos estrictos y dos fronterizos, más siete copias sin citar de otros libros, que quedan fuera del reto. Las fichas separan el dictamen actual de las reservas; no incluyen la conversación de los agentes ni todas las notas de trabajo.

Contenido de la descarga

Comprobar el benchmark OCR

Desde la raíz de la descarga, con Python:

cd data/ocr_bench
python ../../scripts/ocr/score_bench.py

Solo usa la biblioteca estándar. Calcula la media de los errores por página, con normalización de ligaduras, s larga y palabras partidas. El alineamiento permite texto adicional al principio y al final de la salida OCR. Es una muestra de tres páginas de Trévoux, de 1703, 1716 y 1729; BSB tiene salida para dos. No es un benchmark de todo el corpus ni de todos los modelos mencionados en los apuntes.

Ejecutar el ejemplo de LaBSE

python -m venv .venv
.venv/bin/pip install -r requirements.txt
.venv/bin/python examples/demo_labse.py

La primera ejecución descarga sentence-transformers/LaBSE. El ejemplo imprime una matriz de similitudes coseno; no estima la probabilidad de copia ni reproduce los resultados del corpus completo. Los textos históricos completos de cada ejemplo se consultan en sus fichas.

Ejecutar el detector sobre el tomo incluido

.venv/bin/python scripts/match_v3.py --fmt ia --vols memoirespourlhis1716unse --no-jds --no-v2 --threads 4 --out out/demo --tsv out/demo.tsv

Este comando busca en un solo tomo, usando los segmentos I–III incluidos y los pesos guardados. No reproduce el recall 42/50 ni el recuento histórico final. Para repetir la búsqueda completa hay que aportar el corpus, manteniendo los identificadores y las ediciones. FEIJOO_SET=4-5 selecciona los segmentos IV–V; FEIJOO_OCR_DIR permite indicar el directorio de OCR rehecho, que por defecto es data/trevoux/ocr/ dentro de esta descarga. El cambio de ruta es la única adaptación de portabilidad en los scripts publicados.

Los scripts de traducción necesitan un modelo convertido de Helsinki-NLP/opus-mt-es-fr en data/cache/mt_align/opus-mt-es-fr-ct2. Se publica el código, pero no el modelo convertido ni toda la traducción del corpus. Las dependencias del benchmark de reconocimiento Kraken son distintas de las de la búsqueda y se enumeran en requirements-ocr.txt.

Fuentes y créditos

TCU: Filosofía en español, transcripción de ediciones posteriores utilizada para buscar; cada acierto se cotejó con la primera edición. Primeras ediciones: BNE Digital y USC Minerva. Los recortes BNE conservan el crédito de Biblioteca Nacional de España, CC BY 4.0.

Trévoux: Internet Archive, ejemplar Getty de 1716, y BSB/MDZ. Las imágenes son recortes de escaneos, a veces unidos con separación visible; los subrayados de la web se dibujan encima y no alteran los originales descargables. Los metadatos mantienen los créditos y condiciones identificadas por cada proveedor.

Modelos: LaBSE, artículo de Feng et al., OPUS-MT. Referencias metodológicas: Hinderks et al. y Roe, Olsen y Morrissey.