UD03 · Taller 2 — Un sistema de PLN de punta a punta¶
Objetivo: diseñar y construir, siguiendo la metodología de seis pasos, un sistema de PLN con spaCy orientado a una tarea de tu elección.
No necesitas GPU: todo va en el contenedor de la unidad.
Fase 1 — Define la tarea¶
Elige una: un extractor de entidades de un dominio (médico, legal, deportivo…), o un matcher de preguntas frecuentes de este módulo.
✏️ Respuesta: qué entra, qué sale, para quién.
(escribe aquí)
Fase 3 — Implementa con spaCy¶
%pip install spacy
# python -m spacy download es_core_news_sm # descomenta la primera vez
import spacy
nlp = spacy.load("es_core_news_sm")
# TU CÓDIGO: si es un extractor de entidades, añade un EntityRuler con tus patrones;
# si es un matcher de preguntas, usa PhraseMatcher o Matcher
...
Fase 4 — Evalúa¶
Prueba tu sistema con al menos 10 textos que no hayas usado para diseñarlo.
textos_prueba = [
# TU CÓDIGO: al menos 10 textos de prueba
]
# TU CÓDIGO: ejecuta tu sistema sobre cada uno y anota si acierta
...
✏️ Respuesta: exactitud aproximada y los errores, leídos uno a uno: ¿qué tienen en común?
(escribe aquí)
Fase 5 — Documenta¶
✏️ Respuesta: origen de los datos, licencia, decisiones tomadas (por qué reglas y no un modelo estadístico, o al revés) y limitaciones que asumes.
(escribe aquí)
Fase 6 — Mejora (reto)¶
✏️ Respuesta: propón una mejora concreta —más patrones, otro tagset, un modelo estadístico en vez de reglas— sin necesidad de implementarla. Y responde: ¿por qué elegiste spaCy y no otra herramienta? La respuesta buena habla de los datos que tenías, no de lo moderna que es la técnica.
(escribe aquí)