UD03 · EX2 — Clasificador de preguntas¶
Clasificar preguntas¶
En la práctica Clasificación de texto con PyTorch hemos visto el proceso para convertir un texto en una representación numérica que pueda ser utilizada por un algoritmo de aprendizaje automático. Hemos visto diferentes representaciones como Bolsa de palabras (BoW) y incrustaciones de palabras (word embeddings) y cómo entrenar una red neuronal para clasificar texto.
En esta práctica, deberás repetir el proceso para clasificar las preguntas en temas. Usaremos el conjunto de datos TREC de preguntas en inglés, en su versión moderna: SetFit/TREC-QC.
!!! Sobre el identificador del dataset datasets ya no ejecuta scripts de carga («Dataset scripts are no longer supported»), así que el identificador clásico trec (o CogComp/trec) ya no funciona, tampoco fijando una versión antigua de la librería. Usa load_dataset("SetFit/TREC-QC"), que es la misma base de preguntas ya convertida al formato actual. La categoría gruesa está en la columna label_coarse_text.
Objetivos de la práctica¶
- Reproducir el proceso de Clasificación de texto con PyTorch para clasificar preguntas por temática.
- Preparar una red neuronal con PyTorch para la clasificación.
- Probar al menos dos representaciones (bolsa de palabras y embeddings) para convertir el texto en números.
- Comparar los resultados obtenidos con cada representación.
Parte escrita (RA3-b, RA3-e, RA3-f)¶
Añade al final una sección de conclusiones que responda:
- Si tuvieras que anotar manualmente 1.000 preguntas nuevas con su tema, ¿qué decisiones de tagset tomaría un lingüista antes de empezar? (Pista: repasa el §7.2 de la teoría.)
- ¿Qué perfiles harían falta si este proyecto creciera a un producto real de atención al cliente?
- ¿Qué formación necesitarías tú para mejorar este sistema más allá de lo visto en la unidad?