Saltar a contenido

UD03 · Notebooks guiados

Práctica: se hace, no se entrega

7 actividades que se trabajan en clase, con el profesor. No se entregas ni puntúas: preparas las entregas de la unidad y la prueba escrita del RA3.

Actividad Qué es Descargar Abrir en Colab
N01 · Introducción al procesamiento del lenguaje natural Introducción · el pipeline de PLN de punta a punta Descargar Open In Colab
N02 · Clasificador de noticias Clasificación de texto con PyTorch Descargar Open In Colab
N03 · Modelos de lenguaje, DistilBERT Modelos de lenguaje · DistilBERT Descargar Open In Colab
N04 · Primeros pasos con spaCy Primeros pasos con spaCy Descargar Open In Colab
N05 · Ampliación: clasificador de géneros musicales Ampliación · clasificador de géneros musicales Descargar Open In Colab
N06 · Representación de texto Práctica · representación de texto por dos caminos Descargar Open In Colab
N07 · NLTK y Python Práctica · etiquetado con NLTK y cess_esp Descargar Open In Colab

N01 · Introducción al procesamiento del lenguaje natural

Los fundamentos con nltk y TextBlob: tokenizar, quitar stopwords, etiquetar categorías gramaticales, extraer frases nominales y construir representaciones bolsa de palabras, tf-idf y word embeddings. !!! caution "gensim no instala en Python 3.14" La celda de Word2Vec usa gensim, que todavía no publica rueda para Python 3.14 (su última versión, 4.4.0, llega hasta 3.13). En el contenedor de la unidad no pasa nada —lleva Python 3.12—, pero si trabajas con un intérprete más nuevo, esa celda concreta fallará al instalar. El resto del notebook no depende de gensim.

N02 · Clasificador de noticias

Construye un clasificador de texto desde cero: de la bolsa de palabras a los word embeddings, con un modelo de PyTorch entrenado y evaluado. Es el notebook que N09 repite sobre datos propios.

N03 · Modelos de lenguaje, DistilBERT

Transfer learning de manual: parte de un DistilBERT preentrenado y lo afina para análisis de sentimiento con una base de datos de tuits. N10 repite el proceso sobre reseñas de cine.

N04 · Primeros pasos con spaCy

El pipeline de spaCy de una sola pasada: tokenización, POS, dependencias y entidades, sobre texto en español.

N05 · Ampliación: clasificador de géneros musicales

Un sistema de PLN aplicado a audio: clasificar el género de una canción combinando librosa y transformers. Es el notebook más largo del módulo (240 celdas) y no cuenta horas de la unidad: queda como material de ampliación para quien quiera ir más allá de N11.

N06 · Representación de texto

Tokenizar, quitar stopwords y construir una bolsa de palabras y un vector tf-idf, resuelto con NLTK y con TextBlob — el mismo ejercicio, dos librerías.

Qué tienes que tener al terminar: los cuatro ejercicios resueltos por uno de los dos caminos —tú eliges— y una comparación breve con el otro. No se entrega: es práctica.

N07 · NLTK y Python

Procesa el corpus español anotado cess_esp: separa entrenamiento y prueba, reduce el conjunto de etiquetas morfosintácticas de 289 a un conjunto manejable, y valida con validación cruzada.

Qué tienes que tener al terminar: los seis apartados resueltos. No se entrega: es práctica.


Volver a la UD03 · Entregas