UD03 · Notebooks guiados¶
Práctica: se hace, no se entrega
7 actividades que se trabajan en clase, con el profesor. No se entregas ni puntúas: preparas las entregas de la unidad y la prueba escrita del RA3.
| Actividad | Qué es | Descargar | Abrir en Colab |
|---|---|---|---|
N01 · Introducción al procesamiento del lenguaje natural | Introducción · el pipeline de PLN de punta a punta | ||
N02 · Clasificador de noticias | Clasificación de texto con PyTorch | ||
N03 · Modelos de lenguaje, DistilBERT | Modelos de lenguaje · DistilBERT | ||
N04 · Primeros pasos con spaCy | Primeros pasos con spaCy | ||
N05 · Ampliación: clasificador de géneros musicales | Ampliación · clasificador de géneros musicales | ||
N06 · Representación de texto | Práctica · representación de texto por dos caminos | ||
N07 · NLTK y Python | Práctica · etiquetado con NLTK y cess_esp |
N01 · Introducción al procesamiento del lenguaje natural¶
Los fundamentos con nltk y TextBlob: tokenizar, quitar stopwords, etiquetar categorías gramaticales, extraer frases nominales y construir representaciones bolsa de palabras, tf-idf y word embeddings. !!! caution "gensim no instala en Python 3.14" La celda de Word2Vec usa gensim, que todavía no publica rueda para Python 3.14 (su última versión, 4.4.0, llega hasta 3.13). En el contenedor de la unidad no pasa nada —lleva Python 3.12—, pero si trabajas con un intérprete más nuevo, esa celda concreta fallará al instalar. El resto del notebook no depende de gensim.
N02 · Clasificador de noticias¶
Construye un clasificador de texto desde cero: de la bolsa de palabras a los word embeddings, con un modelo de PyTorch entrenado y evaluado. Es el notebook que N09 repite sobre datos propios.
N03 · Modelos de lenguaje, DistilBERT¶
Transfer learning de manual: parte de un DistilBERT preentrenado y lo afina para análisis de sentimiento con una base de datos de tuits. N10 repite el proceso sobre reseñas de cine.
N04 · Primeros pasos con spaCy¶
El pipeline de spaCy de una sola pasada: tokenización, POS, dependencias y entidades, sobre texto en español.
N05 · Ampliación: clasificador de géneros musicales¶
Un sistema de PLN aplicado a audio: clasificar el género de una canción combinando librosa y transformers. Es el notebook más largo del módulo (240 celdas) y no cuenta horas de la unidad: queda como material de ampliación para quien quiera ir más allá de N11.
N06 · Representación de texto¶
Tokenizar, quitar stopwords y construir una bolsa de palabras y un vector tf-idf, resuelto con NLTK y con TextBlob — el mismo ejercicio, dos librerías.
Qué tienes que tener al terminar: los cuatro ejercicios resueltos por uno de los dos caminos —tú eliges— y una comparación breve con el otro. No se entrega: es práctica.
N07 · NLTK y Python¶
Procesa el corpus español anotado cess_esp: separa entrenamiento y prueba, reduce el conjunto de etiquetas morfosintácticas de 289 a un conjunto manejable, y valida con validación cruzada.
Qué tienes que tener al terminar: los seis apartados resueltos. No se entrega: es práctica.