

AIS Research Workshop - Sesión 4: The Transformer
¡Esta sesión estará dedicada a aprender como funcionan los Transformers e implementar uno desde cero! Además haremos un recorrido por arquitecturas previas con el objetivo de ver la historia del procesamiento del lenguaje natural.
Las lecturas de esta semana son pesadas así que les recomiendo encararlas con tiempo.
📚 Lecturas Obligatorias Para participar efectivamente en la sesión, necesitan haber leído los siguientes papers:
"A Neural Probabilistic Language Model" (Bengio et al., 2003) 🔗https://www.jmlr.org/papers/volume3/bengio03a/bengio03a.pdf
The Unreasonable Effectiveness of Recurrent Neural Networks, Karpathy, 2015 🔗https://karpathy.github.io/2015/05/21/rnn-effectiveness/
"Attention is All You Need" (Vaswani et al., 2017) 🔗https://arxiv.org/pdf/1706.03762
(Opcional) A Mathematical Framework for Transformer Circuits, Anthropic, 2021 🔗https://transformer-circuits.pub/2021/framework/index.html