

Escalado de LLM’s - Federico Lebron
🧻 Escalado de LLM’s
En esta ocasión, Federico Lebron, nos va a hablar sobre “Escalado de LLM’s” una charla basada en su libro “How To Scale Your Model” (https://jax-ml.github.io/scaling-book), en donde se muestra como escalar LLM’s con el uso de TPU’s y GPU’s.
🧠 Para empezar vamos a repasar un poco sobre qué son y cómo funcionan las TPU’s.
🧠Luego veremos cómo se corre una red neuronal usando muchos aceleradores en paralelo, incluyendo técnicas de paralelismo como ser paralelismo de datos, de modelo, de secuencia, de pipeline y de expertos.
🧠 Finalmente veremos técnicas de inferencia modernas como decodificación especulativa, batching continuo, y paginado de atención.
🧻Sobre el charlista:
Federico Lebron se graduó de la Licenciatura en Ciencias de la Computación en el año 2014. Hoy en día trabaja en Google Deepmind (Mountain View, California), en inferencia para el modelo Gemini y modelos derivados.
Sumate este jueves a las 15hs, en el pabellón 0 + infinito aula 1604 o virtual por google meet.