

Tribu iA/Papers. Sesión 2: RLHF y DPO
🧠 ¿Listos para seguir profundizando en el estado del arte de los LLMs?
Vuelve Tribu IA / Papers con su segunda sesión, y esta vez abordaremos dos papers fundamentales para entender cómo alineamos los modelos de lenguaje con las preferencias humanas.
📅 Miércoles 9 de abril
🕕 6:00 p.m. (hora COL)
🌐 Modalidad: Virtual
🔍 Papers a presentar:
📄 RLHF – Aligning Language Models with Human Feedback
El enfoque clásico que marcó el comienzo de la era ChatGPT. Clave para entender cómo los modelos aprenden a ser “útiles” para los humanos.
📄 DPO – Direct Preference Optimization
Language Models as Implicit Reward Models
Una alternativa elegante a RLHF que está ganando tracción por su simplicidad y efectividad.
🎙️ Como siempre, contaremos con presentaciones a cargo de investigadores de alto nivel, discusión técnica abierta, y el espíritu colaborativo que caracteriza a Tribu IA.
No olvides leer los papers antes de la sesión. Puedes arrancar escuhando los podcasts de Notebook.
Gracias a nuestros patrocinadores Softserve y Riscco por dar soporte a este programa.
💡 Si quieres elevar tu comprensión de los modelos de lenguaje y cómo se afinan para interactuar con nosotros, esta sesión es imperdible.
Al registrarte, aceptas nuestra Política de tratamiento de datos