Foto de portada de En camino a detectar y entender la Evaluation Awareness no verbalizada
Foto de portada de En camino a detectar y entender la Evaluation Awareness no verbalizada
Organizado por
21 asistieron

En camino a detectar y entender la Evaluation Awareness no verbalizada

Organizado por AI Safety Colombia
Google Meet
Inscripción
Evento pasado
¡Hola! Para unirte al evento, regístrate a continuación.
Acerca del evento

¿Qué pasa si un modelo se comporta distinto porque detecta que está siendo evaluado, incluso sin decirlo explícitamente?

Eso podría volver mucho más difícil confiar en nuestras evaluaciones: un sistema podría parecer seguro durante una prueba y comportarse de otra manera fuera de ella.

En esta charla del AI Incident Response Sprint, Luis Miguel Montoya presentará un trabajo aceptado como póster en el workshop de Interpretabilidad Mecanística de ICML 2026. En experimentos controlados, encontraron que el comportamiento condicionado por la evaluación puede persistir incluso después de suprimir las verbalizaciones detectadas sobre ella.

¿Qué nos dice esto sobre lo que ocurre internamente en los modelos y sobre nuestra capacidad para supervisar agentes cada vez más autónomos?

Organizado por
21 asistieron