Cover Image for En camino a detectar y entender la Evaluation Awareness no verbalizada
Cover Image for En camino a detectar y entender la Evaluation Awareness no verbalizada
21 Went

En camino a detectar y entender la Evaluation Awareness no verbalizada

Hosted by AI Safety Colombia
Google Meet
Registration
Past Event
Welcome! To join the event, please register below.
About Event

¿Qué pasa si un modelo se comporta distinto porque detecta que está siendo evaluado, incluso sin decirlo explícitamente?

Eso podría volver mucho más difícil confiar en nuestras evaluaciones: un sistema podría parecer seguro durante una prueba y comportarse de otra manera fuera de ella.

En esta charla del AI Incident Response Sprint, Luis Miguel Montoya presentará un trabajo aceptado como póster en el workshop de Interpretabilidad Mecanística de ICML 2026. En experimentos controlados, encontraron que el comportamiento condicionado por la evaluación puede persistir incluso después de suprimir las verbalizaciones detectadas sobre ella.

¿Qué nos dice esto sobre lo que ocurre internamente en los modelos y sobre nuestra capacidad para supervisar agentes cada vez más autónomos?

21 Went