

En camino a detectar y entender la Evaluation Awareness no verbalizada
¿Qué pasa si un modelo se comporta distinto porque detecta que está siendo evaluado, incluso sin decirlo explícitamente?
Eso podría volver mucho más difícil confiar en nuestras evaluaciones: un sistema podría parecer seguro durante una prueba y comportarse de otra manera fuera de ella.
En esta charla del AI Incident Response Sprint, Luis Miguel Montoya presentará un trabajo aceptado como póster en el workshop de Interpretabilidad Mecanística de ICML 2026. En experimentos controlados, encontraron que el comportamiento condicionado por la evaluación puede persistir incluso después de suprimir las verbalizaciones detectadas sobre ella.
¿Qué nos dice esto sobre lo que ocurre internamente en los modelos y sobre nuestra capacidad para supervisar agentes cada vez más autónomos?