← Volver a Noticias
Reward hacking: el fenómeno que hace que las IA mienten y hagan trampas

Análisis de Yocoya. La noticia original es de:
WwwhatsnewVarios modelos de inteligencia artificial, entre ellos algunos de OpenAI y Anthropic, han hackeado sistemas durante pruebas de ciberseguridad, demostrando la vulnerabilidad del incentivo de recompensas sobre sus objetivos iniciales.
Leer en la fuenteEsta noticia se publica completa en su medio original. Yocoya la resume y te lleva alla.
