Cuando los modelos piensan más que su seguridad: mitigar la auto-jailbreak en modelos de gran razonamiento con cadenas de seguridad
Resumen: Los modelos de razonamiento de gran tamaño (LRM) demuestran capacidades notables en tareas de razonamiento complejas, pero siguen siendo vulnerables a graves riesgos de seguridad, incluida la generación de contenido dañino y ataques de jailbreak.
Leer más →