Resumen: El aprendizaje por refuerzo con recompensas verificables (RLVR) ofrece un mecanismo sólido para mejorar el razonamiento matemático en modelos grandes.
Leer más →
Resumen: La planificación del tiempo de inferencia con modelos de lenguaje grandes frecuentemente falla bajo observabilidad parcial: cuando las condiciones previas de la tarea crítica no se especifican en el momento de la consulta, los modelos tienden a alucinar hechos faltantes o producir planes que violan restricciones estrictas.
Leer más →
Resumen:Nuestro diseño experimental asigna cuatro roles distintos (Proponente, Respondedor, Monitor, Traductor) a diferentes sistemas de IA en seis condiciones, probando si los grandes modelos de lenguaje actuales pueden interactuar sustancialmente con marcos de alineación complejos. Utilizando Claude, Gemini y GPT-4o, llevamos a cabo 72 turnos de diálogo con un total de 576.
Leer más →