Resumen: Los agentes de modelos de lenguaje grande (LLM) han demostrado una gran capacidad en la toma de decisiones secuencial, pero siguen siendo fundamentalmente reactivos en tareas de largo plazo. A diferencia de los humanos que emplean el razonamiento de “qué pasaría si” para evaluar planes potenciales antes de comprometerse, los agentes estándar carecen de un modelo del mundo interno para simular resultados futuros. Por lo tanto, proponemos internalizar la planificación consciente del futuro entrenando un modelo autorregresivo único para verbalizar tanto un despliegue estatal prospectivo como una estimación de éxito condicionada por el plan, un análogo textual del valor Q. Fundamentalmente, identificamos una brecha en la capacidad del formato: simplemente ajustar los agentes en los rastros de anticipación durante el post-entrenamiento conduce a una imitación superficial de la previsión sin una base predictiva genuina. Para cerrar esta brecha, introducimos un paradigma de capacitación de tres etapas: (i) Capacitación intermedia agente del modelo mundial (WM-AMT) para inyectar capacidades predictivas latentes en la política; (ii) SFT que genera formato (FE-SFT) para estructurar esta capacidad inyectada; y (iii) Aprendizaje por refuerzo condicionado a la previsión (FC-RL) para refinar la calibración y la utilidad de las simulaciones generadas. Evaluado en tareas de búsqueda y razonamiento matemático, nuestro enfoque supera consistentemente otras líneas de base de capacitación. Nuestros resultados demuestran que el modelado eficaz del mundo interno en agentes de LLM requiere un proceso de capacitación que priorice las capacidades para lograr una previsión fundamentada y calibrada.
Publicado originalmente en export.arxiv.org el 28 de junio de 2026.
Ver fuente original
