Cadena de pensamiento latente para el razonamiento visual
Resumen: El razonamiento de cadena de pensamiento (CoT) es fundamental para mejorar la interpretabilidad y confiabilidad de los modelos de lenguaje-visión amplios (LVLM). Sin embargo, es posible que los algoritmos de entrenamiento existentes, como SFT, PPO y GRPO, no se generalicen bien en tareas de razonamiento invisibles y dependan en gran medida de un modelo de recompensa sesgado.
Leer más →