En este momento estás viendo 
<span class="bsf-rt-reading-time"><span class="bsf-rt-display-label" prefix="Tiempo de lectura"></span> <span class="bsf-rt-display-time" reading_time="1"></span> <span class="bsf-rt-display-postfix" postfix="mins"></span></span><!-- .bsf-rt-reading-time -->ATOD: Destilación recocida según políticas por turnos para agentes autónomos de múltiples turnos

ATOD: Destilación recocida según políticas por turnos para agentes autónomos de múltiples turnos

  • Autor de la entrada:
  • Categoría de la entrada:Noticias externas

Resumen: El entrenamiento de pequeños agentes de modelos de lenguaje para tareas interactivas de largo horizonte requiere tanto una imitación rápida como una mejora impulsada por la recompensa. La destilación de políticas (OPD, por sus siglas en inglés) proporciona una guía densa para los docentes y generalmente mejora rápidamente en la etapa inicial, pero sus ganancias se saturan una vez que el estudiante se acerca al maestro, lo que limita el techo de desempeño final. El aprendizaje por refuerzo (RL) optimiza directamente las recompensas del entorno y fomenta la mejora exploratoria hacia un límite más alto definido por la recompensa, pero la retroalimentación escasa y retrasada hace que el aprendizaje en las primeras etapas sea mucho menos eficiente que el OPD. En este artículo, proponemos ATOD (Annealed Turn-aware On-policy Distillation), un algoritmo híbrido de destilación en línea que explota explícitamente esta complementariedad. (1) ATOD utiliza un cronograma OPD-RL recocido: OPD domina la capacitación temprana para abordar el comportamiento a nivel de maestro, mientras que RL se fortalece gradualmente para impulsar la exploración basada en recompensas. (2) ATOD introduce la reponderación de incertidumbre-desacuerdo a nivel de turno (T-DUR), que amplifica suavemente los giros de alta utilidad y mejora la supervisión densa en trayectorias largas. Los experimentos en ALFWorld, WebShop y Search-QA muestran que ATOD supera consistentemente las bases de referencia posteriores a la capacitación de la competencia: en los tres tamaños de estudiantes, ATOD mejora la tasa de éxito promedio en 3,03 puntos sobre OPD y 23,62 puntos sobre GRPO, mientras supera los modelos de docentes correspondientes en 2,16 puntos.

Publicado originalmente en export.arxiv.org el 28 de junio de 2026.
Ver fuente original

admin

Usuario de administración del sitio web