Mezclar o fusionar: hacia el aprendizaje por refuerzo multidominio para modelos de lenguajes grandes

Resumen: El aprendizaje por refuerzo con recompensas verificables (RLVR) juega un papel clave en la estimulación de la capacidad de razonamiento explícito de los modelos de lenguaje grande (LLM). Podemos lograr un rendimiento de nivel experto en algunos dominios específicos a través de RLVR, como codificación o matemáticas.

Leer más →

Comentarios desactivados en Mezclar o fusionar: hacia el aprendizaje por refuerzo multidominio para modelos de lenguajes grandes

Ampliación de la capacitación de agentes web mediante generación automática de datos y evaluación detallada

Resumen:Presentamos un proceso escalable para generar automáticamente datos de capacitación de alta calidad para agentes web. En particular, un desafío importante a la hora de identificar instancias de capacitación de alta calidad es la evaluación de la trayectoria: cuantificar cuánto progreso se logró hacia la finalización de la tarea.

Leer más →

Comentarios desactivados en Ampliación de la capacitación de agentes web mediante generación automática de datos y evaluación detallada

Sondeo de invariancia guiado por el lenguaje de modelos de visión-lenguaje

Resumen:En nueve VLM, EVA02-CLIP y las variantes grandes de OpenCLIP se encuentran en una frontera favorable de invariancia-sensibilidad, combinando una baja varianza inducida por la paráfrasis con puntuaciones consistentemente más altas para los subtítulos originales que para sus contrapartes invertidas.

Leer más →

Comentarios desactivados en Sondeo de invariancia guiado por el lenguaje de modelos de visión-lenguaje

Fin del contenido

No hay más páginas por cargar