Resumen: Los avances recientes en grandes modelos de lenguaje (LLM) han cambiado el paradigma posterior al entrenamiento desde el ajuste de la instrucción tradicional y la alineación de las preferencias humanas hacia el aprendizaje por refuerzo (RL) centrado en las capacidades de razonamiento.
Leer más →
Resumen: Los modelos de recompensa (RM) son un componente central en el entrenamiento posterior de modelos de lenguaje grande (LLM), y sirven como sustitutos para la evaluación de las preferencias humanas y guían la alineación del modelo.
Leer más →
Resumen: Al abordar la inequidad educativa en el África subsahariana, esta investigación presenta un marco autónomo orquestado por agentes para la generación de contenido educativo descentralizado y culturalmente adaptable en dispositivos de borde. El sistema aprovecha cuatro agentes especializados que trabajan juntos para generar contenido educativo contextualmente apropiado.
Leer más →