Resumen:Evaluar agentes de IA en puntos de referencia integrales es costoso porque cada evaluación requiere implementaciones interactivas con el uso de herramientas y razonamiento de varios pasos. Estudiamos si los subconjuntos de tareas pequeños pueden preservar las clasificaciones de los agentes a un costo sustancialmente menor.
Leer más →
Resumen: Recientemente se han propuesto modelos de lenguaje grandes como herramientas para la calificación automatizada de ensayos, pero su concordancia con la calificación humana aún no está clara.
Leer más →
Resumen:Estudiamos la planificación a largo plazo en entornos 3D a partir de objetivos de lenguaje natural poco especificados utilizando únicamente observaciones visuales, centrándonos en tareas de reordenamiento de cajas 3D de varios pasos.
Leer más →