Puntuaciones logarítmicas, descubrimientos de la ley de potencias: desvinculación de la medición de la cobertura en la evaluación basada en agentes

Resumen: Los jueces agentes basados ​​en LLM son un enfoque emergente para evaluar la IA conversacional, sin embargo, persiste una incertidumbre fundamental: ¿podemos confiar en sus evaluaciones y, de ser así, cuántas se necesitan?

Leer más →

Comentarios desactivados en Puntuaciones logarítmicas, descubrimientos de la ley de potencias: desvinculación de la medición de la cobertura en la evaluación basada en agentes

Hacia una estimación de la incertidumbre confiable y alineada con la verdad en modelos de lenguaje grandes

Resumen: La estimación de incertidumbre (UE) tiene como objetivo detectar resultados alucinados de modelos de lenguaje grande (LLM) para mejorar su confiabilidad. Sin embargo, las métricas de UE a menudo muestran un rendimiento inestable en todas las configuraciones, lo que limita significativamente su aplicabilidad.

Leer más →

Comentarios desactivados en Hacia una estimación de la incertidumbre confiable y alineada con la verdad en modelos de lenguaje grandes

Fin del contenido

No hay más páginas por cargar