Resumen:Evaluar grandes modelos de lenguaje (LLM) como jueces es cada vez más crítico para construir canales de evaluación escalables y confiables. Presentamos ScalingEval, un estudio comparativo a gran escala que compara sistemáticamente 36 LLM, incluidos GPT, Gemini, Claude y Llama, en múltiples categorías de productos utilizando un protocolo de evaluación basado en consenso.
Leer más →
Resumen: Métodos: Analizamos 5.000 pares de informes de residentes-asistentes de la práctica habitual en un sistema de salud multisitio de EE. UU. A GPT-4o se le solicitaron instrucciones clínicas para identificar errores comunes y proporcionar comentarios. Se realizó un estudio de lectores utilizando 100 pares de informes.
Leer más →
Resumen: Los repositorios de datos abiertos tienen potencial para la toma de decisiones basada en evidencia, pero son inaccesibles para los no expertos que carecen de experiencia en descubrimiento de conjuntos de datos, mapeo de esquemas y análisis estadístico.
Leer más →