No-Human in the Loop: Evaluación agente a escala para recomendación

Resumen:Evaluar grandes modelos de lenguaje (LLM) como jueces es cada vez más crítico para construir canales de evaluación escalables y confiables. Presentamos ScalingEval, un estudio comparativo a gran escala que compara sistemáticamente 36 LLM, incluidos GPT, Gemini, Claude y Llama, en múltiples categorías de productos utilizando un protocolo de evaluación basado en consenso.

Leer más →

Comentarios desactivados en No-Human in the Loop: Evaluación agente a escala para recomendación

Evaluación de la IA generativa como herramienta educativa para la redacción de informes de residentes de radiología

Resumen: Métodos: Analizamos 5.000 pares de informes de residentes-asistentes de la práctica habitual en un sistema de salud multisitio de EE. UU. A GPT-4o se le solicitaron instrucciones clínicas para identificar errores comunes y proporcionar comentarios. Se realizó un estudio de lectores utilizando 100 pares de informes.

Leer más →

Comentarios desactivados en Evaluación de la IA generativa como herramienta educativa para la redacción de informes de residentes de radiología

PublicAgent: principios de diseño de agentes múltiples a partir de un marco de análisis de datos abiertos basado en LLM

Resumen: Los repositorios de datos abiertos tienen potencial para la toma de decisiones basada en evidencia, pero son inaccesibles para los no expertos que carecen de experiencia en descubrimiento de conjuntos de datos, mapeo de esquemas y análisis estadístico.

Leer más →

Comentarios desactivados en PublicAgent: principios de diseño de agentes múltiples a partir de un marco de análisis de datos abiertos basado en LLM

Fin del contenido

No hay más páginas por cargar