Resumen:Muchas organizaciones buscan la transformación digital para mejorar la eficiencia operativa, reducir los esfuerzos manuales y optimizar los procesos mediante la automatización y las herramientas digitales. Para lograr esto, se requiere una comprensión integral de sus necesidades únicas.
Leer más →
Resumen:Evaluar grandes modelos de lenguaje (LLM) como jueces es cada vez más crítico para construir canales de evaluación escalables y confiables. Presentamos ScalingEval, un estudio comparativo a gran escala que compara sistemáticamente 36 LLM, incluidos GPT, Gemini, Claude y Llama, en múltiples categorías de productos utilizando un protocolo de evaluación basado en consenso.
Leer más →
Resumen: Métodos: Analizamos 5.000 pares de informes de residentes-asistentes de la práctica habitual en un sistema de salud multisitio de EE. UU. A GPT-4o se le solicitaron instrucciones clínicas para identificar errores comunes y proporcionar comentarios. Se realizó un estudio de lectores utilizando 100 pares de informes.
Leer más →