Razonamiento de subespecialidad basado en evidencia: evaluación de una capa de inteligencia clínica seleccionada en el examen estilo junta de endocrinología de 2025

Resumen:Antecedentes: Los modelos de lenguaje grandes han demostrado un sólido desempeño en exámenes médicos generales, pero el razonamiento clínico de subespecialidades sigue siendo un desafío debido a las pautas que evolucionan rápidamente y a las jerarquías de evidencia matizadas.

Leer más →

Comentarios desactivados en Razonamiento de subespecialidad basado en evidencia: evaluación de una capa de inteligencia clínica seleccionada en el examen estilo junta de endocrinología de 2025

¿Qué persona nos falta? Identificación de personas relevantes desconocidas para la simulación de usuarios fieles

Resumen: Las simulaciones de usuarios existentes, donde los modelos generan respuestas similares a las de los usuarios en el diálogo, a menudo carecen de verificación de que se proporcionen suficientes personajes de usuario, lo que cuestiona la validez de las simulaciones.

Leer más →

Comentarios desactivados en ¿Qué persona nos falta? Identificación de personas relevantes desconocidas para la simulación de usuarios fieles

¿Qué tan incierta es la calificación? Un punto de referencia de métricas de incertidumbre para la evaluación automática basada en LLM

Resumen:El rápido aumento de los grandes modelos lingüísticos (LLM) está remodelando el panorama de la evaluación automática en la educación.

Leer más →

Comentarios desactivados en ¿Qué tan incierta es la calificación? Un punto de referencia de métricas de incertidumbre para la evaluación automática basada en LLM

Fin del contenido

No hay más páginas por cargar