T2D-Bench: Evaluación basada en evidencia de los resultados de LLM para la diabetes tipo 2 utilizando un gráfico de conocimiento de estilo de vida clínico de múltiples capas

Resumen: Los modelos de lenguaje grande (LLM) pueden producir recomendaciones clínicamente fluidas para la diabetes tipo 2 sin satisfacer las limitaciones de las guías ni justificar explícitamente las afirmaciones glucémicas relacionadas con el estilo de vida.

Leer más →

Comentarios desactivados en T2D-Bench: Evaluación basada en evidencia de los resultados de LLM para la diabetes tipo 2 utilizando un gráfico de conocimiento de estilo de vida clínico de múltiples capas

OmniPath: un marco agente multimodal para auditar la accesibilidad de las sillas de ruedas

Resumen: Para un usuario de silla de ruedas, una línea azul estándar en un mapa suele ser una promesa incumplida. Si bien plataformas como OpenStreetMap (OSM) capturan con éxito dónde está un camino, con frecuencia no logran transmitir cómo se siente físicamente viajar por él. Esta barrera de información es problemática para los usuarios de sillas de ruedas.

Leer más →

Comentarios desactivados en OmniPath: un marco agente multimodal para auditar la accesibilidad de las sillas de ruedas

VeryTrace: verificación de rastros de razonamiento mediante formalismo compilable y verificación estructurada

Resumen: En tres dominios diversos: matemáticas de competencia (AIME 2025), planificación de robótica (LLM-BabyBench) y razonamiento de parentesco (CLUTRR), VeryTrace mejora la precisión sobre líneas de base de tiro cero en LLM de última generación sin requerir capacitación específica de dominio o ejemplos en contexto, lo que demuestra que la verificación de seguimiento formalizada logra precisió

Leer más →

Comentarios desactivados en VeryTrace: verificación de rastros de razonamiento mediante formalismo compilable y verificación estructurada

Fin del contenido

No hay más páginas por cargar