M3Kang: Evaluación del razonamiento matemático multimodal multilingüe en modelos visión-lenguaje

Resumen:A pesar de que los modelos visión-lenguaje (VLM) de última generación han demostrado sólidas capacidades de razonamiento, su desempeño en el razonamiento matemático multilingüe sigue sin explorarse, particularmente en comparación con el desempeño humano.

Leer más →

Comentarios desactivados en M3Kang: Evaluación del razonamiento matemático multimodal multilingüe en modelos visión-lenguaje

Doc2AHP: Inferir modelos de decisión estructurados de criterios múltiples a través de árboles semánticos con LLM

Resumen:Si bien los modelos de lenguajes grandes (LLM) demuestran una notable competencia en la comprensión semántica, a menudo tienen dificultades para garantizar la coherencia estructural y la confiabilidad del razonamiento en tareas complejas de toma de decisiones que exigen una lógica rigurosa.

Leer más →

Comentarios desactivados en Doc2AHP: Inferir modelos de decisión estructurados de criterios múltiples a través de árboles semánticos con LLM

ChiEngMixBench: Evaluación de modelos de lenguaje grandes en generación mixta de código chino-inglés natural y espontáneo

Resumen: La mezcla de códigos es cada vez más frecuente en las interacciones entre humanos y grandes modelos de lenguaje, sin embargo, el trabajo existente a menudo la reduce a un problema de traducción o convertibilidad, lo que dificulta evaluar si el comportamiento de cambio de un modelo es apropiado para el contexto y está alineado con las convenciones humanas.

Leer más →

Comentarios desactivados en ChiEngMixBench: Evaluación de modelos de lenguaje grandes en generación mixta de código chino-inglés natural y espontáneo

Fin del contenido

No hay más páginas por cargar