Resumen: Los modelos multimodales de lenguaje grande (MLLM) se han convertido en herramientas poderosas para la comprensión de gráficos. Sin embargo, dependen en gran medida del contenido extraído mediante OCR, lo que provoca alucinaciones numéricas cuando las anotaciones textuales de los gráficos son escasas.
Leer más →
Resumen:El avance tecnológico permite compartir información con un solo clic, lo que ha permitido la rápida difusión de información falsa. Esto hace que el sistema automatizado de verificación de datos sea necesario para garantizar la seguridad e integridad de nuestro ecosistema de medios en línea.
Leer más →
Resumen: Los modelos de visión-lenguaje (VLM) heredan importantes sesgos sociales de sus datos de entrenamiento, especialmente en la representación de género. Las intervenciones de equidad actuales a menudo adoptan una perspectiva que no tiene en cuenta las diferencias y que impone un trato uniforme entre los grupos demográficos.
Leer más →