Resumen: Adoptamos un protocolo de evaluación de doble vía que refleja la implementación: (i) ablaciones A/B en línea a gran escala para aislar la utilidad de cada fuente de retroalimentación, y (ii) pruebas fuera de línea de pocas tomas en puntos de referencia de conocimiento intensivo.
Leer más →
Resumen: La generación de recuperación aumentada (RAG) mejora los modelos de lenguajes grandes (LLM) al integrar fuentes de conocimiento externas para abordar sus limitaciones en el acceso a información actualizada o especializada. Una estrategia natural para aumentar la probabilidad de recuperar información relevante es ampliar la cantidad de documentos recuperados.
Leer más →
Resumen: En aplicaciones de alto riesgo, los modelos predictivos no solo deben producir predicciones precisas sino también cuantificar y comunicar su incertidumbre. La predicción de opción de rechazo aborda esto al permitir que el modelo se abstenga cuando la incertidumbre de la predicción es alta.
Leer más →