Resumen: Los sistemas de recomendación a menudo inducen burbujas de filtro y homogeneización semántica mediante la optimización monolítica para la participación inmediata del usuario.
Leer más →
Resumen: La interpretabilidad mecanicista ha logrado avances sustanciales en la localización automática de circuitos, pero explicar qué hacen los componentes localizados sigue siendo laborioso y difícil de estandarizar. En este trabajo, estudiamos si los agentes del modelo de lenguaje (LM) pueden ayudar con este problema de explicación una vez que ya se ha identificado un circuito.
Leer más →
Resumen:A medida que los sistemas de IA se implementan en entornos cada vez más diversos y de alto riesgo, la alineación del modelo debe generalizarse más allá de las tareas y dominios observados durante el entrenamiento.
Leer más →