MoE Top-p dinámico controlable por escasez para preentrenamiento de modelos de cimientos grandes
Resumen: Las arquitecturas dispersas de mezcla de expertos (MoE) escalan efectivamente la capacidad del modelo activando solo un subconjunto de expertos para cada token de entrada. Sin embargo, la estrategia de enrutamiento estándar Top-k impone un patrón de escasez uniforme que ignora la dificultad variable de los tokens.
Leer más →