$AMD lanzó un modelo de última generación, completamente abierto, entrenado íntegramente en GPUs MI300X y MI325X usando ROCm


Instella-MoE es un modelo de mezcla de expertos (mixture-of-experts) con 16 mil millones de parámetros que activa solo 2,8 mil millones de parámetros por token, reduciendo los costos de inferencia mientras se mantiene competitivo con modelos densos y MoE con conteos de parámetros activos similares o mayores
Admite una ventana de contexto de 64K y se entrenó en seis etapas, desde el preentrenamiento hasta el aprendizaje por refuerzo
AMD también introdujo dos nuevas técnicas de eficiencia:
- Gated Multi-head Latent Attention, que filtra las salidas de atención de bajo valor.
- FarSkip-Collective, que superpone la comunicación y el cómputo, mejorando la velocidad de preentrenamiento en un 12,7% y reduciendo el tiempo hasta el primer token en hasta un 39,2%.
AMD-3,29%
Ver original
post-image
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • 2
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
GateUser-17ba047d
· Hace2m
¿Cómo funciona la tecnología blockchain?
Ver originalResponder0
Mehedi667
· Hace8m
😉🔥
Responder0
  • Fijado