$AMD 已發布一款最先進、完全開放的模型,使用 ROCm,並且完全在 MI300X 與 MI325X GPU 上進行訓練


Instella-MoE 是一款 160 億參數的混合專家(mixture-of-experts)模型,每個 token 只啟用 28 億參數,能在保持與同等或更高啟用參數數量的稠密模型與 MoE 模型競爭力的同時,降低推論成本
它支援 64K 的內容視窗,並透過六個階段訓練完成,從預訓練到強化學習
AMD 也同時提出兩項新的效率技術:
- 受閘多頭潛在注意力(Gated Multi-head Latent Attention),會過濾低價值的注意力輸出。
- FarSkip-Collective,能讓通訊與運算重疊,使預訓練速度提升 12.7%,且「首個 token」時間最多降低 39.2%。
AMD-5.15%
查看原文
post-image
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 2
  • 1
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
GateUser-17ba047d
· 12小時前
區塊鏈技術如何運作
查看原文回復0
mehedi667
· 12小時前
😉🔥
回復0