Tencent Hunyuan stellt den Stem Sparse Attention-Algorithmus vor und senkt die Latenz des ersten Tokens um das 3,7-fache bei 128K-Context

Laut Guru Club veröffentlichte Tencent Hunyuan am 5. Juni den Stem-Sparse-Attention-Algorithmus, der auf der erstklassigen Machine-Learning-Konferenz ICML-26 akzeptiert wurde. Der Algorithmus erreicht bei einem Budget von 25% nahezu verlustfreie Genauigkeit durch Token Position Decay (TPD) und Output-Aware Metric (OAM) und reduziert die Latenz des ersten Tokens um das 3,7-Fache bei einer Kontextlänge von 128K, wenn er in Kombination mit HPC-Operatoren eingesetzt wird.
Disclaimer: The information on this page may come from third-party sources and is for reference only. It does not represent the views or opinions of Gate and does not constitute any financial, investment, or legal advice. Virtual asset trading involves high risk. Please do not rely solely on the information on this page when making decisions. For details, see the Disclaimer.
Kommentieren
0/400
Keine Kommentare