DeepSeek V4 以 1M 上下文窗口发布;华为 Ascend 与 燚微(Cambricon)芯片实现全兼容

Gate News 消息,4 月 24 日——DeepSeek V4-Pro 和 DeepSeek V4-Flash 于 4 月 24 日正式发布,并开源,背景处理长度已从 128K 大幅扩展至 1M,代表近 10 倍的容量提升。华为计算宣布其 Ascend 超算节点产品通过芯片与模型技术的紧密协作,已对 DeepSeek V4 系列模型实现完全支持。

华为 Ascend 950 通过融合算子内核与多流并行技术,实现高吞吐、低延迟的 DeepSeek V4 模型推理部署,以降低 Attention 计算与内存访问的开销。对于输入 8K 的 DeepSeek V4-Pro,Ascend 950 实现约 20ms TPOT、单卡 Decode 吞吐量 4,700 TPS;对于输入 8K 的 DeepSeek V4-Flash,达到约 10ms TPOT,吞吐量为 1,600 TPS。Ascend A3 超算节点系列同样实现完全兼容,并提供训练参考实现以便快速微调。基于采用大 EP 模式的 Ascend A3 64 卡超算节点,借助 vLLM 推理引擎,在 8K/1K 输入输出场景下,DeepSeek V4-Flash 的单卡 Decode 吞吐量超过 2,000 TPS。华为全系 Ascend A2、A3 和 950 产品线均支持 DeepSeek V4-Flash 与 V4-Pro。

华为云宣布与 DeepSeek V4 的先发兼容,借助其 MaaS 平台,为开发者提供一键式 API 令牌服务。华为云优化系统层、算子层和集群层能力,以确保快速模型适配与高性能部署。包括金山 WPS 和 360 在内的企业已通过华为云集成了 DeepSeek 的新模型。

燚微(Cambricon)也宣布基于 vLLM 推理框架实现 DeepSeek V4-Flash 与 V4-Pro 的 Day 0 兼容,并将适配代码开源给 GitHub 社区。Cambricon 此前在去年 DeepSeek V3.2 发布时也已实现先发适配,得益于其在 DeepSeek 系列模型上开展了深度的软件-硬件协同性能优化。

免責聲明:本頁面資訊可能來自第三方來源,僅供參考,不代表 Gate 的立場或觀點,亦不構成任何財務、投資或法律建議。虛擬資產交易具有高風險,請勿僅依賴本頁資訊作出決策。詳情請參閱 免責聲明
回覆
0/400
暫無回覆