Gate News 消息,4月24日——DeepSeek 的 V4 技术报告显示,V4-Flash 和 V4-Pro 分别在 32T 和 33T token 上进行了预训练,相较于 V3 使用的约 15T token 翻了一倍。该报告承认在训练过程中遇到了“显著的不稳定性挑战”,损失尖峰反复出现,是由于 Mixture-of-Experts (MoE) 层中的异常;路由机制本身会加剧这些异常,而简单的回滚也无法解决问题。
DeepSeek 目前已落地到实际训练中的两项解决方案:预判式路由(Anticipatory Routing),它将路由索引计算与骨干网络更新解耦,并仅在检测到损失尖峰时自动触发 (增加约 20% 的开销),以及 SwiGLU 夹持(SwiGLU Clamping),通过直接将激活值夹持到固定范围来抑制异常。报告称这两种方案都有效,但承认“底层原理仍未被充分理解”。
Susan Zhang(谷歌 DeepMind 研究员,曾在 Meta AI 和 OpenAI 工作)评论称,由于训练数据翻倍所触发的不稳定性“解释了延迟”。她将这两种解决方案描述为“补丁(band-aids)”,同时也承认了 DeepSeek 的技术透明度。
免责声明:本页面信息可能来自第三方,不代表 Gate 的观点或意见。页面显示的内容仅供参考,不构成任何财务、投资或法律建议。Gate 对信息的准确性、完整性不作保证,对因使用本信息而产生的任何损失不承担责任。虚拟资产投资属高风险行为,价格波动剧烈,您可能损失全部投资本金。请充分了解相关风险,并根据自身财务状况和风险承受能力谨慎决策。具体内容详见
声明。
相关文章
Web3 AI 基础设施 AIW3 完成 $2M 种子轮融资,Buffalo Capital 牵头
Gate News 消息,4月24日——Web3 AI 基础设施平台 AIW3 宣布完成一轮 $2 百万美元种子轮融资。本轮融资由 Buffalo Capital 牵头,GalaXin Capital 和 Three-stones Ventures 参与作为共同投资方。
AIW3 正在向 Agent-as-a-Service
GateNews16 分钟前
Cohere 收购德国 AI 公司 Aleph Alpha,斩获 $600M 投资用于欧洲扩张
Gate 新闻消息,4月24日——加拿大 AI 公司 Cohere 宣布计划收购德国 AI 公司 Aleph Alpha,以加强其在欧洲的布局。Aleph Alpha 的支持方 Schwarz Group 计划在 Cohere 的 E 轮融资中投资 $600 百万。
预计该融资轮将于 202
GateNews58 分钟前
小鹏、Redmi 牵头:北京车展上的车载 AI 推进
快讯,4月24日——随着中国加速推进 AI Plus 战略,并寻求在国外半导体方面获得更大独立性,中国车企在4月24日的北京车展上展示了先进的车载 AI 系统。
小鹏展示了语音控制泊车功能,允许驾驶员“通过
GateNews1小时前
前字节跳动 Seed 工程师:字节跳动 AI 迭代需六个月,而谷歌为三个月
Gate News 消息,4 月 24 日——字节跳动 Seed 团队的前工程师、现任北京大学助理教授张驰在播客《Into Asia》中透露,字节跳动完成一次完整的大型语言模型训练 (预训练循环大约需要六个月
GateNews1小时前
OpenAI 工程师 Clive Chan 挑战 V4 硬件建议,称其相较 V3 存在错误与模糊之处
Gate News 消息,4 月 24 日——OpenAI 工程师 Clive Chan 就 V4 技术报告中的硬件建议章节提出了详细异议,称其“出人意料地平庸且容易出错”,与备受赞誉的 V3 版本相比尤为如此。V3 的硬件指导,其中包括问答(Q&A)环节
GateNews2小时前
Naver 推出 AI Tab 测试版,Google Gemini 进入韩国搜索市场
Gate News 消息,4 月 24 日——Naver 宣布,其新的对话式搜索功能 AI Tab 将启动封闭测试版,此前谷歌已在韩国于 Chrome 中推出 Gemini。
AI Tab 将与 Naver 现有的搜索标签并列出现,为用户提供一个专门用于对话式
GateNews2小时前