Дані для тренування DeepSeek V4 збільшилися до 33T: нестабільність спровокувала затримку релізу

Повідомлення Gate News від 24 квітня — Технічний звіт DeepSeek V4 розкриває, що V4-Flash і V4-Pro були попередньо натреновані на 32T і 33T токенів відповідно, удвічі більше приблизно 15T токенів, використаних для V3. У звіті визнається, що під час тренування вони зіткнулися з “значними проблемами нестабільності”, причому сплески loss неодноразово виникали через аномалії в шарі Mixture-of-Experts (MoE); сам механізм маршрутизації загострює ці аномалії, і простий rollback не може вирішити проблему.

DeepSeek упровадив два рішення, які тепер застосовуються до реального тренування: Anticipatory Routing, що відокремлює обчислення індексу маршрутизації від оновлень backbone-мережі та автоматично запускає перемикання лише тоді, коли виявляються сплески loss (додаючи приблизно 20% накладних витрат), і SwiGLU Clamping, який безпосередньо пригнічує аномалії шляхом обмеження значень активацій фіксованим діапазоном. У звіті зазначено, що обидва підходи є ефективними, але визнається, що “базові принципи досі недостатньо вивчені”.

Сьюзан Чжан, дослідниця Google DeepMind, яка раніше працювала в Meta AI та OpenAI, прокоментувала, що нестабільність, спричинена подвоєнням даних для тренування, “пояснює затримку”. Вона описала два рішення як “тимчасові латки” та водночас визнала технічну прозорість DeepSeek.

Застереження: Інформація на цій сторінці може походити від третіх осіб і не відображає погляди або думки Gate. Вміст, що відображається на цій сторінці, є лише довідковим і не є фінансовою, інвестиційною або юридичною порадою. Gate не гарантує точність або повноту інформації і не несе відповідальності за будь-які збитки, що виникли в результаті використання цієї інформації. Інвестиції у віртуальні активи пов'язані з високим ризиком і піддаються значній ціновій волатильності. Ви можете втратити весь вкладений капітал. Будь ласка, повністю усвідомлюйте відповідні ризики та приймайте обережні рішення, виходячи з вашого фінансового становища та толерантності до ризику. Для отримання детальної інформації, будь ласка, зверніться до Застереження.

Пов'язані статті

Web3 AI Infrastructure AIW3 Залучає $2M у seed-фінансуванні на чолі з Buffalo Capital

Повідомлення Gate News, 24 квітня — платформа інфраструктури Web3 AI AIW3 оголосила про завершення $2 мільйонного seed-раунду. Раунд очолювала Buffalo Capital, а GalaXin Capital і Three-stones Ventures брали участь як співінвестори. AIW3 переходить до Agent-as-a-Service

GateNews16хв. тому

Cohere придбає німецьку компанію в галузі ШІ Aleph Alpha та забезпечує $600M інвестицій для європейської експансії

Повідомлення Gate News, 24 квітня — канадська компанія в галузі ШІ Cohere оголосила про плани придбати німецьку компанію в галузі ШІ Aleph Alpha, щоб посилити свою присутність у Європі. Schwarz Group, інвестор Aleph Alpha, планує інвестувати $600 мільйонів у раунд фінансування Series E Cohere. Очікується, що раунд фінансування буде завершено в 202

GateNews58хв. тому

Xpeng і Xiaomi очолюють поштовх у бортовий ШІ на Пекінському автосалоні

Повідомлення Gate News, 24 квітня — Китайські автовиробники показали передові вбудовані в авто системи ШІ на Пекінському автосалоні 24 квітня, оскільки країна прискорює свою стратегію AI Plus та прагне більшої незалежності від іноземних напівпровідників. Xpeng продемонструвала голосокероване паркування, яке дозволяє водіям «

GateNews1год тому

Колишній інженер Seed у ByteDance: ітерації AI у ByteDance тривають шість місяців проти трьох у Google

Повідомлення Gate News, 24 квітня — Чжан Чі, колишній інженер команди Seed у ByteDance та нинішній доцент Пекінського університету, розповів у подкасті "Into Asia", що ByteDance потрібно приблизно шість місяців, щоб завершити один повний цикл тренування великих мовних моделей (pretraining

GateNews1год тому

Інженер OpenAI Клайв Чан Оскаржує Рекомендації щодо Апаратного Забезпечення V4, Посилаючись на Помилки та Невизначеність Порівняно з V3

Повідомлення Gate News, 24 квітня — інженер OpenAI Клайв Чан висунув детальні заперечення до розділу з рекомендаціями щодо апаратного забезпечення у технічному звіті V4, назвавши його "дивовижно посереднім і таким, що схильний до помилок" порівняно з відомою версією V3. Апаратні рекомендації V3, які включали сесії Q&A

GateNews2год тому

Naver запускає бета-версію AI Tab, коли Google Gemini виходить на ринок пошуку Південної Кореї

Повідомлення Gate News, 24 квітня — Naver оголосила про старт закритої бета-версії AI Tab, її нової функції розмовного пошуку, після запуску Google Gemini у Chrome в Південній Кореї. AI Tab з’явиться поруч із наявними вкладками пошуку Naver, надаючи користувачам окремий простір для розмовних

GateNews2год тому
Прокоментувати
0/400
Немає коментарів