根據 Beating,字節跳動的 Seed Audio 1.0 於 7 月 22 日推出。使用者可透過單一提示生成對話、音效與環境音,且具備 100ms 的時序精度。該模型支援文字與參考音訊輸入;每次生成可產出約兩分鐘的音訊。在可擴展的延伸能力下,還能在各次輸出中維持一致的角色聲線。
在多數情境中,音訊可用性超過 90%,且在大多數支援語言中,平均意見分數(MOS)皆達 4 以上。Seed Audio 1.0 支援 20+ 種語言,並提供跨語言語音轉移與語調自訂功能。該模型現已透過 Volcano Ark 體驗中心提供,並開放 API 整合。