D’après Beating, la Seed Audio 1.0 de ByteDance a été lancée le 22 juillet, permettant la génération de dialogues, d’effets sonores et d’audio d’ambiance à l’aide d’un seul prompt, avec une précision de synchronisation de 100 ms. Le modèle accepte des entrées en texte et en audio de référence, peut produire environ deux minutes d’audio par génération grâce à des capacités étendues, et conserve des voix de personnages cohérentes d’une sortie à l’autre.
L’audio affiche plus de 90 % d’utilisabilité dans la plupart des scénarios, avec un Mean Opinion Score (MOS) supérieur à 4 dans la majorité des langues prises en charge. Seed Audio 1.0 prend en charge 20+ langues, avec transfert de voix interlingue et personnalisation du ton. Le modèle est désormais disponible via le centre d’expérience Volcano Ark, avec une intégration API ouverte.