Qwen3-TTS (Alibaba)
Моделі синтезу мовлення: створіть голос за текстовим описом або клонуйте з короткого кліпу, 10 мов.
Послуга озвучення реклами й відео.
Модель Apache-2.0. Для швидкості потрібен GPU.
Apache-2.0 для коду (файл LICENSE прочитано); ваги моделей теж заявлені як apache-2.0 на перевіреній картці моделі Hugging Face (Qwen/Qwen3-TTS-12Hz-1.7B-Base)
Так: код і перевірені ваги — обидва Apache-2.0, тож розміщувати для клієнта, що платить, дозволено; практичне обмеження — закони про згоду на клонування голосу, яких не торкаються ні README, ні картка моделі.
Не архівований, але останній push був 2026-03-17 (близько 7 місяців до 2026-10-07) — схоже на репозиторій релізів, а не на активну розробку. Офіційного сайту в репозиторії GitHub немає. На практиці потрібен GPU NVIDIA (приклади використовують device_map='cuda:0'; FlashAttention 2 «recommended to reduce GPU memory usage»); точні вимоги до VRAM: не знайдено в README чи картці моделі. Моделі на 0.6B і 1.7B параметрів. Клонує голос за 3 секунди з еталонного кліпу — отримайте письмову згоду власника голосу; настанов щодо згоди/відповідального використання в README чи картці моделі не знайдено. Ліцензію ваг перевірили лише в одній із п'яти карток моделей. API Alibaba: Qwen3-TTS-VC доступний для регіонів Сінгапур і Китай (Пекін).
Рекламодавці й відеопродюсери
Послуга озвучення реклами й відео.
Alibaba Cloud Model Studio продає Qwen3-TTS як API. Єдина знайдена ціна: створення голосу (клонування) «Billed at $0.01/voice», із безкоштовною квотою в регіоні Сінгапур 1,000 голосів протягом 90 днів після активації. Ціну за символ синтезу мовлення: не знайдено на відкритій сторінці.
ElevenLabs (виведено: README лише раз згадує ElevenLabs у таблиці бенчмарків — не називає себе альтернативою). Платний вхідний план ElevenLabs: Starter, $6/місяць за стандартним прайсом (на сторінці було промо $1 за перший місяць; $5/місяць при річній оплаті).