Google викотили Gemini 3.8 Flash TTS та Gemini 3.8 Flash-Lite TTS
Це нові text-to-speech моделі для генерації мовлення з тексту:
- Flash (старша версія) — створена для складної режисури озвучки, де критично контролювати кожну емоцію.
- Flash-Lite (молодша версія) — заточена під швидку й дешеву генерацію в реальному часі (голосові ШІ-агенти, масовий дубляж).
Ключові фічі флагманської Flash:
Обидві моделі очолили рейтинги якості Hume AI та лідирують у сліпих тестах Voice Arena. Усе згенероване аудіо захищене невидимим водяним знаком SynthID.
Що далі й де спробувати? Незабаром Google додасть «ремікси» — можна буде взяти будь-який із 2000+ готових бібліотечних голосів і текстовим запитом скоригувати йому емоції чи регіональний говір.
Моделі вже доступні в Gemini API та Google AI Studio. Для звичайних користувачів версію Flash додали в Gemini Notebook, а Flash-Lite — в Google Vids. Доступ через Gemini Enterprise з'явиться трохи згодом.
Орлов вигорів з АІ | YouTube | АІ БАЗА | GotBurnout.io
Це нові text-to-speech моделі для генерації мовлення з тексту:
- Flash (старша версія) — створена для складної режисури озвучки, де критично контролювати кожну емоцію.
- Flash-Lite (молодша версія) — заточена під швидку й дешеву генерацію в реальному часі (голосові ШІ-агенти, масовий дубляж).
Ключові фічі флагманської Flash:
- Генерація голосу з нуля за текстовим промптом на 100+ мовах і діалектах.
- Повний контроль режисури: прямо в тексті можна прописувати тон, темп, акцент і стиль вимови (наприклад, пошепки чи з напругою), а також додавати ремарки — сміх, зітхання й короткі реакції.
- Клонування голосу всього за 30-секундним семплом (вимагає обов’язкового аудіопідтвердження згоди від власника голосу).
- Багатогодинні аудіо без дрейфу: голос не деградує з часом, зберігаючи початковий тембр і акцент.
- Діалоги з одного файлу: генерує розмову двох різних персонажів з природними перебиваннями та плавними переходами.
Обидві моделі очолили рейтинги якості Hume AI та лідирують у сліпих тестах Voice Arena. Усе згенероване аудіо захищене невидимим водяним знаком SynthID.
Що далі й де спробувати? Незабаром Google додасть «ремікси» — можна буде взяти будь-який із 2000+ готових бібліотечних голосів і текстовим запитом скоригувати йому емоції чи регіональний говір.
Моделі вже доступні в Gemini API та Google AI Studio. Для звичайних користувачів версію Flash додали в Gemini Notebook, а Flash-Lite — в Google Vids. Доступ через Gemini Enterprise з'явиться трохи згодом.
Орлов вигорів з АІ | YouTube | АІ БАЗА | GotBurnout.io