Новий лідер рейтінгу speech-to-speech! Google випустила Gemini 3.8 Live
Google випустила Gemini 3.8 Live та 3.8 Live Extended Thinking — голосові моделі, які міркують, не замовкаючи. Одна з них очолила рейтинг Speech-to-Speech Quality Index.

Google представила дві нові live-моделі: Gemini 3.8 Live для масштабу й швидкості та Gemini 3.8 Live Extended Thinking для складних задач. Головна фішка другої — вона міркує й говорить одночасно: модель не мовчить над відповіддю, а проговорює проміжні кроки, поки виконує завдання у фоні.
Дві моделі — два сценарії
Gemini 3.8 Live — базова модель, збудована для масштабу та цінності: плавний діалог, розуміння того, що бачить камера, у near real-time, і висока ефективність витрат. Extended Thinking — старша версія для складних багатокрокових задач: під час міркування вона видає природні вербальні підказки на кшталт «зачекайте, перевірю…», а потім у живому режимі розповідає, як просувається фонове завдання.
Обидві моделі викликають інструменти та API у фоні, не перериваючи розмову: можна попросити забронювати щойно згаданий ресторан, і модель продовжить балачку, поки бронювання оформлюється.
Цифри, які варто знати
Extended Thinking посіла перше місце в Speech-to-Speech Quality Index від Artificial Analysis (82.6) і лідирує в агентному завершенні завдань: 68.6% на τ-Voice та 35.1% на банківському бенчмарку Sierra. На Big Bench Audio модель набирає 97.7%, зберігаючи конкурентну ціну серед флагманів. Базова 3.8 Live — друга в Speech Agent Arena, що важливо саме для продуктових сценаріїв: користувачі віддають їй перевагу при порівнянні, а витрати на неї нижчі.
Для українських розробників цікавіша деталь: 3.8 Live автоматично перемикається між 97 мовами посеред розмови — без жодних налаштувань. Це знімає цілий клас проблем із багатомовними голосовими ботами.
Де це вже працює
- Розробникам — у Gemini API через Google AI Studio (режим Live) уже сьогодні.
- Умовним користувачам — у Search Live для покрокового вирішення проблем у реальному часі.
- Підписникам Google AI Pro/Ultra — у Gemini Live та у Workspace: Docs Live, Gmail Live, Keep Live.
- Підприємствам — приватне превʼю в Gemini Enterprise і скоро в Customer Experience.
Екосистема навколо вже готова: платформи Agora, LiveKit, Pipecat, Fishjam і Vercel підтримують Gemini Live API, тож голосовий інтерфейс можна зібрати, не займаючись потоковою інфраструктурою. Google також підкреслює безпеку: весь згенерований аудіо має невидимий водяний знак SynthID.
Контекст: гонитва за живим голосом
Це прямий хід у протистоянні з OpenAI, чиї GPT-Live-1 ми розбирали кілька днів тому. Обидві компанії тепер пропонують голосові моделі, які говорять без пауз і працюють з інструментами посеред розмови — різниця дедалі більше не в самій можливості, а в ціні, латентності та якості агентних сценаріїв. За бенчмарками Google, її новий флагман наразі попереду; перевіримо на власних українських задачах найближчим часом.
- 1Gemini 3.8 Live and Extended Thinking announcement — Google AI Studio (X), 15 вересня 2026
- 2Gemini Live API documentation — Google AI for Developers, вересень 2026
- 3Speech to Speech Quality Index — Artificial Analysis, вересень 2026
- 4EVA-Bench results — ServiceNow Research, вересень 2026
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.




Коментарі 0