Новий лідер рейтінгу speech-to-speech! Google випустила Gemini 3.8 Live

Google випустила Gemini 3.8 Live та 3.8 Live Extended Thinking — голосові моделі, які міркують, не замовкаючи. Одна з них очолила рейтинг Speech-to-Speech Quality Index.

Google представила дві нові live-моделі: Gemini 3.8 Live для масштабу й швидкості та Gemini 3.8 Live Extended Thinking для складних задач. Головна фішка другої — вона міркує й говорить одночасно: модель не мовчить над відповіддю, а проговорює проміжні кроки, поки виконує завдання у фоні.

Дві моделі — два сценарії

Gemini 3.8 Live — базова модель, збудована для масштабу та цінності: плавний діалог, розуміння того, що бачить камера, у near real-time, і висока ефективність витрат. Extended Thinking — старша версія для складних багатокрокових задач: під час міркування вона видає природні вербальні підказки на кшталт «зачекайте, перевірю…», а потім у живому режимі розповідає, як просувається фонове завдання.

Обидві моделі викликають інструменти та API у фоні, не перериваючи розмову: можна попросити забронювати щойно згаданий ресторан, і модель продовжить балачку, поки бронювання оформлюється.

Цифри, які варто знати

Speech-to-Speech Quality Index8.3
τ-Voice (агентні задачі)6.9
τ-Voice-banking (Sierra)3.5
Big Bench Audio9.8

Extended Thinking посіла перше місце в Speech-to-Speech Quality Index від Artificial Analysis (82.6) і лідирує в агентному завершенні завдань: 68.6% на τ-Voice та 35.1% на банківському бенчмарку Sierra. На Big Bench Audio модель набирає 97.7%, зберігаючи конкурентну ціну серед флагманів. Базова 3.8 Live — друга в Speech Agent Arena, що важливо саме для продуктових сценаріїв: користувачі віддають їй перевагу при порівнянні, а витрати на неї нижчі.

Для українських розробників цікавіша деталь: 3.8 Live автоматично перемикається між 97 мовами посеред розмови — без жодних налаштувань. Це знімає цілий клас проблем із багатомовними голосовими ботами.

Де це вже працює

  • Розробникам — у Gemini API через Google AI Studio (режим Live) уже сьогодні.
  • Умовним користувачам — у Search Live для покрокового вирішення проблем у реальному часі.
  • Підписникам Google AI Pro/Ultra — у Gemini Live та у Workspace: Docs Live, Gmail Live, Keep Live.
  • Підприємствам — приватне превʼю в Gemini Enterprise і скоро в Customer Experience.

Екосистема навколо вже готова: платформи Agora, LiveKit, Pipecat, Fishjam і Vercel підтримують Gemini Live API, тож голосовий інтерфейс можна зібрати, не займаючись потоковою інфраструктурою. Google також підкреслює безпеку: весь згенерований аудіо має невидимий водяний знак SynthID.

Контекст: гонитва за живим голосом

Це прямий хід у протистоянні з OpenAI, чиї GPT-Live-1 ми розбирали кілька днів тому. Обидві компанії тепер пропонують голосові моделі, які говорять без пауз і працюють з інструментами посеред розмови — різниця дедалі більше не в самій можливості, а в ціні, латентності та якості агентних сценаріїв. За бенчмарками Google, її новий флагман наразі попереду; перевіримо на власних українських задачах найближчим часом.

Джерела
  1. 1Gemini 3.8 Live and Extended Thinking announcement Google AI Studio (X), 15 вересня 2026
  2. 2Gemini Live API documentation Google AI for Developers, вересень 2026
  3. 3Speech to Speech Quality Index Artificial Analysis, вересень 2026
  4. 4EVA-Bench results ServiceNow Research, вересень 2026
Категорія: Голос, мова й генерація · також у Моделі й порівняння

Коментарі 0

?
Ще тихо. Скажіть перше слово.

Читати далі