GPT-Live-1 у API: розмова без пауз — і Picsart перший показав, як це виглядає в продукті
OpenAI винесла голосову модель GPT-Live-1 з ChatGPT в API: вона слухає і говорить одночасно, переживає переривання і делегує reasoning бекенд-моделі — за $0,05 за хвилину голосового шару. Picsart уже підключив її до своїх агентів: говори, перебивай, міняй задачу на льоту.

10 вересня OpenAI винесла в API GPT-Live-1 — голосову модель, яка слухає і говорить одночасно, переживає переривання, паузи і зміну напрямку розмови. Першим помітним продукт-кейсом став Picsart: їхні Agents тепер працюють через живий голос — говори з агентом як з людиною, перебивай посеред задачі, міняй запит без початку з нуля.
Що таке GPT-Live-1
Це та модель, що стоїть за живими голосовими розмовами ChatGPT, тепер у API. Головна відмінність від класичного голосового стека — одна модель замість ланцюжка STT → LLM → TTS: вона міркує над вхідним і вихідним аудіо разом, тож переривання, паузи і фонові «ага-ага» обробляються в момент, а не через крихкі хендофф-и між трьома системами.
- Дуплекс: слухає і говорить одночасно — можна перебити посеред відповіді, додати деталі чи змінити питання без «почніть спочатку».
- Делегування reasoning: розмову веде GPT-Live-1, а складні міркування і tool calls йдуть у бекенд-модель — GPT-6 Astra для складних задач, щось швидше на кшталт Luna для типових (розклади, статуси замовлень).
- Тон і темп: характер агента налаштовується через system prompt.
- Телефонія: повноцінні дуплекс-агенти для дзвінків — від бронювання до підтримки.
- Транскрипти в коробці: ASR-транскрипти і текст відповіді нативно; є turn detection для тих, хто будує по чергах.
Цифри і ціна
- Full Duplex Bench: +30 відсоткових пунктів проти GPT-Realtime-2.1 — з великим приростом у turn-taking latency і «інтерактивній поведінці» (реакція на переривання, backchannels, фонову мову).
- Tau3: #1 у класі voice-agent intelligence на end-to-end задачах — у парі з GPT-6 Astra (medium reasoning).
- Speak (мова-тутор): у ранніх оцінках переривання знизились майже на 80% проти turn-based систем — учень отримує час подумати до відповіді.
- Ціна: $0,05 за хвилину за голосовий front-end шар; бекенд-модель і harness — окремо, на ваш вибір.
Архітектурний зсув: голос перестає бути «конвеєром із трьох станцій». Керований шар розмови відділяється від reasoning — і кожен підбирає бекенд під задачу: швидкий для обʼєму, розумний для складного.
Picsart: перший показовий кейс
Picsart підключив GPT-Live-1 до своїх Agents — агентів для створення контенту, редагування фото й налаштування рекламних кампаній. Що це дає на практиці:
- Розмова в реальному часі: говориш із агентом як з людиною — без очікування повної відповіді перед тим, як вставити слово.
- Корекція на льоту: додати контекст, уточнити чи перенаправити агента — без перезапуску задачі з нуля.
- Hands-free на мобільному: описати наступний flow, ad set чи редагування голосом — без набирання промтів.
Показово, що репост анонсу прийшов з акаунта OpenAI Developers — OpenAI активно підсилює ранні інтеграції як еталонні кейси для нового API.
Що це змінює
- Спрощення архітектури: замість склейки STT/LLM/TTS і власної логіки переривань — один модельний шар, що поводиться як співрозмовник.
- Гнучкість бекенду: голос і «мислення» нарешті розділені — міняєте reasoning-модель, не торкаючись голосового UX.
- Ентерпрайз-напрям: OpenAI паралельно просуває Presence — рішення на базі GPT-Live-1 для корпоративних голосових агентів, що вміють діяти в системах компанії й ескалювати до людей.
- Кому вже годиться: підтримка, бронювання, tutoring, hands-free мобільні сценарії. Кому рано: задачі з жорсткою відповідністю і регуляторикою — переривчаста розмова вимагає іншого тестування, ніж чат.
Джерела: Build more natural voice experiences with GPT-Live-1 in the API — офіційний анонс OpenAI, 10 вересня 2026; Picsart Agents — анонс інтеграції (X, @Picsart).
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.



