Meta випустила Muse Voice Transcribe: realtime-розпізнавання мовлення за $0.18/год

Перша модель аудіосприйняття від Meta Superintelligence Labs: streaming-транскрипція, діаризація 20+ мовців і endpointing в одній моделі — з #1 на Artificial Analysis. Доступна через Meta Model API та OpenRouter.

Meta Superintelligence Labs представила Muse Voice Transcribe — свою першу модель real-time аудіосприйняття. Це не «ще один Whisper»: streaming-розпізнавання мовлення, діаризація 20+ мовців і endpointing живуть в одній авторегресивній моделі, яку Meta заявляє #1 на Artificial Analysis за streaming speech-to-text (станом на 1 вересня 2026). Ціна — $0.18 за годину аудіо.

Як вона працює: аудіо як токени

Muse Voice Transcribe належить до сімейства Muse Spark і обробляє звук у чанках по 80 мілісекунд (12.5 Гц): кожен перетворюється на один «soft-токен». Далі модель самостійно вирішує — продовжити слухати (емітує спеціальний токен <|next_audio|>, який заміщується наступним чанком) або вже видати текст. Коли потік обривається, вставляється <|empty_audio|>, і модель дописує решту. Архітектурно це рідкісний дизайн: модель сама контролює, скільки аудіо прослухати перед кожним словом.

Кількість прослуханого контексту перед передбаченням слова Meta називає «delay», і тут розгорнутий компроміс: чим довше чекаєш — тим точніше, але повільніше. Рішення — «adaptive delay»: модель динамічно підбирає затримку для кожного слова залежно від складності, тренуючись reinforcement learning з мультиплікативною нагородою WER × delay. За цим підходом модель досягає Pareto-фронту в парі «швидкість — точність», вимірюваній як час до фінальної транскрипції.

Діаризація та endpointing — без окремих моделей

Замість конвеєра «ASR → окрема модель діаризації → окремий детектор мови» Meta додає спеціальні токени: <|start_of_turn|> імітує перемикання мовця, <|speaker_A|>…<|speaker_Z|> маркують промовця, <|speech_onset|>/<|speech_endpoint|> позначають початок і кінець вислову. Усі три задачі тренуються разом з ASR, з додатковими нагородами зверху. Практичний наслідок: модель тягне довгі записи понад годину з 20+ мовцями без жодної постобробки — типова робота, для якої раніше збирали ланцюги з Whisper + pyannote.

Одна модель робить те, для чого раніше збирали конвеєр із трьох: streaming-транскрипцію, розпізнавання мовців і детекцію кінця фрази.

Мови, код-сві́тчинг і бенчмарки

Модель навчалась на 70+ мовах, з яких 25 валідовані на старті релізу (повний список — у доках Meta). Білінгвам найцікавіше інше: нативний code-switching — довільне перемикання мов усередині речення й між реченнями, без окремих конфігурацій. Точність підвищують три типи biasing — мовою, ключовими словами та контекстом: можна підказати моделі імена продуктів або тематику зустрічі.

На бенчмарках Meta посилається на перше місце Artificial Analysis у категорії streaming speech-to-text і на публічних діаризаційних бенчмарках (рейтинг станом на 1 вересня 2026). Незалежні тести користувачів показують помітно менше помилок, ніж у локального Whisper на англійській — але це сторонні спостереження, офіційні метрики Meta поки обмежуються заявою про лідерство.

Ціна і де взяти

Ціна на Meta Model API — $0.18 за годину аудіо. Для порівняння: OpenAI gpt-4o-transcribe і whisper-1 коштують $0.006 за хвилину ($0.36/год) — тобто Muse виходить удвічі дешевше, при цьому діаризація й endpointing уже всередині, без додаткових сервісів. Через OpenRouter модель доступна окремим Speech-to-Text ендпоінтом (POST /api/v1/audio/transcriptions з base64-аудіо), з verbose_json для сегментів і таймстампів слів — якщо маршрутизований провайдер це підтримує.

  • Meta Model API — $0.18/год, стрімінг і one-shot транскрипція
  • OpenRouter: POST /api/v1/audio/transcriptions, model=meta/muse-voice-transcribe-1.0
  • Вже вбудована в голосовий набір Meta AI та Muse Code (голосова диктовка по Fn)
  • Довгий звук 1+ година, 20+ мовців, без постобробки

Що це означає практично: ринок realtime-ASR, який останні роки тримали OpenAI з gpt-4o-transcribe і куча Whisper-обгорток, отримав сильного гравця з агресивною ціною. Для продуктів з голосом — диктовки, зустрічі, кол-центри, voice-агенти — одна модель замість конвеєра «транскрипція + діаризація + VAD + endpointing» суттєво спрощує архітектуру. А для нас цікава деталь — заявлена підтримка code-switching: українсько-англійські зустрічі якраз той кейс, де класичні ASR звично сиплються.

Валідований список із 25 мов — та частина, яку Meta офіційно підтверджує на старті. Українська модель навчалась у межах 70+ мов, але перед продакшн-використанням точність української варто перевірити на власному аудіо — незалежних бенчмарків по ній поки немає.

Джерела
  1. 1Meta AI Research — Introducing Muse Voice Transcribe research.meta.ai, вересень 2026
  2. 2Meta Model API — Muse Voice Transcribe (модель і ціни) developer.meta.com, вересень 2026
  3. 3OpenRouter — meta/muse-voice-transcribe-1.0 (STT endpoint) openrouter.ai, вересень 2026
Матеріал із рубрики «Моделі та релізи»Моделі та релізиГолосові агенти
Поділитися статтею
TelegramXLinkedIn

Читати далі