YuE2: відкрита модель, яка пише пісні вдома — і спершу складає ноти
Модель спершу пише ноти, а потім записує пісню: YuE2 — відкрита генеративна модель, яку можна запустити вдома на відеокарті з 24 ГБ. У бенчмарку авторів вона обійшла Suno v5 і Mureka 9, але ліцензія — лише некомерційна.

Безкоштовна й відкрита модель YuE2 вміє написати повноцінну пісню з вокалом прямо на вашому компʼютері — без підписки на Suno чи ElevenLabs. Секрет у двох кроках: модель спершу пише ноти, а потім записує пісню за цими нотами.
Модель YuE2 випустила команда m-a-p (Multimodal Art Projection — дослідники з HKUST і партнерів) на Hugging Face 9 вересня 2026 року. Це продовження відкритої моделі YuE, і за власними тестами авторів нова версія стрибнула далеко вперед. Головне — YuE2 можна завантажити, покрутити як завгодно і запустити вдома, якщо у вас є відеокарта з 24 ГБ памʼяті.
Як це працює: спершу ноти, потім запис
Ідея проста, як у людини: спершу композитор сідає й записує мелодію на папері, а вже потім іде в студію співати. YuE2 робить те саме. Такий підхід у статті називається symbolic planning — тобто «планування через символи»: модель спершу пише ноти (мелодію й акорди у форматі ABC), а потім за цим нотним планом синтезує готовий звук у стерео на 48 кГц. За рахунок цього пісні виходять структурнішими: у них є ясна мелодія, а не «каша» зі звуків.
Нотний план — це не чорна скринька. Його можна відкрити, відредагувати вручну або доручити іншому AI-агенту: перегармонізувати пісню, змінити стиль або лірику — і перерендерити трек заново. Також модель уміє робити кавери: вона розпізнає мелодію з запису і співає її в новому виконанні.
Наскільки добре виходить
Автори порівняли YuE2 з комерційними сервісами на власному бенчмарку WildSongBench (192 промпти, оцінка 0–10). Ось середні бали найкращих генерацій:
Попередня відкрита версія YuE отримала лише 4,92 — тож прогрес за рік відчутний. На задачі каверів модель також показує сильні результати: точність розпізнавання мелодії Hit@1 — 71,3%.
Важливо: наведені бали — власні метрики авторів YuE2, а не незалежний тест. Іще один нюанс: ліцензія CC BY-NC 4.0 — некомерційна. Використовувати пісні в комерційних проєктах не можна. Для порівняння: Suno та ElevenLabs дозволяють комерційне використання лише на платних підписках, безкоштовні плани — теж лише для некомерційних цілей.
Керувати характером генерації можна через параметр керівництва (CFG) у діапазоні 1,0–1,2: він визначає, наскільки точно модель слідує вашому опису стилю й тексту пісні. У командному рядку є три режими роботи: повний — «ноти + запис», режим лише мелодії, коли ви задаєте голос, а модель добудовує решту, і повністю вимкнений нотний план, коли модель пише пісню напряму, без проміжних нот.
Що потрібно, щоб запустити вдома
- Відеокарта з 24 ГБ памʼяті (BF16) і близько 24 ГБ оперативної памʼяті
- Пік споживання відеопамʼяті — приблизно 11 ГБ (до 14 ГБ на максимальному контексті)
- Встановлення через pip-пакет yue2_infer з Hugging Face, запуск однією командою yue2 generate
- На виході — FLAC-файл пісні плюс нотний план у ABC, який можна редагувати
Швидкість теж приємна: пісня на 3,6 хвилини генерується приблизно за 71 секунду на відеокарті RTX 4090. На серверній H800 через vLLM команда показувала до 373 пісень на годину при високій конкурентності — тож для масової генерації це теж реально.
Хочете спершу просто послухати? Офіційне демо живе на сторінці map-yue2.github.io — там викладено 9 кроків еволюції однієї пісні у 14 версіях, можна почути, як модель рухається від чернетки до фіналу. Спільнота вже відреагувала швидко: за кілька днів після релізу зʼявилися порти для llama.cpp (GGUF), ComfyUI та Apple MLX.
Окрема фішка — редакційний цикл. Оскільки нотний план зберігається як звичайний текст, його можна просто відкрити у блокноті й поправити: пересунути акорд, підняти мелодію на тон. Після цього пісня перерендерюється з новим планом за хвилину. Це відчутно ближче до роботи справжнього музиканта, ніж «перебувати промпт і молитися».
Що це означає
Поки найкращі комерційні сервіси — Suno й ElevenLabs — тримають модель за subscribe-платною стіною, YuE2 дає те саме «пісня з текстового опису» у відкритому коді. Для музикантів це означає контроль над кожною нотою, для розробників — можливість вбудувати генерацію пісень у власні застосунки (у моделі є окремі API для планування нот і синтезу звуку).
Ми вже писали, що ElevenLabs Music v2.5 дозволяє комерційні права навіть на безкоштовному тарифі — деталі в нашій статті: <https://prostoai.xyz/articles/elevenlabs-music-v2-5-naikrashcha-muzychna-model-i-tvoi-prava-na-treky-na-vsikh-taryfakh-vkliuchno-z-bezkoshtovnym/>. YuE2 у цьому плані суворіша: некомерційна ліцензія означає, що для бізнесу чи YouTube-монетизації вона не підходить. Але для навчання, експериментів і повного контролю над піснею — це найсильніший відкритий варіант на сьогодні.
- 1m-a-p/YuE2-3B — модельна картка на Hugging Face — Hugging Face, вересень 2026
- 2Офіційне демо YuE2 (9 кроків / 14 версій пісні) — m-a-p, вересень 2026
- 3YuE — технічний звіт попередньої версії (arXiv) — arXiv, березень 2025
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.




Коментарі 0