Новій моделі ШІ вистачило половини тексту: чому це може здешевити навчання
Дослідники з Китаю додали мовній моделі проміжний крок: спочатку вона визначає загальний зміст наступного фрагмента, а потім формує його слово за словом. У навчанні їй знадобилося майже вдвічі менше тексту, щоб наздогнати звичайну модель.

Сучасні мовні моделі навчають на трильйонах фрагментів тексту — і кожен зайвий мільярд коштує дорого. Дослідники з Китаю показали модель, якій для досягнення того самого навчального показника вистачило 51,3% тексту, потрібного відомій відкритій моделі OLMo. Їхній прийом простий за задумом: перш ніж добирати слова, ШІ намагається визначити зміст наступного фрагмента. Якщо результат повторять інші команди, великі моделі можна буде навчати помітно дешевше.
Що саме випустили
9 вересня 2026 року Intern-NCP Team опублікувала технічний звіт про NCP-ArchPreview. Це мовна модель на 8,94 млрд параметрів, навчена на 5,73 трлн токенів із відкритого набору Dolma 3 Mix. Її основою став дизайн OLMo-3-7B, до якого додали окремий модуль для роботи з прихованими поняттями. Ваги моделі після першого етапу навчання доступні на Hugging Face під ліцензією Apache 2.0.
Сама ідея Next Concept Prediction, або NCP, не зʼявилася цього тижня. Та сама дослідницька група описала ConceptLM у лютому 2026 року й перевірила підхід на моделях до 1,5 млрд параметрів, а також у додатковому навчанні Llama 8B. Нова робота важлива масштабом: автори довели експеримент до майже 9 млрд параметрів і трильйонів навчальних токенів.
Вірусний переказ називає це кінцем прогнозування наступного токена. Насправді NCP-ArchPreview не замінює цей механізм: модель спільно навчається передбачати токени й поняття, а текст під час генерації все одно виходить токен за токеном.
Як модель переходить від фрагмента до слів
Архітектура складається з трьох частин. Спочатку 16-шаровий Token Encoder створює представлення тексту. Модель усереднює приховані стани кожних чотирьох токенів і отримує коротшу послідовність: один умовний «концепт» на чотири токени. Далі 8-шаровий Concept Module прогнозує наступний елемент у цьому прихованому просторі. Нарешті 16-шаровий Token Decoder отримує і токенний контекст, і передбачений концепт та прогнозує наступний токен.
Щоб зробити простір понять керованим, автори застосували product quantization: 32 невеликі словники по 128 кодових векторів. Модель не вибирає одне готове людське поняття на кшталт «автомобіль» чи «причина», а комбінує вектори, вивчені з власних прихованих станів. Тому слово «поняття» тут технічне: окремі коди не зобовʼязані мати зрозуміле людині значення.
- NTP навчає модель передбачати наступний токен — це звичайна ціль сучасних LLM.
- NCP навчає окремий модуль передбачати приховане представлення наступної групи токенів.
- VQ-ціль підлаштовує кодові словники під приховані представлення моделі.
- Усі три цілі оптимізуються разом від початку до кінця навчання.
Результати: де справді є виграш
- 51,3% навчальних токенів: стільки NCP-ArchPreview знадобилося, щоб досягти фінальної мовної помилки OLMo-3-7B на Stage 1. Автори називають це 1,95-кратним прискоренням збіжності за токенним бюджетом.
- 49,04 проти 46,59: підсумковий середній результат на 26 тестах після Stage 1, тобто перевага 2,45 пункту.
- GSM8K: 45,26 проти 39,27, або +5,99 пункту на шкільній математиці. На MATH-500 приріст скромніший — +1,96 пункту.
- HumanEval: 31,38 проти 27,10, або +4,28 пункту на генерації коду.
- 1,74 раза краща обчислювальна ефективність у серії scaling-law експериментів із підбором розміру моделі та обсягу даних.
Порівняння з OLMo-3-7B не ідеально симетричне: NCP-ArchPreview має приблизно 8,94 млрд параметрів, бо в неї є додатковий концептуальний модуль. Автори окремо побудували базові моделі, вирівняні за кількістю параметрів і обчисленнями. NCP-архітектура перевершила модель з таким самим обсягом обчислень, а до значення навчальної помилки параметрично вирівняної 8,9B-бази наблизилася, використавши 85% її аналітичних FLOPs. Саме «наблизилася», а не перевершила — це важливе уточнення до вірусного допису.
Так само 51,3% — це не доказ удвічі швидшого навчання за годинником і не «та сама загальна розумність». Це кількість токенів, потрібна для досягнення конкретного значення training loss. У картці моделі команда прямо застерігає: показник не вимірює реальний час навчання чи швидкість інференсу.
Чому результат усе одно важливий
Навчання великих моделей дедалі частіше впирається не лише в кількість GPU, а й у якість та обсяг даних. Якщо додаткова ціль змушує модель витягувати більше корисного сигналу з того самого тексту, це змінює економіку масштабування: менше токенів для заданого рівня помилки або кращий результат за того самого бюджету. NCP-ArchPreview — поки не новий стандарт, але це вже значно серйозніший аргумент, ніж малий лабораторний прототип.
Прихований простір виявився корисним і після основного навчання. В експериментах автори заморожували майже всю модель і оновлювали лише 17 млн параметрів кодових словників та концептуальних головок для адаптації до коду, математики або знань. Окремо концептуальні представлення додали до чернеткової моделі DFlash2 для спекулятивного декодування: середня кількість прийнятих токенів зросла на 4,17%. Це перспективний сигнал, хоча не пряме вимірювання прискорення готового продукту.
Що поки не доведено
- Це свіжий препринт і результати самої команди; незалежного відтворення ще немає.
- Після додаткового Stage 2 навчання перевага в загальному середньому скоротилася з 2,45 до 0,59 пункту, а середній результат на кодових тестах став на 0,65 пункту нижчим за OLMo-базу.
- Модель перевіряли з контекстом до 8192 токенів; довгі контексти автори залишили для майбутньої роботи.
- Опублікований чекпойнт — базова модель, а не налаштований чат-асистент.
- Ваги й код оцінювання відкриті, але на момент підготовки матеріалу сторінка моделі позначає тренувальний код як coming soon.
Висновок
NCP-ArchPreview не завершує еру LLM і не скасовує передбачення наступного токена. Вона показує практичніший сценарій: залишити звичну генерацію, але додати під час навчання коротший рівень прихованих представлень, який допомагає планувати наступний фрагмент. Відкриті ваги, трильйонний масштаб навчання та контрольні порівняння роблять роботу вартою уваги. Чи стане NCP новою базовою архітектурою, вирішать незалежні відтворення й наступні моделі, а не один сильний технічний звіт.
- 1NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction — arXiv, 9 вересня 2026
- 2NCP-ArchPreview 8.9B — Stage 1 — Hugging Face, вересень 2026
- 3Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models — arXiv, 9 лютого 2026
- 4NCP-ArchPreview evaluation and inference code — GitHub, вересень 2026
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.




Коментарі 0