SWE-2 від Cognition: 50% на FrontierCode за 64% нижчу ціну — нова точка на кривій Парето
Творці Devin випустили SWE-2 — спеціалізовану модель для програмування, донавчену RL-ом на базі відкритої Kimi K3 (2.8 трлн параметрів). Вона практично наздоганяє Fable 5.1 у кодінгу, обходить Grok 4.6 і GPT-5.6 Sol і коштує до 70% дешевше. Розбираємо цифри, рівні зусиль і що це змінює.

Cognition — компанія, що створила першого «AI-програміста» Devin — 10 вересня випустила SWE-2, спеціалізовану модель для програмування. Формула проста: результати на рівні фронтірних моделей у кодінгу — при ціні на 64% нижчій за лідера. «Наша найближча модель до фронтиру», — формулюють вони самі.
Що таке SWE-2
SWE-2 — це post-training відкритої моделі Kimi K3 від Moonshot AI: мультимодальне сімейство MoE на 2.8 трильйона параметрів, яке вже мало розвинене агентне RL-навчання на кодінгу. Поверх цієї бази Cognition зробила власне масштабне reinforcement learning донавчання — за офіційними словами, «RL масштабовано до кількох трильйонів параметрів».
- FrontierCode 1.1 Main: 50.0% — менше 1 відсоткового пункта відставання від лідера Fable 5.1 (Anthropic) — при 64% нижчій вартості запуску.
- DeepSWE 1.1: 73.0% (+4.5 п.п. до базової Kimi K3).
- Terminal-Bench 2.1: 92.8% (+4.5 п.п.).
- Terminal-Bench 4: 27.3% (+5.8 п.п.) — найскладніший термінальний тест.
На різних тестах модель обходить попередню SWE-1.7 і Grok 4.6 (останню — і за результатом, і за ціною), а сумарна економія проти флагманів сягає 70%.
Рівні зусиль: перша модель Cognition з «глибиною міркувань»
SWE-2 — перша модель Cognition з вибором effort level. Механіка цікава: лінійний штраф за вартість вбудований прямо в RL-тренування — штрафи на різних рівнях зусиль калібруються за локальним нахилом кривої Парето базової моделі, тому вся крива «якість/ціна» зсувається вперед, зберігаючи форму.
- Medium effort: задачі розвʼязуються на 81% дешевше і 58% швидше — модель навчилося ретельно досліджувати код перед змінами, замість токенити безкінечно.
- Max effort: максимум токенів на найскладніші архітектурні проблеми.
Головний трюк SWE-2 не в архітектурі, а в економіці тренування: подвоєний обʼєм даних, draft-модель для декодування, NVFP4/FP8 ядра й ітеративний verifier-flywheel — усе, щоби зсунути Парето-фронтир, а не просто піти вправо по ньому.
Доступність
Модель уже працює в платформі Devin — і в десктопному застосунку, і в CLI. За анонсом, упродовж першого місяця після релізу SWE-2 безкоштовна для підписників Pro, Max і Teams.
Що це змінює
- Ціновий тиск на флагмани: Fable 5.1 і GPT-5.6 Sol втрачають цінову перевагу при порівнянній якості в кодінгу — комерційний поріг трильйонних моделей переглядається.
- Нова формула: відкрита китайська база (Kimi K3) + американська команда донавчання = модель фронтірного рівня. Це вже не гіпотеза, а працюючий продукт.
- RL у трильйонному масштабі: перше публічне підтвердження, що масштабування reinforcement learning працює на рівні кількох трильйонів параметрів.
- Практичний висновок для команд: якщо ви платите за кодінг-агента, вашого пайплайна це стосується напряму — частина задач, які сьогодні йдуть на флагмани, можна перевести на SWE-2 і платити втричі менше.
Джерела: офіційний анонс Cognition (X, 10 вересня 2026), розбір технічного звіту з цифрами офіційного блогу Cognition.
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.



