SWE-2 від Cognition: 50% на FrontierCode за 64% нижчу ціну — нова точка на кривій Парето

Творці Devin випустили SWE-2 — спеціалізовану модель для програмування, донавчену RL-ом на базі відкритої Kimi K3 (2.8 трлн параметрів). Вона практично наздоганяє Fable 5.1 у кодінгу, обходить Grok 4.6 і GPT-5.6 Sol і коштує до 70% дешевше. Розбираємо цифри, рівні зусиль і що це змінює.

Cognition — компанія, що створила першого «AI-програміста» Devin — 10 вересня випустила SWE-2, спеціалізовану модель для програмування. Формула проста: результати на рівні фронтірних моделей у кодінгу — при ціні на 64% нижчій за лідера. «Наша найближча модель до фронтиру», — формулюють вони самі.

Що таке SWE-2

SWE-2 — це post-training відкритої моделі Kimi K3 від Moonshot AI: мультимодальне сімейство MoE на 2.8 трильйона параметрів, яке вже мало розвинене агентне RL-навчання на кодінгу. Поверх цієї бази Cognition зробила власне масштабне reinforcement learning донавчання — за офіційними словами, «RL масштабовано до кількох трильйонів параметрів».

  • FrontierCode 1.1 Main: 50.0% — менше 1 відсоткового пункта відставання від лідера Fable 5.1 (Anthropic) — при 64% нижчій вартості запуску.
  • DeepSWE 1.1: 73.0% (+4.5 п.п. до базової Kimi K3).
  • Terminal-Bench 2.1: 92.8% (+4.5 п.п.).
  • Terminal-Bench 4: 27.3% (+5.8 п.п.) — найскладніший термінальний тест.

На різних тестах модель обходить попередню SWE-1.7 і Grok 4.6 (останню — і за результатом, і за ціною), а сумарна економія проти флагманів сягає 70%.

Рівні зусиль: перша модель Cognition з «глибиною міркувань»

SWE-2 — перша модель Cognition з вибором effort level. Механіка цікава: лінійний штраф за вартість вбудований прямо в RL-тренування — штрафи на різних рівнях зусиль калібруються за локальним нахилом кривої Парето базової моделі, тому вся крива «якість/ціна» зсувається вперед, зберігаючи форму.

  • Medium effort: задачі розвʼязуються на 81% дешевше і 58% швидше — модель навчилося ретельно досліджувати код перед змінами, замість токенити безкінечно.
  • Max effort: максимум токенів на найскладніші архітектурні проблеми.

Головний трюк SWE-2 не в архітектурі, а в економіці тренування: подвоєний обʼєм даних, draft-модель для декодування, NVFP4/FP8 ядра й ітеративний verifier-flywheel — усе, щоби зсунути Парето-фронтир, а не просто піти вправо по ньому.

Доступність

Модель уже працює в платформі Devin — і в десктопному застосунку, і в CLI. За анонсом, упродовж першого місяця після релізу SWE-2 безкоштовна для підписників Pro, Max і Teams.

Що це змінює

  • Ціновий тиск на флагмани: Fable 5.1 і GPT-5.6 Sol втрачають цінову перевагу при порівнянній якості в кодінгу — комерційний поріг трильйонних моделей переглядається.
  • Нова формула: відкрита китайська база (Kimi K3) + американська команда донавчання = модель фронтірного рівня. Це вже не гіпотеза, а працюючий продукт.
  • RL у трильйонному масштабі: перше публічне підтвердження, що масштабування reinforcement learning працює на рівні кількох трильйонів параметрів.
  • Практичний висновок для команд: якщо ви платите за кодінг-агента, вашого пайплайна це стосується напряму — частина задач, які сьогодні йдуть на флагмани, можна перевести на SWE-2 і платити втричі менше.

Джерела: офіційний анонс Cognition (X, 10 вересня 2026), розбір технічного звіту з цифрами офіційного блогу Cognition.

Матеріал із рубрики «Моделі та релізи»CognitionSWE-2КодінгKimi K3
Поділитися статтею
TelegramXLinkedIn

Читати далі