Модель DeepSeek навчили ніколи не відмовляти: як це зробили і що з цього вийшло
Команда dealignai перезаписала ваги офіційного DeepSeek-V4.1-Flash так, щоб модель перестала відмовляти. 552 млрд параметрів, vision, інструменти, контекст 1M — і жодних відмов.

Усі великі мовні моделі мають вбудовані правила: на небезпечні чи заборонені запити вони відповідають відмовою. Зазвичай ці правила «знімають» хитрими промптами — і модель часто все одно відмовляється. Команда dealignai пішла іншим шляхом: вони взяли офіційний DeepSeek-V4.1-Flash (гігантська модель на 552 млрд параметрів, яка бачить зображення, працює з інструментами та тримає контекст у мільйон токенів) і перезаписали самі ваги моделі так, щоб механізм відмови просто перестав спрацьовувати. Результат виклали на Hugging Face безкоштовно — за два дні його завантажили 943 рази. По суті, це рідкісна можливість подивитися на питання, яке хвилює всіх: де саме в моделі живе її обережність — і що буде, якщо її прибрати.
Що саме зробили інженери
Звичний спосіб «роззважити» модель — це обхідні шляхи на рівні розмови: хитро сформульований запит, рольова гра, довга підготовча історія. Модель обманюють, але сам механізм відмови залишається всередині. Команда dealignai пішла на рівень глибше: вони знайшли в вагах моделі ті «нервові шляхи», які відповідають за відмови, і перезаписали їх. Важливо, що все інше — знання, здатність міркувати, робота з зображеннями й інструментами, пам'ять на мільйон токенів — залишилося недоторканим. Ніяких хитрих програм-обгорток не потрібно: це звичайний файл моделі, який вантажиться так само, як оригінал.
База — офіційний DeepSeek-V4.1-Flash від deepseek-ai: 552 млрд параметрів, з яких у роботі одночасно задіяні лише 8–16 млрд (така економна архітектура називається MoE), контекст у мільйон токенів, бачення зображень, виклик інструментів і вбудований «режим роздумів». Модифікована версія зберігає все це — автори кажуть, що перевірили кожен критичний компонент на побітову ідентичність з оригіналом.
Результати їхніх тестів
Головний тест — HarmBench, стандартний набір із 320 небезпечних запитів (від хімії до кібератак). Оригінальна модель відмовляється на більшості таких запитів, а особливо охоче — коли їй дозволили спершу міркувати: у «роздумах» вона сама знаходить причини не відповідати. Модифікована версія, за словами авторів, відповіла на всі 320 запитів без жодної відмови, при цьому не «ламаючись»: у довгих розмовах не зациклюється, зображення описує коректно, довгий контекст у 35 тисяч токенів тримає.
Друге питання — чи не «провалюються» разом із відмовами й звичайні знання. Автори прогнали повний набір тесту знань MMLU (14 042 питання): точність впала з 87% до 82,7%. Але якщо прибрати «етичні» предмети (моральні сценарії, юриспруденцію, професійне право — саме там модифікація б'є сильніше), втрата на решті 11 тисяч питань становить лише близько 1 відсоткового пункту. Найбільше просіли moral scenarios: з 77% до 37% — логічно, адже це питання саме про етичні вибори.
Як це запускати (і скільки це коштує)
Модель важить близько 510 гігабайт — для неї потрібно щонайменше 4 серверні видеокарти H200 з NVLink-з'єднанням. Автори підтвердили роботу на такій конфігурації через SGLang: холодний старт близько 28 хвилин, швидкість генерації близько 100 токенів за секунду на один потік. Тобто це реліз для дослідницьких лабораторій, а не для домашнього комп'ютера. Через OpenRouter модифікована версія недоступна — там працює лише офіційний deepseek-ai/DeepSeek-V4.1-Flash.
Чесне уточнення: усі цифри бенчів — від самих авторів модифікації, незалежної перевірки поки немає. Але сам тренд очевидний: uncensored-версії великих моделей з'являються на Hugging Face регулярно, і кожна нова ітерація робить це акуратніше.
Чому це цікаво
Цей реліз — не про те, що тепер усі отримають «безобережну» модель у один клік: ваги на 510 ГБ ніхто вдома не запустить. Цінність у іншому. По-перше, це продовжує серію експериментів, які показують: відмова не розмазана по всій моделі тонким шаром, а сидить у конкретних вагах, які можна знайти й перезаписати. По-друге, дані авторів підтверджують несподівану річ: чим більше модель «думає» перед відповіддю, тим охочіше вона відмовляється — тобто міркування і обережність в цих моделях тісно пов'язані. І по-третє, етичне питання стає інженерним: коли «вимкнути обережність» — це перезапис кількох вагів, дебати про те, чи можливо це взагалі, втрачають сенс. Залишається питання, хто і за яких правил це робить.
- 1DeepSeek-V4.1-Flash-UNCENSORED-FP8 — картка моделі на Hugging Face — huggingface.co, вересень 2026
- 2Офіційний DeepSeek-V4.1-Flash від deepseek-ai (базова модель) — huggingface.co, вересень 2026
- 3OpenRouter — доступні моделі DeepSeek — openrouter.ai, вересень 2026
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.




Коментарі 0