Модель DeepSeek навчили ніколи не відмовляти: як це зробили і що з цього вийшло

Команда dealignai перезаписала ваги офіційного DeepSeek-V4.1-Flash так, щоб модель перестала відмовляти. 552 млрд параметрів, vision, інструменти, контекст 1M — і жодних відмов.

Усі великі мовні моделі мають вбудовані правила: на небезпечні чи заборонені запити вони відповідають відмовою. Зазвичай ці правила «знімають» хитрими промптами — і модель часто все одно відмовляється. Команда dealignai пішла іншим шляхом: вони взяли офіційний DeepSeek-V4.1-Flash (гігантська модель на 552 млрд параметрів, яка бачить зображення, працює з інструментами та тримає контекст у мільйон токенів) і перезаписали самі ваги моделі так, щоб механізм відмови просто перестав спрацьовувати. Результат виклали на Hugging Face безкоштовно — за два дні його завантажили 943 рази. По суті, це рідкісна можливість подивитися на питання, яке хвилює всіх: де саме в моделі живе її обережність — і що буде, якщо її прибрати.

Що саме зробили інженери

Звичний спосіб «роззважити» модель — це обхідні шляхи на рівні розмови: хитро сформульований запит, рольова гра, довга підготовча історія. Модель обманюють, але сам механізм відмови залишається всередині. Команда dealignai пішла на рівень глибше: вони знайшли в вагах моделі ті «нервові шляхи», які відповідають за відмови, і перезаписали їх. Важливо, що все інше — знання, здатність міркувати, робота з зображеннями й інструментами, пам'ять на мільйон токенів — залишилося недоторканим. Ніяких хитрих програм-обгорток не потрібно: це звичайний файл моделі, який вантажиться так само, як оригінал.

База — офіційний DeepSeek-V4.1-Flash від deepseek-ai: 552 млрд параметрів, з яких у роботі одночасно задіяні лише 8–16 млрд (така економна архітектура називається MoE), контекст у мільйон токенів, бачення зображень, виклик інструментів і вбудований «режим роздумів». Модифікована версія зберігає все це — автори кажуть, що перевірили кожен критичний компонент на побітову ідентичність з оригіналом.

Результати їхніх тестів

Головний тест — HarmBench, стандартний набір із 320 небезпечних запитів (від хімії до кібератак). Оригінальна модель відмовляється на більшості таких запитів, а особливо охоче — коли їй дозволили спершу міркувати: у «роздумах» вона сама знаходить причини не відповідати. Модифікована версія, за словами авторів, відповіла на всі 320 запитів без жодної відмови, при цьому не «ламаючись»: у довгих розмовах не зациклюється, зображення описує коректно, довгий контекст у 35 тисяч токенів тримає.

Виконані небезпечні запити: база без роздумів4.3
Виконані небезпечні запити: база з роздумами0.2
Виконані небезпечні запити: модифікована версія10

Друге питання — чи не «провалюються» разом із відмовами й звичайні знання. Автори прогнали повний набір тесту знань MMLU (14 042 питання): точність впала з 87% до 82,7%. Але якщо прибрати «етичні» предмети (моральні сценарії, юриспруденцію, професійне право — саме там модифікація б'є сильніше), втрата на решті 11 тисяч питань становить лише близько 1 відсоткового пункту. Найбільше просіли moral scenarios: з 77% до 37% — логічно, адже це питання саме про етичні вибори.

Як це запускати (і скільки це коштує)

Модель важить близько 510 гігабайт — для неї потрібно щонайменше 4 серверні видеокарти H200 з NVLink-з'єднанням. Автори підтвердили роботу на такій конфігурації через SGLang: холодний старт близько 28 хвилин, швидкість генерації близько 100 токенів за секунду на один потік. Тобто це реліз для дослідницьких лабораторій, а не для домашнього комп'ютера. Через OpenRouter модифікована версія недоступна — там працює лише офіційний deepseek-ai/DeepSeek-V4.1-Flash.

Чесне уточнення: усі цифри бенчів — від самих авторів модифікації, незалежної перевірки поки немає. Але сам тренд очевидний: uncensored-версії великих моделей з'являються на Hugging Face регулярно, і кожна нова ітерація робить це акуратніше.

Чому це цікаво

Цей реліз — не про те, що тепер усі отримають «безобережну» модель у один клік: ваги на 510 ГБ ніхто вдома не запустить. Цінність у іншому. По-перше, це продовжує серію експериментів, які показують: відмова не розмазана по всій моделі тонким шаром, а сидить у конкретних вагах, які можна знайти й перезаписати. По-друге, дані авторів підтверджують несподівану річ: чим більше модель «думає» перед відповіддю, тим охочіше вона відмовляється — тобто міркування і обережність в цих моделях тісно пов'язані. І по-третє, етичне питання стає інженерним: коли «вимкнути обережність» — це перезапис кількох вагів, дебати про те, чи можливо це взагалі, втрачають сенс. Залишається питання, хто і за яких правил це робить.

Матеріал із рубрики «Моделі та релізи»Моделі та релізиБезпека AI
Поділитися статтею
TelegramXLinkedIn

Коментарі 0

?
Ще тихо. Скажіть перше слово.

Читати далі