Що реально тягне ноутбук без дискретної GPU

Запускати локальні моделі можна і без відеокарти — якщо розуміти, куди йде памʼять і чому швидкість визначає не процесор. Чесний гайд без магічних обіцянок.

Гарна новина: для купи реальних задач дискретна GPU не потрібна. Погана: інтернет переповнений обіцянками від людей, які запускати нічого не запускали. Ось рамка, яка допоможе не помилитися ще до завантаження вагів.

Головне правило — памʼять

Локальна модель має повністю вміститися в памʼять, де її будуть рахувати (VRAM, а без GPU — звичайна RAM). Орієнтир простий: файл вагів ≈ скільки памʼяті треба. 7–8B модель у 4-бітній квантизації — це файл на ~4–5 ГБ, отже живе на будь-якому ноутбуці з 16 ГБ RAM. А от 70B навіть у 4 бітах — це ~40 ГБ: на ноутбуці ніяк.

Нюанс з MoE: «124B загалом, 5B активних» звучить дешево, але у памʼяті мають лежати всі ваги — активні лише під час рахунку. Тому величезні MoE-моделі — не варіант для ноутбука, навіть якщо їхній інференс «дешевий».

Які моделі брати

  • 7–9B dense у Q4/Q5 — робоча зона для 16 ГБ RAM: переклад, чернетки, резюме документів, базовий код.
  • Менші 3–4B — якщо RAM 8 ГБ або треба довгий контекст.
  • Контекст — окрема стаття витрат: KV-кеш росте з довжиною розмови, тож «128K контексту» на ноутбуці — це запрошення до swap.

Швидкість і чому вона мала

Генерація тексту обмежена пропускною здатністю памʼяті: на кожен токен треба прочитати ваги. Тому на звичайній RAM рахунок іде одиницями-десятками токенів за секунду — для чату нормально, для масової обробки вже ні. CPU тут майже ні при чому: вузьке місце — канал між памʼяттю й обчисленнями.

Реальні сценарії

Практичний стек: Ollama або LM Studio + моделі у GGUF-квантизації. Що реально працює на ноутбуці: робота з документами (витяг, резюме), переклад, чернетки листів, перефразування, базові скрипти. Що не варто чекати: складні агенти з довгими ланцюжками, найсвіжіші знання, стабільна якість української на рівні великих моделей — для цього бери API.

  • Рахуй RAM до завантаження: ваги + контекст + система.
  • Q4 — стартова точка; Q8 помітно точніша, але вдвічі голодніша до памʼяті.
  • Локально — для приватності й чернеток; фінальна якість — у хмарі.
Матеріал із рубрики «Локальні моделі»Open source AIЛокальні моделіЗалізо
Поділитися статтею
TelegramXLinkedIn

Читати далі