Що реально тягне ноутбук без дискретної GPU
Запускати локальні моделі можна і без відеокарти — якщо розуміти, куди йде памʼять і чому швидкість визначає не процесор. Чесний гайд без магічних обіцянок.

Гарна новина: для купи реальних задач дискретна GPU не потрібна. Погана: інтернет переповнений обіцянками від людей, які запускати нічого не запускали. Ось рамка, яка допоможе не помилитися ще до завантаження вагів.
Головне правило — памʼять
Локальна модель має повністю вміститися в памʼять, де її будуть рахувати (VRAM, а без GPU — звичайна RAM). Орієнтир простий: файл вагів ≈ скільки памʼяті треба. 7–8B модель у 4-бітній квантизації — це файл на ~4–5 ГБ, отже живе на будь-якому ноутбуці з 16 ГБ RAM. А от 70B навіть у 4 бітах — це ~40 ГБ: на ноутбуці ніяк.
Нюанс з MoE: «124B загалом, 5B активних» звучить дешево, але у памʼяті мають лежати всі ваги — активні лише під час рахунку. Тому величезні MoE-моделі — не варіант для ноутбука, навіть якщо їхній інференс «дешевий».
Які моделі брати
- 7–9B dense у Q4/Q5 — робоча зона для 16 ГБ RAM: переклад, чернетки, резюме документів, базовий код.
- Менші 3–4B — якщо RAM 8 ГБ або треба довгий контекст.
- Контекст — окрема стаття витрат: KV-кеш росте з довжиною розмови, тож «128K контексту» на ноутбуці — це запрошення до swap.
Швидкість і чому вона мала
Генерація тексту обмежена пропускною здатністю памʼяті: на кожен токен треба прочитати ваги. Тому на звичайній RAM рахунок іде одиницями-десятками токенів за секунду — для чату нормально, для масової обробки вже ні. CPU тут майже ні при чому: вузьке місце — канал між памʼяттю й обчисленнями.
Реальні сценарії
Практичний стек: Ollama або LM Studio + моделі у GGUF-квантизації. Що реально працює на ноутбуці: робота з документами (витяг, резюме), переклад, чернетки листів, перефразування, базові скрипти. Що не варто чекати: складні агенти з довгими ланцюжками, найсвіжіші знання, стабільна якість української на рівні великих моделей — для цього бери API.
- Рахуй RAM до завантаження: ваги + контекст + система.
- Q4 — стартова точка; Q8 помітно точніша, але вдвічі голодніша до памʼяті.
- Локально — для приватності й чернеток; фінальна якість — у хмарі.
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.



