Edge0: відкритий фреймворк запускає 35-мільярдну MoE-модель з ~3 ГБ памʼяті на споживчому залізі

Анонс від Samuel Zeng: стрімінгова MoE-інференція з offload експертів на SSD і prerouter-передбаченням маршрутизації. Дві преєрелейні моделі (8B і 35B) вже на Hugging Face під Apache 2.0. За словами автора — демо прямо на iPhone.

Стаття про свіжий авторський анонс: незалежних бенчмарків і тестів сторонніх ще немає, тож цифри наводимо з відкритого коду, README-документації та слів автора.

Samuel Zeng (засновник edge0.ai, MIT TR35) анонсував відкритий фреймворк Edge0 — систему для запуску великих мовних моделей повністю на пристрої, без хмари, серверів і GPU настільного ПК. Проєкт із самого старту open-source: runtime, inference-код і дві моделі (8B і 35B preview) вже доступні — GitHub (Edge0-AI/Edge0) і Hugging Face. У треді автор показує демо — генерацію ігор, 3D-сцен і веб-інтерфейсів прямо на пристрої, і, за його словами, 35B-модель працює навіть на iPhone з піковим споживанням памʼяті 1–2,5 ГБ.

Що сталося

Edge0 — це стрімінгова MoE-інференція. Ідея проста й елегантна: у MoE-моделі (mixture of experts) на кожен токен активна лише мала частина «експертів», але зазвичай усі експерти мають жити в памʼяті. Edge0 виносить ваги експертів на диск (SSD), mmapping-ить їх і читає в міру потреби. У результаті пікова памʼять обмежена активним набором, а не кількістю параметрів — 35-мільярдна модель на 4 бітах (≈23 ГБ на диску) вміщується в ~3 ГБ активної памʼяті.

Як це працює

  • SSD expert offload: ваги експертів стрімляться зі сховища на запит; у RAM тримається лише активний набір.
  • Prerouter: натренована головка передбачає маршрутизацію експертів на крок уперед — завантаження експертів перекривається з forward-пасом замість стагнації. У README це оцінюється до +59 % decode throughput, виграш росте разом із затримкою сховища та шириною маршрутизації K.
  • Recover-LoRA: int4-база заморожена, LoRA-адаптери треновані дистиляцією з FP-вчителя — так відновлюється якість після квантизації; адаптери йде в комплекті з чекпойнтом і не зливаються з базою.
  • Бекенд-ізоляція: поточний бекенд — MLX (Apple Silicon M1–M4); CUDA у дорожній карті, нові платформи підключаються через той самий фасад без змін ядра. Тобто зараз це macOS/iPhone-сторона Apple-екосистеми — Windows/Linux з NVIDIA очікуються пізніше.
  • transformers-стиль: AutoModel/AutoConfig/AutoEngine самі розрізняють тір моделі; edge0 serve запускає натренований пайплайн «з коробки».

Моделі: 8B і 35B preview

  • Edge0-35B-A3B-preview — 4-біт, 40 шарів, 256 експертів, prerouter K=4; пікова активна памʼять ~2,9 ГБ (короткі контексти), чекпойнт ~23 ГБ на диску. База — відкрита sparse-MoE модель Qwen3.5-MoE 35B-A3B.
  • Edge0-8B-A1B-preview — 4-біт, 24 шари, 128 експертів, prerouter K=8; ~1,0 ГБ піку, чекпойнт ~4,2 ГБ. База — гібридна модель Ling 3.0 (bailing).
  • Обидві — під Apache 2.0, із LoRA-адаптерами й prerouter-головками в одному каталозі з базою.

Цифри памʼяті в README — для коротких контекстів: із зростанням KV-кешу на довгих розмовах споживання зростає, тож «1–3 ГБ» — це профіль інференсу, а не скринька «35B завжди в 2 ГБ».

Що з цим робити

  • Якщо у вас Mac на Apple Silicon — найпростіший спосіб спробувати: Python 3.10+, edge0 serve з преєрелейним чекпойнтом; для 8B вистачить навіть 4 ГБ диску.
  • Для розробників агентів — локальна інференція з приватністю за замовчуванням і нульовою оплатою за токен: edge0.ai позиціонує лінійку для телефонів, ноутбуків, ПК і роботів.
  • Кому замало: бекенд поки MLX-only (CUDA в roadmap), цифри — від автора без незалежних відтворень, а компроміс стрімінгу з SSD — чутливість до швидкості сховища: на повільних дисках вигоду від prerouter доведеться перевіряти самостійно.

Головна теза Edge0: кількість параметрів ≠ обсяг RAM. Якщо активний набір експертів маленький, решту можна тримати на диску — і тоді «35B на телефоні» перестає звучати як фантастика й стає питанням інженерії швидкодії стрімінгу.

Джерела: Edge0-AI/Edge0 на GitHub (README, Apache 2.0), Edge0-35B-A3B-preview на Hugging Face, Edge0-8B-A1B-preview на Hugging Face, edge0.ai (демо iPhone і деталі тиру памʼяті — за описом автора у треді).

Матеріал із рубрики «Локальні моделі»Edge0On-device AIMoEЛокальні моделіOpen-source
Поділитися статтею
TelegramXLinkedIn

Читати далі