Ling 3.0 Flash VL: 124B MoE, який бачить — і безкоштовний на OpenRouter

InclusionAI Ling 3.0 Flash VL: мультимодальний MoE 124B, зображення й відео на вході, 256K контекст, MIT.

Китайська InclusionAI (більше відома як команда за Ant Group) випустила Ling 3.0 Flash VL — мультимодальну версію свого ефективного 124-мільярдного MoE. Головна новина не в бенчмарках, а у двох словах: нативне зрение та безкоштовний доступ.

Що це таке

Ling 3.0 Flash VL будується на Ling 3.0 Flash — моделі з 124B параметрів загалом, з яких активні лише ~5.5B на токен. Це класична розріджена архітектура Mixture-of-Experts: модель велика «в резерві», але працює як компактна — дешево і швидко. VL-версія додає до тексту нативне сприйняття зображень і відео: не «прикручений зір», а зорову інформацію, вбудовану в повний цикл — розуміння, міркування, дії та перевірку.

  • Модальність: текст + зображення + відео → текст.
  • Контекст: до 256K токенів (262 144 на OpenRouter).
  • Ліцензія: MIT — можна брати в продукцію без переговорів із юристами.
  • Ціна: 0$ за ендпоінт :free на OpenRouter (провайдер Novita, BF16).

Що всередині

Архітектура — цікавіша за більшість релізних постів. Чотири рішення варті уваги:

  • ViT-енкодер + двошаровий MLP-проєктор — класична, але перевірена схема узгодження візуальних ознак із текстовим простором.
  • VideoRoPE — ротарні позиційні ембедінги, що кодують простір і час одночасно. Саме завдяки їм модель локалізує події в довгому відео й відповідає на відео-питання.
  • 42-шаровий гібридний бекбон — чергування KDA та Gated MLA-шарів у співвідношенні 5:1 для ефективного довгого контексту.
  • Розріджений MoE — 124B усього, 5.5B активні: вартість інференсу ближча до моделі класу 7B, а не 124B.

Що вміє

Команда описує три площини: розуміти (складні макети, графіки, документи, лічба об'єктів), міркувати (мультикрокові розрахунки з візуальними доказами) і діяти (розуміння веб- та софтверних інтерфейсів із переведенням у послідовності дій — тобто клас use case «комп'ютерний агент»).

На Artificial Analysis Intelligence Index v4.1.1 модель отримала 42 бали проти 38 у текстової Ling 3.0 Flash — тобто додавання зору підняло загальну інтелектуальну оцінку на 4 пункти. Think-mode увімкнений за замовчуванням (temperature 0.6, top_p 0.95, top_k 20).

Дешевий MoE із зором і безкоштовним ендпоінтом — саме так виглядає уніфікація витягу з PDF, скріншотів і відео в одному виклику.

Як спробувати

Найшвидший шлях — OpenRouter: модель inclusionai/ling-3.0-flash-vl:free, безкоштовно, контекст 262K, до 32K токенів на відповідь. Підтримуються tools/tool_choice, reasoning-параметри, seed і logprobs — тобто модель одразу придатна для агентних конвеєрів, а не лише для чату. Якщо хочете розгорнути самостійно — ваги на Hugging Face (inclusionAI/Ling-3.0-flash-VL), є готові конфігурації для SGLang у BF16/FP8.

  • Модель виберу туди, де вхід — документи та скріншоти, а бюджет обмежений.
  • Для україномовних задач варто тестувати самостійно: у рейтингу не буде українських бенчмарків.
  • Відео-вхід робить її кандидатом на задачі конвертації записів зустрічей у структуру.
Матеріал із рубрики «Моделі та релізи»LLMOpen source AIМультимодальність
Поділитися статтею
TelegramXLinkedIn

Читати далі