Ми дали чотирьом моделям одну українську задачу. Вижила одна

GPT, Claude, Gemini і Llama проти реального документа з українською юридичною лексикою.

Українська мова досі коштує моделям дорожче за англійську: більше токенів, менше даних, більше вигаданих термінів. Ми перевірили, наскільки саме — на документі, який реально приносять юристу.

Умови тесту

Одна задача: витягти з 14-сторінкового договору сторони, суми, терміни й умови розірвання — і повернути структурований результат. Один і той самий промпт, нульова температура, без інструментів і без пошуку. Кожна модель отримала три спроби.

  • Вхід: договір українською, зі скороченнями та посиланнями на статті ЦК.
  • Оцінка: точність фактів, повнота, вигадані посилання, стабільність між спробами.
  • Що не оцінювали: стиль. Гарна проза тут нікого не рятує.
Три спроби на модель — скриншот результатів
Три спроби на модель. Червоне — вигадані посилання на статті.

Що зламалося

Найдорожча помилка виявилась не в цифрах, а в посиланнях: три з чотирьох моделей упевнено назвали статті, яких у договорі немає. Це та категорія помилок, яку неозброєним оком не видно — текст читається бездоганно.

Модель не помиляється голосно. Вона помиляється переконливо — і саме тому потрібен другий прохід.

Токени й ціна

Той самий текст українською обійшовся в середньому на 38% дорожче за англійський переклад — просто через токенізацію. На обсязі це різниця між пілотом і відмовою від проєкту.

Результати

Claude8.6
GPT8.1
Gemini7.4
Llama (local)5.9

Перемогла модель, яка частіше за інших відповідала «у документі цього немає». Відмова від відповіді тут — не слабкість, а функція.

Що з цим робити

Не шукайте одну модель на всі задачі. Робоча схема — дешева модель на витяг, дорога на перевірку, і жорстке правило: кожне посилання має цитату з документа. У наступному випуску розберемо, як зібрати такий двоступеневий пайплайн за вечір.

  • Вимагайте цитату під кожен факт — інакше не приймайте відповідь.
  • Рахуйте токени українською, а не за англійськими прайсами.
  • Тестуйте на своїх документах: чужий бенчмарк вашу задачу не бачив.
Матеріал із рубрики «Огляди й порівняння»LLMУкраїнська мова в AIДані та RAG
Поділитися статтею
TelegramXLinkedIn

Читати далі