PrismML розробляє технологію стиснення ШІ

PrismML розробляє технологію стиснення ШІ

Стартап PrismML розробляє технологію стиснення великих мовних моделей, яка може зробити запуск потужного ШІ на ПК та смартфонах значно реальнішим. Компанія вже залучила $22,25 млн початкового фінансування і представила нову модель Bonsai 2 27B.

Модель Bonsai 2 та процедура стиснення

Її основу становить Qwen3.8 27B від компанії Alibaba, але після стиснення модель займає лише 5,9 ГБ. Це приблизно у 9–10 разів менше за оригінальну версію. Такий обсяг уже дозволяє запускати систему на звичайному комп’ютері, а потенційно й на потужному смартфоні.

PrismML стверджує, що її підхід дозволяє значно зменшити розмір моделі без істотного падіння результатів. Bonsai 2 набирає близько 98% від сукупного результату оригінальної Qwen у бенчмарках. Для першої версії Bonsai цей показник становив 95%. ЇЇ випустили у березні та завантажили понад 11 млн разів. 

Технологія стиснення працює через зміну способу зберігання ваг моделі. Замість звичних 16 бітів PrismML використовує так звані тернарні ваги, які можуть мати лише три значення: +1, -1 або 0. Це суттєво скорочує обсяг даних, необхідних для роботи моделі.

Повністю зберегти продуктивність оригіналу таким способом, найімовірніше, неможливо. Водночас різниця у 2% на бенчмарках не обов’язково означає таку саму втрату якості під час реального використання.

PrismML планує застосувати свою технологію до значно більших моделей. Протягом найближчих місяців компанія розраховує випустити системи з кількома сотнями мільярдів параметрів. На думку розробників, великі моделі можуть виявитися навіть зручнішими для стиснення без істотної втрати можливостей. Якщо цей підхід справді працюватиме у такому масштабі, частина обчислень, які сьогодні виконуються у хмарі, потенційно зможе переміститися безпосередньо на пристрої користувачів.