Модель на 125 миллиардов параметров кажется невозможной для одной потребительской видеокарты. Но связка «квантизация + offload» позволяет запустить её на RTX 4090 и вплотную подойти к 100 токенам в секунду.
Размер весов считается просто: число параметров умножается на число байт на параметр. Для 125B это даёт ориентиры, которые полезно держать в голове до скачивания файлов.
| Точность | Байт на параметр | Примерный размер весов для 125B |
|---|---|---|
| FP16 / BF16 | 2 | ~250 ГБ |
| 8 бит | 1 | ~125 ГБ |
| 6 бит | 0,75 | ~94 ГБ |
| 4 бита | 0,5 | ~62 ГБ |
| 2 бита | 0,25 | ~31 ГБ |
К весам добавляются служебные расходы: KV-кэш контекста, активации, буферы рантайма. Чем длиннее контекст и чем больше одновременных запросов, тем выше эти расходы.
Если вы только начинаете, сначала стоит разобраться с базовым запуском моделей и с тем, какие ИИ-модели имеют открытые веса и как их запустить бесплатно — список открытых весов как раз снимает вопрос «а законно ли и где брать файлы».
Квантизация уменьшает число бит на каждый вес. Чем меньше бит, тем меньше файл и тем ниже требования к памяти. Плата за это — потеря качества: модель начинает чаще ошибаться на сложных рассуждениях, коде и математике.
На