← Все гайды AI Release
EN Подписаться на @ai_release1

Как запустить модель на 125B параметров на RTX 4090: квантизация, offload и 100 токенов в секунду

Обновлено: 05.10.2026 · AI Release · @ai_release1
Как запустить модель на 125B параметров на RTX 4090: квантизация, offload и 100 токенов в секунду

Модель на 125 миллиардов параметров кажется невозможной для одной потребительской видеокарты. Но связка «квантизация + offload» позволяет запустить её на RTX 4090 и вплотную подойти к 100 токенам в секунду.

TL;DR

Сколько памяти нужно модели на 125B

Размер весов считается просто: число параметров умножается на число байт на параметр. Для 125B это даёт ориентиры, которые полезно держать в голове до скачивания файлов.

ТочностьБайт на параметрПримерный размер весов для 125B
FP16 / BF162~250 ГБ
8 бит1~125 ГБ
6 бит0,75~94 ГБ
4 бита0,5~62 ГБ
2 бита0,25~31 ГБ

К весам добавляются служебные расходы: KV-кэш контекста, активации, буферы рантайма. Чем длиннее контекст и чем больше одновременных запросов, тем выше эти расходы.

Если вы только начинаете, сначала стоит разобраться с базовым запуском моделей и с тем, какие ИИ-модели имеют открытые веса и как их запустить бесплатно — список открытых весов как раз снимает вопрос «а законно ли и где брать файлы».

Квантизация: сколько бит оставить

Квантизация уменьшает число бит на каждый вес. Чем меньше бит, тем меньше файл и тем ниже требования к памяти. Плата за это — потеря качества: модель начинает чаще ошибаться на сложных рассуждениях, коде и математике.

На

Глубокое погружение