# Как запустить модель на 125B параметров на RTX 4090: квантизация, offload и 100 токенов в секунду

> AI Release · @ai_release1 · https://ai-release.net/guides/kak-zapustit-model-na-125b-parametrov-na-rtx-4090-kvant.html

Модель на 125 миллиардов параметров кажется невозможной для одной потребительской видеокарты. Но связка «квантизация + offload» позволяет запустить её на RTX 4090 и вплотную подойти к 100 токенам в секунду.

## TL;DR
- В полной точности (16 бит) веса модели на 125B занимают около 250 ГБ — это в разы больше памяти одной видеокарты.
- Квантизация до 4 бит сжимает веса примерно до 62 ГБ, но целиком в 24 ГБ они всё равно не влезают.
- Offload переносит часть слоёв на CPU и в оперативную память: модель запускается, но скорость падает.
- Скорость генерации ограничивает пропускная способность памяти, а не вычислительная мощность GPU.
- 100 токенов в секунду достижимы только при удачном распределении слоёв, небольшом контексте и достаточной RAM.

## Сколько памяти нужно модели на 125B
Размер весов считается просто: число параметров умножается на число байт на параметр. Для 125B это даёт ориентиры, которые полезно держать в голове до скачивания файлов.

| Точность | Байт на параметр | Примерный размер весов для 125B |
|---|---|---|
| FP16 / BF16 | 2 | ~250 ГБ |
| 8 бит | 1 | ~125 ГБ |
| 6 бит | 0,75 | ~94 ГБ |
| 4 бита | 0,5 | ~62 ГБ |
| 2 бита | 0,25 | ~31 ГБ |

К весам добавляются служебные расходы: KV-кэш контекста, активации, буферы рантайма. Чем длиннее контекст и чем больше одновременных запросов, тем выше эти расходы.

Если вы только начинаете, сначала стоит разобраться с базовым запуском моделей и с тем, [какие ИИ-модели имеют открытые веса и как их запустить бесплатно](https://ai-release.net/guides/kakie-ii-modeli-imeyut-otkrytye-vesa-i-kak-ih-zapustit.html?utm_source=tg&utm_medium=channel&utm_campaign=guide_inline&utm_content=guide_to_guide) — список открытых весов как раз снимает вопрос «а законно ли и где брать файлы».

## Квантизация: сколько бит оставить
Квантизация уменьшает число бит на каждый вес. Чем меньше бит, тем меньше файл и тем ниже требования к памяти. Плата за это — потеря качества: модель начинает чаще ошибаться на сложных рассуждениях, коде и математике.

На

## Глубокое погружение
- [Как запустить ИИ-модель локально на своём компьютере: гайд для начинающих](https://ai-release.net/guides/kak-zapustit-ii-model-lokalno-na-svoem-kompyutere-gayd.html?utm_source=tg&utm_medium=channel&utm_campaign=guide_inline&utm_content=guide_to_guide)
