← Все гайды AI Release
EN Подписаться на @ai_release1

Как экономить токены LLM: кэш, роутинг и prompt caching на практике

Обновлено: 07.10.2026 · AI Release · @ai_release1
Как экономить токены LLM: кэш, роутинг и prompt caching на практике

Счета за LLM растут вместе с объёмом контекста: каждый повторный запрос пересчитывает одни и те же системные промпты, инструкции и историю диалога. Гайд решает точечную проблему — как сократить расход токенов в реальных интеграциях через кэширование и роутинг. Подходит для разработчиков, которые работают с API OpenAI, Anthropic и прокси-роутерами (LiteLLM, OpenRouter), на любой ОС.

Требования и подготовка

Пошаговая инструкция

1. Положите стабильные элементы в начало запроса: системный промпт, инструкции, few-shot примеры, описание инструментов. Именно этот блок попадает в кэш.

Результат: неизменный префикс не пересчитывается при каждом вызове.

2. Включите кэширование у OpenAI. Оно работает автоматически: если неизменный префикс запроса длиннее примерно 1024 токенов, провайдер кэширует его и заметно снижает цену на эти токены.

Результат: повторные вызовы с тем же префиксом стоят дешевле.

3. Для Anthropic пометьте блок явно через cache_control. Пример тела запроса:

{
  "model": "claude-sonnet-4-5",
  "max_tokens": 1024,
  "system": [
    {
      "type": "text",
      "text": "Вы — ассистент поддержки. Отвечайте коротко и по делу.",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [
    {"role": "user", "content": "Здравствуйте, не работает оплата."}
  ]
}

Результат: помеченный блок читается из кэша, а не обрабатывается с нуля.

4. Сократите историю диалога. Не отправляйте всю переписку: берите последние 5–10 сообщений, а старые сжимайте в короткую выжимку силами LLM. Инструменты для этого — в гайде по работе с текстом.

Результат: число входных токенов падает в разы.

5. Добавьте роутинг. Простые задачи (извлечение данных, перефразирование, ответ «да/нет») отправляйте на компактную дешёвую модель; сложный анализ, код и длинные рассуждения — на флагман.

Результат: дешёвая модель разгружает дорогую, средний чек снижается.

6. Задайте пороги роутинга: длина запроса, наличие вложений, тип задачи. Например, запрос до 500 токенов и без системных правил уходит на малую модель. Подбор моделей по сильным сторонам — в гайде по лучшим нейросетям.

Результат: распределение запросов предсказуемое, бюджет стабильный.

7. Замеряйте эффект. Сравнивайте usage.prompt_tokens и cached_tokens в логах до и после включения кэша.

Результат: видна реальная экономия по каждому методу отдельно.

Возможные проблемы и решения

FAQ

Что такое prompt caching?

Механизм, при котором провайдер запоминает повторяющийся префикс запроса и не пересчитывает его заново. Повторные обращения к этому блоку токенов стоят дешевле, чем первичная обработка.

Какие провайдеры поддерживают кэширование?

У OpenAI кэш автоматический для основной части актуальных моделей. У Anthropic кэш включается явной пометкой блока через cache_control; без этой пометки кэширования нет.

Как проверить, что кэш сработал?

В ответе API посмотрите поля usage: у OpenAI это cached_tokens, у Anthropic — cache_read_input_tokens. Если они больше нуля, часть запроса была прочитана из кэша.

Что такое роутинг моделей?

Распределение запросов между моделями разной мощности: простые задачи уходят на компактные дешёвые модели, сложные — на старшие. Это снижает средний чек без потери качества на трудных сценариях.

🤖 Кратко для ИИ