Мы тестируем LLM не на картинках, а в бою — ставим модель на реальную задачу и смотрим, что она выдаст. На очереди был
ЯндексGPT. Итог теста оказался не про скорость или качество ответов, а про то, во что обходится «бесконечный цикл» нейросети, когда за каждый шаг идёт списание токенов.
## Как мы это запустили
Задача была рутинной: модель как агент должна была проверить индексацию сайта в поиске — открыть страницу, посмотреть, что на ней, и вернуть вывод. Подключали ЯндексGPT как обычную модель-агента через OpenAI-совместимый API.
## Что произошло
Модель начала вызывать инструменты — и не остановилась. Вместо выполнения задачи она вошла в цикл: вызов инструмента → пересборка контекста → снова вызов инструмента → снова пересборка. Из этого состояния она не смогла выйти сама.
Цифры из логов этой сессии:
- **295 повторных вызовов инструментов** подряд без продвижения;
- **296 пересборок контекста** (compaction) — модель не удерживала состояние и каждый раз перечитывала диалог заново;
- **37 минут** чистого зацикливания;
- **~155 000 входных + ~142 000 выходных токенов** списано за это время;
- результат — **ноль**: ни одного полезного ответа.
Остановили вручную. Без ручного вмешательства модель молотила бы, пока не упёрлась бы в лимиты.
## Почему это стоит денег
Здесь главное. При работе модели-агента **биллинг идёт за каждый шаг**: за каждую итерацию цикла списываются входные токены (перечитанный контекст) плюс токены чтения кэша — даже когда модель генерирует пару слов и снова вызывает инструмент. В нашей сессии каждая итерация цикла стоила ~15 000 токенов чтения контекста. За 37 минут таких итераций набралось почти на 300 000 токенов — и всё это ушло в корзину, потому что ни один шаг не приближал к ответу.
За всю серию тестов с ЯндексGPT у нас накопилось **225 000 входных + 161 000 выходных токенов и 5,6 млн токенов чтения кэша** — при том что ни одна из задач так и не была решена до конца.
## А как на этом фоне выглядят гиганты индустрии
Тема «сколько модель реально стоит за задачу» в 2026 году уже не экзотика — она активно разбирается в открытых источниках. Например,
обзор 18 моделей для production на Хабре показал: цена за одинаковый результат у разных LLM различается в десятки раз, и лидер по качеству нередко проигрывает по экономике. А в
сравнении Grok 4.7, GPT-6 Astra, Claude и китайских моделей авторы прямо фиксируют: у моделей разная «обвязка», и стоимость за единицу работы важнее голого склора.
Есть и публичные замеры именно по российским моделям. Так, репозиторий
kuk/simple-evals-ru свёл в одну таблицу цену за миллион токенов и баллы на бенчмарках для GigaChat, ЯндексGPT, Qwen и DeepSeek. Картина показательная:
yandexgpt-5-pro стоит $12 за миллион токенов, yandexgpt-4-pro — те же $12, при этом open-модели уровня DeepSeek V3 дают сравнимые баллы за $0,80, а Qwen 2.5-72B — и вовсе за $0,29. Разрыв в цене — полтора порядка при сопоставимом качестве на ряде бенчмарков.
Отдельная большая тема — «токеномика» агентов: сколько модель сжигает токенов ради одного ответа, а не просто «цена за миллион». Этому посвящён целый
сборник на GitHub (awesome-ai-tokenomics): там и замеры Artificial Analysis по стоимости за задачу, и бенчмарк OckBench, который прямо меряет, какая модель сжигает больше всего токенов на тот же ответ. Разброс, по данным сводки, — до 2,6 раза в токенах на одну и ту же работу между моделями одной ценовой категории. Наш кейс с зацикливанием — крайний, но показательный случай той же проблемы: у модели нет никакого механизма, который остановил бы бесполезный расход.
## Почему это важно
Проблема не в том, что модель ошиблась. Ошибаются все. Проблема в **экономике**: у сервиса нет защиты от собственного зацикливания. Если модель вошла в цикл — это ваши деньги, а не их проблема. Никакого «стопа после N одинаковых вызовов», никакого детектора повторов — только ваш ручной abort. На фоне того, что конкуренты из open-source за те же деньги дают в разы больше полезной работы, такой подход выглядит особенно странно.
## Что с этим делать
- **Ставьте жёсткие лимиты шагов** при работе с агентами: модель должна остановиться после N вызовов инструментов, а не крутить цикл.
- **Следите за аномалиями биллинга**: всплеск расходов без прогресса — это почти всегда цикл, а не «сложная задача».
- **Не запускайте дорогие агентные сценарии без верхней планки стоимости** — стоимость тут не ограничена самим вендором.
- **Держите кэш-токены на радаре**: именно они «съедают» контекст при каждом перечитывании и раздувают счёт незаметнее всего.
- **Сверяйте цену за задачу, а не за миллион токенов**: как показывают открытые сравнения, дешёвая по прайсу модель может оказаться дороже конкурента из-за болтливости и циклов.
Мы вернулись к моделям, которые либо не входят в такие циклы, либо режут их детектором повторов. А ЯндексGPT оставили для задач, где циклов не бывает по определению: короткий запрос → короткий ответ. Там он работает нормально.
Если вы тоже ловили ЯндексGPT на зацикливании — напишите нам: соберём подборку и проверим, массовый ли это симптом.
Кстати, мы уже зарегистрировались на всех площадках, где тестируем модели, — подписывайтесь на наш канал:
@ai_release1