Токен дешевеет из года в год, а счета за инференс растут. Станислав Ежов, директор по развитию ИИ ПАО «Группа Астра», рассказывает о том, куда же уходит разница и что с этим делает архитектура.
Цена токена падает почти каждый квартал. В марте 2023 года миллион входных токенов GPT-4 стоил $30. К 2026 году стоимость инференса моделей с сопоставимым уровнем производительности опустилась примерно до $0,4 за миллион токенов. Мы видим падение на два порядка всего за три года. ИИ дешевеет, значит, и продукты на его основе становятся рентабельнее, но в то же время счета компаний за инференс растут.
По данным отраслевых обзоров 2026 года, за пару последних лет средний корпоративный бюджет на ИИ увеличился с 1,2 до 7 млн долларов. Объем использования, число запросов, длина цепочек, частота вызовов — все это выросло быстрее, чем снизилась стоимость единицы, и именно здесь теряется маржа. Цену токена считают исправно, но забывают учесть рост его потребления на одну и ту же бизнес-задачу.
Агентные цепочки съедают эту экономию первыми и заметнее всего. Раньше на задачу уходили один запрос и один ответ. Теперь агент разбирает запрос, планирует шаги, проверяет промежуточный результат, корректирует план, и каждый из этих этапов становится отдельным обращением к модели, и за любое из них мы платим. Модель подешевела, но итераций стало в разы больше, и это обычно сводит на нет профит от подешевевшего токена.
Рядом, причем с похожим по силе эффектом, расширяется контекст. Диалог или цепочка агентных действий живет дольше, чем один обмен репликами, и на каждом шаге ИИ приходится передавать всю историю заново. Контекст растет иногда даже быстрее, чем сам диалог, ведь к истории добавляются промежуточные результаты и уточнения.
Есть и более простые вещи, дающие меньший, но заметный эффект. Многие прогоняют весь трафик через одну мощную модель: так проще. В итоге для простой классификации письма задействуют ту же дорогую модель, что и для сложного юридического анализа, хотя тут справилась бы и дешевая. Кроме того, из-за SLA по скорости ответа для пиковой нагрузки приходится держать резерв вычислений. Он простаивает почти всегда, но платить за него нужно постоянно.
Где корень бед и как все исправить
Технически проще всего справиться с роутингом и провижинингом, с них обычно начинают и думают, что вопрос закрыт. Однако это ошибка, ведь основная утечка — агентные цепочки и контекст — остается нетронутой.
Дело не в невнимательности CFO. Экономику ИИ обычно считают на пилоте, то есть при одном профиле нагрузки, коротких цепочках, небольшом контексте, а когда продукт масштабируется и сценарии использования меняются, ничего не пересматривают. Метрики качества, точность и скорость ответа стоят в одной таблице, а стоимость на единицу результата — в другой, и никто не сводит их в общий отчет на регулярной основе. Пока эти две таблицы не встретились, рост счета выглядит как естественная плата за развитие бизнеса, и утечку, которую можно остановить, в этих цифрах никто не увидит.
Свести обе таблицы в одну — задача управленческая. Архитектура AI-native решает ее через владельца строки бюджета — продуктовую или FinOps-роль, которая отвечает за деньги, как инженер — за настройку модели. Начинают с главных причин утечки, даже если их устранить сложнее, чем остальные:
- Против агентных циклов задают лимит шагов на задачу и обязательный пересчет стоимости, если цепочка выходит за плановую длину.
- Чтобы не рос контекст, историю сжимают, а повторяющиеся фрагменты выносят в кэш — таким образом избавляются от их повторной передачи модели.
- Есть еще и второй слой — роутинг между дорогими и дешевыми моделями и провижининг под фактический профиль нагрузки вместо пикового. Его добавляют, когда главные причины уже под контролем. Как и у любой статьи расходов, здесь нужны порог и регулярный пересмотр — это условие входа для крупного бизнеса и КИИ, так как у них цена ошибки выше. Это работает и там, где ИИ-функция встроена в процесс и не создает отдельной строки выручки. Критерием в этом случае будет стоимость единицы работы до и после внедрения.
Правило, о котором важно помнить
Всегда стоит учитывать, что эффект от ИИ на единицу результата должен опережать рост счета за инференс за тот же период. В кейсах, что я оценивал, именно агентные цепочки и рост контекста обычно определяли, каким будет счет. Правило работает без оговорок, если эффект выражен в выручке или прямой экономии затрат.
Если же он связан с качеством, например, скоростью решения вопросов клиентов или их удержанием, за точку отсчета берут стоимость часа человека, который раньше все делал вручную, и от нее считают экономию. Если условие не выполняется, сценарий замораживают или пересобирают. Масштабировать его дальше, просто потому что пилот показал результат, — не вариант.
Рост мощности ИИ создает долг управляемости и безопасности, и компанию можно назвать AI-native, только если ее архитектура способна принять такую мощность без потери контроля. А эффективность токенов и вычислений — это доля мощности, реально конвертируемая в прибыль, а не тратящаяся впустую на циклы, контексты и резервы, которые никто не измерил.