Стоимость вычислений в ИИ падает из года в год, создавая иллюзию дешевизны агентских решений. Однако их реальная себестоимость включает не только цену подписки, но и затраты на контроль, интеграцию и исправление ошибок. В этой статье мы разберем, как правильно рассчитать unit-экономику ИИ-агентов до их масштабирования и когда автономия приносит прибыль, а когда — чистый убыток. Станислав Ежов, директор по развитию ИИ ПАО «Группа Астра», рассмотрит unit-экономику автономии.
Почему дешевый токен не делает дешевым бизнес-решение и как считать стоимость действия агента до масштабирования
На одном из пилотов, в разработке ПО для крупной организации, где команда состояла из полутора сотен инженеров, мы считали экономию от ИИ-инструментов по каждому сценарию отдельно. Разброс между пессимистичным и оптимистичным вариантами составил десятки миллионов рублей в год при одном и том же штате. В итоге мы решили масштабировать агента только для рутинных, хорошо специфицированных задач, а для legacy-кода и нестандартных случаев сознательно ограничили его автономию, чтобы от роста числа переделок не страдала скорость. Эта разница и есть главный урок: цена агента определяется не подпиской на модель, а тем, как вокруг этой модели устроен процесс.
Многие обсуждают ИИ-агентов, отталкиваясь до демонстраций и стоимости миллиона токенов. Инференс дешевеет из года в год, и это создает иллюзию, что автономия становится дешевле вместе с ним. На практике счет за агентное решение формируют совсем другие статьи расходов, и здесь начинается уже не техническая, а управленческая история.
Компания платит за завершенное действие: обработанную заявку, исправленный дефект, согласованный документ, изменение в рабочей системе и т. д. У каждого действия есть полная себестоимость, и в ней цена самого вычисления – совсем не главная строка. Вместе с ней придется учитывать еще много всего:
- подготовку контекста и данных, на базе которых агент принимает решение;
- интеграции с системами, куда он получает доступ;
- контроль — права, журналирование и ограничение опасных операций;
- проверку результата человеком там, где ошибка стоит дорого;
- затраты на исправления, если агент сделал не то, что нужно;
- отдельной строкой идет цена риска: штрафы, инциденты, ответственность конкретного руководителя за конкретное решение.
Рост мощности агента увеличивает каждую из этих статей нелинейно.
Долг управляемости: во что обходится слепое доверие к генерации
Модель, которая раньше только советовала, теперь совершает действия в реальной инфраструктуре. Она пишет в базу, отправляет письма клиентам, запускает обновления систем. Расширение полномочий без встроенного контроля превращается в долг управляемости. Он копится незаметно, а осознание приходит при первом серьезном инциденте. Мы привыкли измерять скорость генерации, но редко считаем, во что обходится доверие к ее результату.
Скорость и экономический эффект — величины разного порядка, и их подмена — типичная ошибка пилотных проектов. Написание кода или обработки заявок идет быстрее, но это ничего не говорит о деньгах, особенно если становится все больше доработок, дублирования, эскалаций к человеку или отказов. Во время собственного проекта мы признавали, что получили ускорение, только при одном условии: переделки, дублирование и частота отказов не растут относительно исходных показателей. Без этого фильтра любой процент экономии хорош для презентации, но не становится управленческим выводом.
Где граница свободы? Экономика ассистентов против неуправляемого legacy
Три уровня автономии живут по разным экономическим правилам:
- Если ассистент только предлагает варианты, а решение принимает человек, то внедрение обходится дешево, и долг управляемости практически не создается. Цена ошибки здесь ограничена внимательностью того, кто утверждает результат.
- Когда агент работает в ограниченной среде с определенным набором действий, получится заметный профит, но понадобятся правила, аудит и понятные границы полномочий, иначе эффект от выигрыша в скорости может обнулиться из-за роста инцидентов.
- Агент, способный менять критичную систему самостоятельно – это совершенно другое. Цена контура безопасности и контроля здесь может превышать стоимость самого инференса, и без доверенной архитектуры масштабировать такое решение неразумно, каким бы выгодным оно ни казалось на демонстрации.
Показательный пример — работа с унаследованным кодом. Люди тратят в среднем около 58% времени на то, чтобы понять логику чужого кода, прежде чем внести изменение, — это известный отраслевой показатель, а не оценка «на глаз».
На задачах с четкими и повторяемыми правилами автоматизация дает измеряемую экономию, а в случаях со знакомым разработчику, но плохо документированным legacy-кодом независимые измерения фиксировали отрицательный эффект от применения ИИ-агента — до минус 19% от скорости, а не в плюс. Попытка сразу дать агенту полную свободу действий в такой задаче создает риск, а не экономию, и неважно, насколько уверенно ее вам обещает поставщик.
Инвестиционное решение о масштабировании стоит принимать явно не на основе процента ускорения из слайдов. Сначала лучше выбрать конкретный повторяемый сценарий с понятной текущей стоимостью, провести на нем пилот с параллельным контролем качества и риска и только затем считать эффект для всей команды или процесса. Один и тот же агент способен давать заметную экономию на рутинной задаче и одновременно отрицательный эффект там, где контекст непредсказуем. Оба результата реальны, и решение о масштабировании строится на объективных данных после пилота, а не на общем ощущении от инструмента.
Вычислительная мощность продолжит расти, а цена токена продолжит падать. Это не решает управленческую задачу само по себе. Вопрос, который я себе задаю перед каждым решением о масштабировании, звучит иначе: «Какая доля этой мощности доходит до прибыли, а какая тратится на переделки, ручные проверки и устранение последствий необдуманной автономии?». Если ответом на этот вопрос будут конкретные цифры, а не интуитивные предположения, значит, у вас действительно управляемое внедрение агентов, а не действия на эмоциях от красивой демонстрации.
