Сколько вы закладываете в бюджет на один осмысленный ответ автономной системы при нагрузке в тысячу RPS? Половина технических директоров, с которыми мне доводится общаться, берут открытый прайс-лист любимого провайдера, умножают цену тысячи токенов на среднюю длину генерации и с этой красивой линейной математикой идут защищать бюджет. Это фатальная ошибка, которая вскрывается в первую же неделю после релиза. Когда меня спрашивают, сколько стоит держать ИИ-агента в проде: полная экономика токенов, latency и инфраструктуры оказывается настолько суровее бумажных прогнозов, что проекты часто сворачивают из-за отрицательной юнит-экономики. Дешёвый прототип работает превосходно, пока вы тестируете его руками. Но как только вы даёте модели доступ к инструментам, поиску и памяти, а затем выпускаете в суровую реальность MLOps-продакшена, счёт начинает расти по экспоненте.
Сколько стоит держать ИИ-агента в проде: полная экономика токенов, latency и инфраструктуры на масштабе
Чтобы понять масштаб бедствия, нужно препарировать анатомию одного «действия» агента. В классическом инференсе вы платите за системный промпт, контекст пользователя и сгенерированный ответ. Транзакция закрыта. В агентной парадигме — будь то ReAct, Plan-and-Solve или любой кастомный цикл — одно действие пользователя порождает каскад вызовов. Агент получает задачу, генерирует внутреннюю мысль, принимает решение вызвать внешний инструмент. Это первый вызов. Инструмент отрабатывает, возвращает сырой JSON или кусок текста. Агент снова вызывается, чтобы проанализировать этот результат, понять, достигнута ли цель, и спланировать следующий шаг. Это второй вызов. Дьявол кроется в том, что во второй вызов вы обязаны передать всю историю первого шага: изначальный промпт, первую мысль, команду инструменту и его ответ. Контекст пухнет с каждым шагом линейно, а значит, потребление токенов на вход растёт квадратично.
Если ваш агент совершает пять итераций рассуждения перед выдачей финального ответа, вы платите за базовый промпт пять раз. Добавьте сюда latency. В агентных цепях время до первого токена, известное как TTFT, убивает пользовательский опыт. Каждый шаг цикла — это остановка генерации, поход по сети за данными, ожидание ответа API и новый запуск авторегрессионного механизма. Ваш KV-кэш на серверах разрывается на куски, потому что динамический скретчпад агента уникален для каждой сессии и постоянно мутирует. Вы не можете эффективно кэшировать префиксы, кроме самого базового системного промпта. GPU простаивает в ожидании сетевых I/O-операций ваших инструментов, а память забивается промежуточными тензорами.
Мульти-агентность и агентный RAG: множители финансовой боли
Дальше в игру вступает хайп. Кто-то в команде читает свежий пейпер про роевой интеллект и решает развернуть команду из нескольких LLM: один агент ищет данные, другой пишет код, третий проверяет результат. Помню, отлаживая очередной пайплайн в Morana Labs, мне пришлось жестко прибить потрясающе красивую архитектуру мульти-агентного роя в вечер пятницы, потому что система увлечённо жгла по пятьсот долларов в час на тестовом стенде, просто вежливо здороваясь друг с другом и перекидываясь системными сообщениями перед каждым обращением к базе данных. Мульти-агентность умножает стоимость в разы за счёт колоссального оверхеда на коммуникацию. Вы платите за то, чтобы одна нейросеть объясняла другой контекст задачи на естественном языке, вместо того чтобы передавать строгие детерминированные структуры.
Агентный RAG усугубляет картину. Это уже не просто векторный поиск по близости. Агент сам формирует несколько поисковых запросов, читает сотни тысяч токенов извлеченных документов, понимает, что информации не хватает, меняет стратегию поиска и делает новый запрос. Стоимость хранения эмбеддингов, работа reranker-моделей в реальном времени и, главное, заталкивание огромных кусков сырого текста в контекст LLM на каждой итерации поиска превращают один невинный вопрос пользователя в инфраструктурный кошмар.
Прагматичные рычаги: кэш, роутинг и амнезия
Выжить в этом можно только через жесточайшую инженерную дисциплину. Первый рычаг — маршрутизация на дешёвые модели. Вам абсолютно не нужна флагманская модель с сотнями миллиардов параметров, чтобы проверить, вернул ли API погоды пустую строку, или чтобы отформатировать дату. Тяжёлые модели должны вызываться только в точках ветвления сложных логических графов и для глубокого планирования. Обычный роутинг, агрегацию инструментальных логов и простые ReAct-шаги обязана делать квантованная малая модель вроде Llama 3 8B, работающая на дешевом железе или edge-узле. Каждое действие в цепи должно динамически оцениваться маршрутизатором, который направляет запрос в самый дешёвый когнитивный движок, способный с ним справиться.
Второй рычаг — принудительное ограничение контекста и управляемая амнезия. Агенту нельзя позволять тащить за собой весь мусор предыдущих шагов. Как только промежуточный этап завершен, скрипт должен вычищать из контекста сырые ответы инструментов, оставляя только сжатую выжимку фактов. Если вы не научите свою систему забывать, p99 latency быстро улетит за пределы тридцати секунд, а провайдер выставит вам счёт, который не покроет никакая подписка. Семантическое кэширование на уровне эмбеддингов пользовательских намерений должно перехватывать до трети трафика ещё до того, как он коснется LLM.
Скрытый налог MLOps: кто платит за наблюдаемость
Ни одна смета не учитывает скрытые расходы продакшена. Чтобы автономный агент работал надежно, его нужно постоянно оценивать. Практика LLM-as-a-judge означает, что вы берете процент реального трафика и прогоняете его через отдельную, часто более дорогую модель, чтобы проверить, не начал ли ваш агент галлюцинировать в бесконечном цикле из-за того, что внешний API незаметно обновил формат ответа. Continuous evaluation удваивает стоимость инференса на семплированном объеме.
Сюда же ложится мониторинг. Инструменты LLM-наблюдаемости, которые трекают токены, latency каждого шага и деревья вызовов, стоят серьезных денег на больших объемах трейсов. Добавьте к этому стоимость дежурства. On-call инженер, который должен ночью понять, почему агент начал уходить в таймаут, сталкивается не с упавшим подом в Kubernetes, а с вероятностной природой генерации. Расследование таких инцидентов требует времени дорогих специалистов, глубоко понимающих и бэкенд, и специфику машинного обучения.
Сметная модель обязана строиться вокруг стоимости одного законченного действия, а не изолированного вызова. Если ваш уровень автономии позволяет системе сделать до десяти шагов, берите максимальную длину цепи, считайте квадратичный рост токенов контекста, прибавляйте стоимость retrieval-базы и умножайте на цену токена. Трехцентовый запрос в API легким движением руки превращается в доллар за транзакцию. Экономику нужно считать до релиза, жестко отвечая себе на вопрос: покрывает ли бизнес-ценность этого конкретного действия тот вычислительный ад, который разворачивается под капотом.