09-09-2026 · ai/token-cheap-task-expensive.md

Токен подешевел, задача подорожала

В своём агенте я в какой-то момент сделал счётчик стоимости сессии. Не из бухгалтерских соображений – просто хотелось видеть цифру рядом с работой. Заодно пришлось написать скучную вещь: подтягивать цены из каталога, когда провайдер не присылает их в ответе.

И вот эта цифра оказалась интереснее, чем я ожидал. Одна задача вроде «разберись, почему падает вот этот тест, и почини» – это не один запрос к модели. Это план, выбор инструментов, чтение десятка файлов, запуск тестов, разбор вывода, повторная попытка, проверка результата, компакция контекста, когда переписка разрослась. Десятки вызовов там, где я в голове держал слово «спросил».

Пока я не видел счётчик, я думал в терминах цены за миллион токенов. А она падает быстрее, чем я успеваю привыкнуть: индекс Silicon Data, который считает средневзвешенную по потреблению цену по двум сотням открытых и ста двадцати проприетарных моделей, за один квартал сжался почти на 60% – с 2,07 доллара за миллион токенов в мае до 0,97 к концу августа. По этой логике мои расходы должны были схлопнуться.

Они выросли.

У этого расхождения теперь есть название. 17 августа Gartner выпустил прогноз, где называет его парадоксом инференса: юнит-экономика улучшается, а общая стоимость ИИ растёт, и понятного пути к сопоставимой отдаче при этом нет. Цифра в прогнозе жёсткая: стоимость инференса на один агентный сценарий вырастет более чем в пять раз к 2028 году – при том, что цена токена всё это время будет снижаться. Причина простая: агентная задача съедает в разы больше токенов, чем чат с моделью, потому что состоит из планирования, вызовов инструментов, интерпретации результатов, проверки собственной работы и исправления ошибок. Там же есть фраза, которая мне понравилась точностью: чат-бот читает запрос и отвечает разумно, а агент постоянно рассуждает, договаривается и переспрашивает сам себя.

Двумя месяцами раньше те же аналитики выпустили прогноз с заголовком, от которого неуютно: к 2028 году расходы на ИИ-кодинг превысят среднюю зарплату разработчика – именно из-за роста потребления токенов.

То есть подешевел не тот показатель, на который я смотрел. Цена токена – это цена единицы. Единиц стало на порядок больше, и вот здесь начинается самое интересное: их количество выбираю не я. Агент внутри устроен как цикл «рассуждение – действие – наблюдение», и на каждой итерации решение сделать ещё шаг или остановиться принимает модель. Я задаю рамки: какие инструменты доступны, какая модель, где лимит итераций, когда сжимать контекст. Сколько шагов уйдёт на конкретную задачу, я узнаю из счётчика, когда всё уже закончилось.

Дальше начинается неприятное. Дешёвый токен меняет поведение инженера – и меняет незаметно. Я перестал экономить контекст: раньше я думал, какие файлы дать модели, теперь отдаю папку и жду, что она разберётся. Я перестал считать попытки: не получилось с первого раза – пусть попробует ещё, это же секунды. Я стал запускать по два агента параллельно, потому что могу. Каждое из этих решений выглядит рациональным, и каждое расширяет рамки, внутри которых модель считает шаги. Одна задача превращается в пятьдесят вызовов там, где хватило бы пяти, и экономия на цене единицы уходит на рост их числа с запасом.

Индустрия эту стадию уже прошла. В свежем отчёте FinOps Foundation, собранном на опросе 1 192 специалистов, отвечающих за больше чем 83 миллиарда долларов облачных расходов, управлением расходами на ИИ занимаются 98% организаций – против 31% двумя годами ранее. За два года почти все, кто платит за инференс, обзавелись отдельной дисциплиной, чтобы понимать, куда уходят деньги.

Мне это напоминает историю с облаками. Когда сервер стал стоить копейки за час, никто не начал платить меньше – просто серверов стало больше, а поверх выросла целая профессия про то, чтобы за этим следить. Токены идут тем же путём, только быстрее.

Я не собираюсь возвращаться к ручной экономии на контексте: это как раз та работа, за которую я и плачу инференсом. Но с тех пор, как в агенте появился счётчик, я стал задавать себе перед задачей другой вопрос. Раньше он звучал «сможет ли модель это сделать». Теперь – «во сколько шагов, и знаю ли я, сколько их будет».

Токен подешевел. Задача – подорожала. И самое неудобное здесь то, что цену задачи я узнаю уже после того, как её оплатил.