— По всему миру компании ограничивают потребление токенов LLM! — кричат мне. — Ура, скоро мы снова вернёмся к ручной разработке!
Нет. Совсем не так.
Кто-то услышал слово «лимит», сложил его со словом «токены» и получил апокалипсис: доступ к ИИ по талонам, очереди за килобайтами, возвращение золотого века ручного кодинга. Красивая история — разваливается на первом же вопросе: что, собственно, вы собрались ограничивать?
Ограничивать нечего: месяц работы стоит как две пиццы
Обычный программист сидит в чате с моделью месяц — и ему за глаза хватает подписки за двадцать баксов. Двадцать. Долларов.
Вы всерьёз считаете, что у человека с зарплатой в пять тысяч не найдётся лишней двадцатки на инструмент, которым он зарабатывает эти пять тысяч? Это не дефицит, который надо нормировать талонами. Это статья расходов размером с обед. Компания, которая начнёт «экономить» на таком, сэкономит ровно ничего — и потеряет инженера, который просто оплатит подписку сам и уйдёт работать быстрее.
Первый этаж этой страшилки пуст. Ограничивать в чат-режиме нечего: там нет тех денег, ради которых кто-то стал бы выстраивать очередь за талонами.
Но настоящие деньги в LLM — не там. И вот тут начинается путаница, из которой растёт весь миф.
«Ограничивают» и «считают» — два разных глагола
Потребление токенов не ограничивают. Его считают — то есть закладывают в бюджет. А бюджет — нормальная жизнь любого производства, не введение карточной системы.
И бюджет этот — не на вайб-кодинг в чате. Он на программные пайплайны: там модель работает не как собеседник, а как деталь конвейера. Её вызывают из скриптов, по HTTP, прямо к серверу провайдера. Ушёл запрос — пришёл ответ — поехало дальше по коду. Таких вызовов в сутки могут быть тысячи, и каждый оплачивается по объёму данных и по «крутизне» модели: чем больше текста прогоняешь и чем мощнее модель дёргаешь, тем дороже.
Вот здесь появляются реальные суммы. Их совершенно естественно считать и оптимизировать — ровно как любую другую строку в счёте за инфраструктуру. За серверы считают, за трафик считают, за облако считают. Никто не кричит, что «доступ к серверам скоро будет по талонам», когда финдир смотрит на счёт от облачного провайдера.
Я занимаюсь этим счётом каждый день. Не в теории — руками, на своём боевом пайплайне: массовые прогоны гоню через дешёвую и быструю модель, а на шаги, где нужно качество, поднимаю модель помощнее и подороже. Это не режим экономии и не борьба с дефицитом. Это инженерия стоимости — та же, что и везде, где есть переменные расходы.
Тот, кто увидел в этой бухгалтерии «ограничение ИИ», перепутал бюджет с талоном. Считать расход — не значит его запрещать.
Никто не хочет меньше ИИ — все хотят больше
Третий этаж, он же самый абсурдный. Разберём саму цель.
Ни одна компания в здравом уме не ставит задачу ограничить применение ИИ. С какой стати? Это инструмент конкурентного преимущества — то, чем ты обгоняешь соседа по рынку. Ограничивать его — как запретить инженерам пользоваться электричеством, чтобы сэкономить на счётчике.
Компании хотят прямо противоположного: применять ИИ как можно больше, а не бить сотрудников по рукам за лишний запрос. И именно из этого желания — больше, дешевле, устойчивее — растут все те шаги, которые снаружи путают с «нормированием»:
| Что компания делает на самом деле | Зачем | Как это выглядит снаружи |
|---|---|---|
| Балансировка между вендорами LLM | Не зависеть от одного провайдера и его цен | «Ограничивают одного, разрешают другого» |
| Роутинг запросов | Простые запросы — дешёвой модели, сложные — сильной | «Разрешают не всем моделям» |
| Переход на локальные модели | Объёмы такие, что своё железо окупается | «Вообще отрезали от облака» |
Это движение в сторону «больше ИИ за те же деньги», не «меньше ИИ для всех». Оптимизируют не чтобы урезать — оптимизируют, чтобы масштабировать. Тот, кто читает эти новости как приближение талонов, читает их ровно наоборот.
Прежде чем пересказывать про талоны — включите голову
«Ограничение токенов» — не карточная система на ИИ. Это счёт за производство, который считают и оптимизируют, потому что производства становится больше, а не меньше. В чате ограничивать нечего — там двадцать баксов. В пайплайнах есть что считать — и это считают, как считают любую инфраструктуру. Цель у всех одна: выжать из ИИ больше, а не спрятать его под прилавок.
Люди, которые считают эти токены руками каждый день, панику не разделяют — потому что между «бюджет» и «дефицит» лежит пропасть, и мы по эту сторону.