Никаких талонов на ИИ: вы перепутали бюджет с дефицитом

Компании не ограничивают токены LLM — их считают и оптимизируют, как любой счёт за инфраструктуру. Дефицит ИИ — миф, рождённый перепутанным глаголом.

Никаких талонов на ИИ: вы перепутали бюджет с дефицитом

— По всему миру компании ограничивают потребление токенов LLM! — кричат мне. — Ура, скоро мы снова вернёмся к ручной разработке!

Нет. Совсем не так.

Кто-то услышал слово «лимит», сложил его со словом «токены» и получил апокалипсис: доступ к ИИ по талонам, очереди за килобайтами, возвращение золотого века ручного кодинга. Красивая история — разваливается на первом же вопросе: что, собственно, вы собрались ограничивать?

Ограничивать нечего: месяц работы стоит как две пиццы

Обычный программист сидит в чате с моделью месяц — и ему за глаза хватает подписки за двадцать баксов. Двадцать. Долларов.

Вы всерьёз считаете, что у человека с зарплатой в пять тысяч не найдётся лишней двадцатки на инструмент, которым он зарабатывает эти пять тысяч? Это не дефицит, который надо нормировать талонами. Это статья расходов размером с обед. Компания, которая начнёт «экономить» на таком, сэкономит ровно ничего — и потеряет инженера, который просто оплатит подписку сам и уйдёт работать быстрее.

Первый этаж этой страшилки пуст. Ограничивать в чат-режиме нечего: там нет тех денег, ради которых кто-то стал бы выстраивать очередь за талонами.

Но настоящие деньги в LLM — не там. И вот тут начинается путаница, из которой растёт весь миф.

«Ограничивают» и «считают» — два разных глагола

Потребление токенов не ограничивают. Его считают — то есть закладывают в бюджет. А бюджет — нормальная жизнь любого производства, не введение карточной системы.

И бюджет этот — не на вайб-кодинг в чате. Он на программные пайплайны: там модель работает не как собеседник, а как деталь конвейера. Её вызывают из скриптов, по HTTP, прямо к серверу провайдера. Ушёл запрос — пришёл ответ — поехало дальше по коду. Таких вызовов в сутки могут быть тысячи, и каждый оплачивается по объёму данных и по «крутизне» модели: чем больше текста прогоняешь и чем мощнее модель дёргаешь, тем дороже.

Вот здесь появляются реальные суммы. Их совершенно естественно считать и оптимизировать — ровно как любую другую строку в счёте за инфраструктуру. За серверы считают, за трафик считают, за облако считают. Никто не кричит, что «доступ к серверам скоро будет по талонам», когда финдир смотрит на счёт от облачного провайдера.

Я занимаюсь этим счётом каждый день. Не в теории — руками, на своём боевом пайплайне: массовые прогоны гоню через дешёвую и быструю модель, а на шаги, где нужно качество, поднимаю модель помощнее и подороже. Это не режим экономии и не борьба с дефицитом. Это инженерия стоимости — та же, что и везде, где есть переменные расходы.

Тот, кто увидел в этой бухгалтерии «ограничение ИИ», перепутал бюджет с талоном. Считать расход — не значит его запрещать.

Никто не хочет меньше ИИ — все хотят больше

Третий этаж, он же самый абсурдный. Разберём саму цель.

Ни одна компания в здравом уме не ставит задачу ограничить применение ИИ. С какой стати? Это инструмент конкурентного преимущества — то, чем ты обгоняешь соседа по рынку. Ограничивать его — как запретить инженерам пользоваться электричеством, чтобы сэкономить на счётчике.

Компании хотят прямо противоположного: применять ИИ как можно больше, а не бить сотрудников по рукам за лишний запрос. И именно из этого желания — больше, дешевле, устойчивее — растут все те шаги, которые снаружи путают с «нормированием»:

Что компания делает на самом деле Зачем Как это выглядит снаружи
Балансировка между вендорами LLM Не зависеть от одного провайдера и его цен «Ограничивают одного, разрешают другого»
Роутинг запросов Простые запросы — дешёвой модели, сложные — сильной «Разрешают не всем моделям»
Переход на локальные модели Объёмы такие, что своё железо окупается «Вообще отрезали от облака»

Это движение в сторону «больше ИИ за те же деньги», не «меньше ИИ для всех». Оптимизируют не чтобы урезать — оптимизируют, чтобы масштабировать. Тот, кто читает эти новости как приближение талонов, читает их ровно наоборот.

Прежде чем пересказывать про талоны — включите голову

«Ограничение токенов» — не карточная система на ИИ. Это счёт за производство, который считают и оптимизируют, потому что производства становится больше, а не меньше. В чате ограничивать нечего — там двадцать баксов. В пайплайнах есть что считать — и это считают, как считают любую инфраструктуру. Цель у всех одна: выжать из ИИ больше, а не спрятать его под прилавок.

Люди, которые считают эти токены руками каждый день, панику не разделяют — потому что между «бюджет» и «дефицит» лежит пропасть, и мы по эту сторону.

Leave a Reply

Your email address will not be published. Required fields are marked *