Стоимость ИИ для компании — это сумма запросов к моделям, работы по встраиванию в процессы и контроля вокруг них. Цена «за тысячу токенов» из карточки модели описывает только первый кусок и то в идеальных условиях.
Публичного прайс-листа у AI Cloud нет: на тарифах стоят «по запросу» и «индивидуально». Ниже — из каких частей собирать оценку, чтобы не стыдиться сметы через три месяца.
Что входит в счёт, кроме модели
Интеграция: коннектор к CRM, ITSM, 1С, очереди файлов. Часто это больше человеко-недель, чем «подключить API». Политики ИБ: DLP, разбор журналов, исключения. Сопровождение: кто меняет промпт, когда процесс изменился.
Ещё простой: пилот без даты окончания, который жрёт кредиты на внутренние эксперименты без владельца. И смена модели: если приложения прибиты к одному API, вы заплатите проектом, а не строкой в конфиге.
Почему демо врёт
В демо три предложения входа. В проде — переписка на две страницы и вложение. Контекст раздувает счёт быстрее, чем «число сотрудников». Повтор «перефразируй» умножает вызовы. Стриминг и длинные ответы дороже короткой классификации.
Имеет смысл на пилоте сразу снять стоимость на 100 реальных объектов (заявок, документов), а не на одном красивом примере.
Как не смешать бюджеты отделов
Личные карты и десять кабинетов поставщиков делают ИИ невидимым для финансового контролёра. Единый договор и квоты по проектам — наоборот. Шлюз здесь не про «безопасность ради галочки», а про то, чтобы маркетинг не съел лимит поддержки.
Единица учёта может называться кредитом, токеном или рублём за запрос. Важно, чтобы её можно было отнести на центр затрат. Практика единиц — FinOps и кредиты.
Дорогая модель на дешёвую задачу
Самый частый скрытый налог: всё гоняют через frontier-модель, потому что «вдруг качество». Для маршрутизации писем это расточительно. Для разбора спорного договора — может быть оправдано. Правило маршрута дешевле совещания каждый вторник.
Сравнение моделей по задаче — как выбрать LLM. Канал, где правило исполняется, — шлюз.
Пилот, продуктив, железо
Пилот должен иметь потолок. Продуктив — прогноз объёма с запасом на рост переписок, не на рост «интереса к ИИ». Железо в своём контуре имеет смысл считать вместе с амортизацией и сменой карт, а не сравнивать прайс GPU с прайсом токена за один месяц.
Если объём неизвестен, не закупайте стойку «на вырост». Начните с сервиса, снимите фактический профиль, потом решайте про Private AI Cloud.
Что запросить у поставщика в цифрах
Не «сколько стоит ИИ», а: сколько стоит пилот на N документов; как тарифицируется простой шлюза; что будет при x5 объёма; как выглядит счёт при смене модели; сколько хранятся логи и входит ли это в цену.
Ответы без объёма бесполезны. Возьмите свой N с пилота. Заявка на расчёт — контакт.
Частые вопросы
Публичной одной цифры нет: зависит от сценария, объёма запросов, контура размещения и интеграций. В AI Cloud тарифы указаны как «по запросу» и «индивидуально». Имеет смысл считать пилот отдельно от продуктивного объёма и не проецировать цену токена в демо на годовой бюджет.
В демо короткий промпт. В проде в запрос кладут переписку, регламент и файл. Плюс повторные вызовы, когда ответ не подошёл. Плюс дорогая модель на поток, который закрыла бы дешёвая. Без квот это видно только по факту.
Это один договор и одна единица учёта вместо отдельных подписок на каждый чат и каждый API. Расход можно разнести по отделам. Как устроены единицы в AI Cloud — в статье [AI-кредиты](/resources/ai-credits-billing).
Своё железо дешевеет на ровной высокой загрузке и дорожает, если карты простаивают, а люди всё равно нужны. Сервис дороже на единицу при огромном стабильном объёме и дешевле, пока вы пробуете сценарии и меняете модели. Сравнение контуров — в [размещении ИИ](/resources/ai-placement-cloud-hybrid-onprem).