Выбор языковой модели для компании — это выбор маршрута под класс задач, а не подписка на бренд. Модель, которая хорошо пишет письма, может путать суммы в счетах. Модель, которая сильна в коде, может быть избыточна для классификации заявок.
В каталоге AI Cloud больше 300 моделей разных типов. Ниже — как не утонуть в списке. Частный случай open-source-линеек разобран в Kimi, Qwen, DeepSeek; здесь метод целиком, включая GPT, Claude, Gemini, GigaChat и YandexGPT.
Сначала задача, потом таблица лидеров
Запишите вход и выход. «Суммаризация договора до одной страницы с сохранением сторон и штрафов» — задача. «Чтобы было как у конкурентов» — нет. От входа зависит длина контекста: короткий тикет и стостраничный PDF требуют разного окна.
Запишите, кто проверяет ответ. Если юрист всё равно читает каждое письмо, можно взять модель подешевле. Если ответ уходит клиенту без правки — качество и запрет галлюцинаций важнее цены токена.
Пять критериев, которые реально двигают решение
Качество на вашем языке и домене. Корпоративный русский с аббревиатурами ведомств — это не общий бенчмарк. Контур: можно ли обрабатывать запрос в нужной юрисдикции. Стоимость на ожидаемом объёме, не на одном демо. Задержка: оператор на линии не будет ждать 20 секунд. Устойчивость: что будет, если поставщик деградирует.
Лицензия и происхождение весов важны для open-source в своём контуре. Для API-сервиса важнее договор и журналы, чем файл лицензии на Hugging Face.
Российские и зарубежные модели — не идеологии
GigaChat и YandexGPT часто выигрывают там, где нужны закупки без иностранного контракта и привычный русский канцелярит. GPT, Claude, Gemini — там, где длинное рассуждение, код, смешанные языки. Это среднее по больнице: на вашем наборе знаков может получиться наоборот.
Политика «только российское» или «только frontier» экономит совещания и дорожает в эксплуатации. Нормальная политика — allow-list по контурам: персональные данные — на согласованный список, публичные черновики — шире.
Одна модель на компанию — ловушка удобства
Закупки любят одну строку в договоре. Разработка любит один SDK. В итоге FAQ гоняют через самую дорогую модель, а сложный разбор всё равно ругают за качество. Маршрутизация на шлюзе как раз для этого: правило, а не совещание каждый раз.
Единого API ко всем моделям нет. Единым должен быть способ вызвать разрешённую модель и списать расход. Сами интерфейсы поставщиков остаются разными.
Как провести сравнение за две недели
Соберите 30–50 реальных примеров, не выдуманных. Разметьте, что считается ошибкой. Прогоните двух–четырёх кандидатов. Посчитайте не «кто умнее», а долю критичных ошибок и стоимость прогона. Посмотрите хвост: самые плохие ответы.
Если нет времени на 50 примеров, сделайте 15, но живых. Ноль примеров и выбор «как у всех» — самый дорогой вариант на горизонте года.
Модель — не весь стек
Для поиска по базе нужны embeddings и индекс, не только чат. Для звонков — речь. Для сканов — пакет, который умеет документы. Обзор типов — мультимодальный ИИ.
Когда задача выбрана, смотрите карточку в каталоге и политики на шлюзе. Если нужен изолированный контур под свою или дообученную модель — это уже размещение, не выбор бренда чата.
Частые вопросы
Ту, которая проходит ваши примеры и вписывается в контур данных и бюджет. Универсальной «лучшей LLM» нет: для классификации писем и для разбора договора критерии разные. Имеет смысл держать несколько моделей и маршрутизировать задачу, а не искать одну на всё.
Размещение и договор важны, но не заменяют качество на задаче. Иногда регламенты на русском лучше закрывает GigaChat или YandexGPT, иногда нужна более сильная зарубежная модель за DLP и журналом. Решение — по классу данных и по тесту, не по флагу на сайте модели.
Нет. Дорогая модель на каждом FAQ съест бюджет и не даст пропорционального качества. Имеет смысл дешёвый маршрут на поток и усиленный — на сложные случаи, когда дешёвый не справляется или риск ошибки высок.
На одном и том же наборе ваших документов и диалогов, с заранее записанными критериями ошибок. Сравнение по демо вендора и по новостям лидеров рейтинга почти всегда врёт.