Цену API легко понять неправильно. На странице модели указаны рубли или доллары за миллион токенов, а компания отправляет запросы разной длины. Один отдел анализирует короткие обращения, другой передает модели длинные документы. Даже при одинаковом количестве обращений их расходы будут отличаться. Чтобы оценить бюджет, нужно знать модель, объем входа и объем ответа.
Что оплачивается в запросе
Входные токены — текст, который приложение передало модели: системные инструкции, сообщение пользователя, историю разговора и приложенный контекст. Выходные — созданный моделью ответ. Ставки на вход и выход обычно разные. Это видно в официальном прайсе OpenAI и прайсе Anthropic: обе компании публикуют их раздельно за миллион токенов.
Миллион — единица сравнения цены, а не минимальная покупка. Если запрос использовал 2 000 входных токенов, за вход берут 2 000/1 000 000 соответствующей ставки. С ответом расчет повторяют отдельно. Для предварительной сметы достаточно двух счетчиков; после пилота следует брать фактические значения из журналов использования выбранного канала.
Формула месячного бюджета выглядит так:
Входные токены за месяц / 1 000 000 × ставка входа + выходные токены за месяц / 1 000 000 × ставка выхода.
Отдельно учитывают операции, которые оплачиваются вне этой формулы: например, встроенные инструменты поиска, изображения или иной режим обработки, если они используются и имеют собственную ставку. Не стоит смешивать текстовый прайс с такими расходами в одной цифре без расшифровки.
Пример: 10 000 обращений в месяц
Допустим, внутренний помощник обрабатывает 10 000 запросов. На один запрос вместе с инструкциями и найденными материалами уходит в среднем 2 000 входных токенов, ответ занимает 500. За месяц получится 20 млн входных и 5 млн выходных токенов.
В рабочем предложении «Культуры платежей» для теста гипотезы цена GPT-6 Luna рассчитана как 11,16 ₽ за 1 млн входных и 55,78 ₽ за 1 млн выходных. По этой предлагаемой сетке пример стоит 20 × 11,16 + 5 × 55,78 = 502,10 ₽ за текстовые токены. Это иллюстрация метода, а не опубликованный обязательный тариф: фактическая поставка и цена должны быть зафиксированы в предложении клиенту. У более дорогой модели при том же объеме бюджет будет иным.
Посмотреть предлагаемые ставки и отправить свою нагрузку на расчет можно на странице API-модели и цены для компании.
Почему фактический счет бывает выше прогноза
Первый источник расхождения — история диалога. При каждом новом ходе приложение может повторно отправлять прежние сообщения. Короткий ответ не означает короткий вход. Второй — длинные документы: файл, найденные фрагменты и служебные инструкции тоже попадают в запрос. Третий — внутренние токены рассуждения у моделей, которые их используют: оплата вывода может включать больше, чем видимый пользователю ответ. OpenAI описывает reasoning tokens отдельно.
Есть и обратный эффект. Когда одна и та же часть запроса повторяется, поставщик может применять кэширование контекста. Чтение кэша обычно стоит дешевле обычного входа, но запись также тарифицируется и зависит от модели и режима. Документация OpenAI и Anthropic описывают эти условия отдельно. Закладывать стопроцентное попадание в кэш до испытаний нельзя.
Как собрать реалистичный прогноз
Начните с одного сценария, а не со всего будущего продукта. Возьмите 30–50 типичных обращений: короткие, длинные, с документами и без них. Для каждого зафиксируйте вход, выход и модель. Затем посчитайте медиану и верхнюю границу. Если в задаче есть сезонные пики, добавьте к плану их отдельно; средняя нагрузка не покажет потребность в пиковый день.
Проверьте, какую долю запросов действительно нужно отдавать мощной модели. Классификация обращения, извлечение короткого поля и сложный анализ договора требуют разного качества ответа. Дешевая модель может выиграть по цене токена, но проиграть, если ее результат часто приходится исправлять или запускать повторно. Поэтому сравнивайте стоимость успешно решенной задачи, а не только прайс за миллион.
Финальная смета должна показывать как минимум выбранные модели, вход и выход за месяц, ожидаемое количество обращений, стоимость по каждому типу токенов и дополнительные операции. Если данных еще нет, начните с описания процесса и двух-трех примеров запросов. Мы поможем превратить их в расчет и подготовим условия корпоративного подключения: получить расчет API-доступа.
Для технического отбора модели пригодится отдельный материал как выбрать API-модель для продукта.
