Краткий ответ
Столбец Cost на странице журнала — это сумма в USD за этот вызов. Все, что вы видите там, объясняется четырьмя вещами:- Модели с тарификацией по использованию (большинство текстовых моделей, а также gpt-image-2, семейство SeeDance 2.0 и другие) возвращают counts токенов в поле
usageответа, поэтому стоимость можно вычислить на стороне клиента; - Модели с оплатой за вызов не возвращают сумму в ответе, но цена за единицу фиксирована, поэтому cost = calls × фиксированная цена — это тоже легко вычислить;
- Суммы в журнале указаны до скидки: ваша фактическая стоимость — это эта величина, деленная на коэффициент бонуса пополнения (бонус 10% означает деление на 1.1, то есть примерно скидку 9%);
- Журнал фиксирует только успешно тарифицированные вызовы. Ошибки возвращаются в ответе API; неудачный вызов, за который не было списания, в журнале не появляется и не тарифицируется.
Чтение каждого столбца
Два режима тарификации
По объему использования (за token)
usage в ответе возвращает количество token напрямую. Стоимость = input tokens × input rate + output tokens × output rate.Применяется к: большинству текстовых моделей, а также моделям изображений и видео с оплатой за token, таким как gpt-image-2 и семейство SeeDance 2.0.За вызов (фиксированная цена за единицу)
Может ли API возвращать стоимость напрямую?
Она не возвращает сумму, но стоимость полностью вычислима:- По использованию: умножьте значения
usageна коэффициенты тарифа сами — это собственные подсчеты token поставщика, более точные, чем любая оценка; - За вызов: цена за единицу фиксирована, так что просто умножьте ее на количество вызовов.
Расчет по использованию
Модели с оплатой по использованию возвращают примерно следующее:Проверка счетчиков token для gpt-image-2
Почему суммы в логе показываются «до скидки»
В логе записывается исходная сумма, рассчитанная по тарифам модели. Ваша фактическая стоимость получает еще одну скидку сверху, потому что при пополнении вы получили бонусный кредит:0.011 ÷ 1.1 = 0.01 — примерно на 9% дешевле.
См. уровни бонусов пополнения
Списываются ли неудачные вызовы?
Нет — и они вообще не появляются в журнале тарификации. Это ключ к правильному чтению журнала: Типичный пример: вызов gpt-image-2 и получениеPUBLIC_, это модерация контента на upstream — она не тарифицируется, и после корректировки prompt можно безопасно повторить запрос.
Частые вопросы
Два вызова одной и той же модели стоят очень по-разному — это нормально?
Два вызова одной и той же модели стоят очень по-разному — это нормально?
- Разная длина входа: длинный контекст, многоходовая история, изображения и аудио резко увеличивают число input tokens
- Токены рассуждения: модели с включенным reasoning создают дополнительные output tokens, которые учитываются в столбце Completion
- Попадания в кэш: cached input тарифицируется по значительно более низкой ставке, поэтому второй запуск того же prompt может стоить намного дешевле
- Параметры image/video: разрешение, длительность и количество изображений напрямую влияют на число token или количество вызовов
Количество token в журнале не совпадает с моим подсчетом.
Количество token в журнале не совпадает с моим подсчетом.
usage в ответе и журналу — они поступают из одного и того же источника. Несоответствия обычно возникают из-за того, что мультимодальный контент (изображения, аудио) преобразуется в token по правилам конкретного вендора; system prompts и схемы tools учитываются как input; а токены reasoning учитываются как output, не отображаясь в видимом тексте.Где найти цены за единицу для моделей с оплатой за вызов?
Где найти цены за единицу для моделей с оплатой за вызов?
Вызов завершился ошибкой, но, кажется, с меня списали средства. Что делать?
Вызов завершился ошибкой, но, кажется, с меня списали средства. Что делать?
Могу ли я увидеть контент, который отправил, в журнале?
Могу ли я увидеть контент, который отправил, в журнале?