Skip to main content

Краткий ответ

Лимиты параллельных запросов зависят от типа модели - у текстовых моделей самый высокий уровень параллельных запросов, а у моделей для генерации изображений - умеренные ограничения.
Важное примечаниеЛимиты параллельных запросов применяются к отдельным моделям, а не ко всему вашему аккаунту. Например, Nano Banana Pro поддерживает 30 параллельных запросов, что не влияет на параллельные запросы других моделей.

Лимиты параллельных запросов по типу модели

Текстовые модели

По умолчанию: 50 req/sec
  • ✅ Поддержка высокой параллельности
  • ✅ Подходит для пакетной обработки
  • 🔓 Более высокие квоты доступны

Асинхронные видео-модели

По умолчанию: высокая параллельность
  • ✅ Асинхронная обработка
  • ✅ Поддержка крупных объемов вызовов
  • 📊 Идеально подходит для пакетной генерации видео

Модели изображений

По умолчанию: 30 req/sec
  • ⚠️ Параллельные запросы контролируются
  • 📦 Передача больших данных Base64
  • 🔓 Настраивается по запросу

Почему у моделей изображений есть контроль параллельных запросов?

Техническая причинаAPI для генерации изображений используют кодирование Base64 для передачи данных изображений, что приводит к большим полезным нагрузкам запроса (обычно 500KB-5MB на запрос). Чтобы обеспечить стабильность сервиса и скорость ответа, необходим умеренный контроль параллельных запросов.Пример: У Nano Banana Pro по умолчанию 30 параллельных запросов, что достаточно для большинства сценариев использования.

Как рассчитываются параллельные запросы

Для каждой отдельной модели

Лимиты параллельных запросов применяются к каждой конкретной модели, а не ко всей вашей учетной записи:
Реальный примерЕсли одновременно использовать:
  • Nano Banana Pro (image): 30 одновременно
  • GPT-4o mini (text): 50 одновременно
  • FLUX.1 Pro (image): 30 одновременно
Общая доступная параллельность: 110+ запросов (независимо по каждой модели)

Как запросить более высокие параллельные запросы?

Индивидуальные пользователи

1

Оцените свои потребности

Определите требуемый уровень параллельных запросов и сценарий использования
2

Свяжитесь со службой поддержки

Свяжитесь с нами в Enterprise WeChat, чтобы описать свои потребности
3

Техническая проверка

Мы оценим запрос на основе вашего сценария использования и исторических данных
4

Корректировка квоты

После одобрения мы скорректируем лимиты параллельных запросов для вашего token

Корпоративные клиенты

Сервис выделенной линииКорпоративные клиенты могут подать заявку на услуги выделенной линии со следующими преимуществами:
  • 🚀 Более высокие квоты на параллельные запросы: Настраиваются под потребности бизнеса
  • 🔒 Изолированные пулы ресурсов: Не зависят от публичного трафика
  • Приоритетное планирование: Гарантированная скорость ответа
  • 📞 Персональное обслуживание: Обслуживание один на один
Свяжитесь с нами, чтобы узнать о планах корпоративного обслуживания.

Часто задаваемые вопросы

Текстовые модели передают меньший объем данных запроса/ответа (обычно несколько КБ), тогда как модели для изображений передают данные изображений в Base64 (обычно 500KB-5MB). Управление параллельными запросами обеспечивает общее качество сервиса.
Вы можете проверить это через:
  • Конфигурацию token в консоли бэкенда
  • Информацию о лимите запросов в заголовках ответа API
  • Обратиться в службу поддержки для уточнения конкретных квот
При превышении лимитов API возвращает 429 Too Many Requests. Рекомендации:
  • Реализуйте управление очередью запросов
  • Добавьте механизм повторных попыток (экспоненциальная задержка)
  • Подайте заявку на более высокую квоту параллельных запросов
Нет. У каждого token есть независимые квоты на параллельные запросы без взаимного влияния. Для большей общей параллельности запросов создайте несколько token, чтобы распределить запросы.
Как правило, разумные изменения параллельных запросов предоставляются бесплатно. Однако очень высокая параллельность или услуги выделенной линии могут потребовать корпоративных индивидуальных планов - пожалуйста, обратитесь в службу поддержки для подробностей.

Советы по оптимизации параллельных запросов

Используйте очереди запросов

Реализуйте локальное управление очередью, чтобы контролировать одновременные запросы и избегать лимитов

Механизм повторных попыток при ошибках

Используйте стратегию повторных попыток с экспоненциальной задержкой при возникновении ошибок 429

Распределение по нескольким token

Создайте несколько token, чтобы распределять запросы между разными token и увеличивать общую параллельность

Отдавайте приоритет асинхронной обработке

Для сценариев без работы в реальном времени предпочитайте async API (например, для генерации видео)

Свяжитесь с нами

Чтобы запросить более высокие квоты на параллельные запросы или узнать о корпоративных услугах выделенной линии:

Поддержка по email

[email protected]Подробно опишите ваши потребности в параллельных запросах

Корпоративный WeChat

QR-код корпоративного WeChatСканируйте QR-код или Нажмите, чтобы связаться с поддержкойБыстрый ответ, общение в реальном времени

Telegram

@apiyi001Мгновенные сообщения, оперативные ответы
Пожалуйста, укажите при обращении:
  • 📊 Сценарий использования: Конкретное применение (например, пакетная генерация изображений для e-commerce, модерация контента)
  • 📈 Ожидаемая параллельность: Требуемый уровень параллельных запросов
  • 🕐 Пиковые часы: Основные периоды использования
  • 📜 Исторические данные: Текущий объем запросов и частота
Эта информация поможет нам подобрать для вас наиболее подходящий план квоты на параллельные запросы.