Skip to main content
GPT-6 Astra (gpt-6-astra) — флагманское новое поколение OpenAI, выпущенное 3 сентября 2026 года и предназначенное для работы с компьютером, разработки ПО, науки и длительных агентных задач: контекст на 1 050 000 tokens, максимальный вывод 128 000 tokens, настраиваемый уровень reasoning. APIYI открыл оба эндпоинта Responses и Chat Completions и в день запуска выполнил одинаковую матрицу из 74 проверок по трём линиям: официальный релей через OpenAI напрямую, официальный релей через Azure и Codex_Reverse.
GPT-6 Astra уже доступна в APIYI: имя модели — gpt-6-astra. Официальные релей-группы default / svip тарифицируются в точном соответствии с OpenAI и обслуживаются двумя официальными линиями — OpenAI напрямую и Azure; группа Codex_Reverse (ресурсы Codex, полученные обратной разработкой) тарифицируется со скидкой 0,5x. Вызов функций и агентная цепочка tools доступны только в Responses, поэтому начинайте новые проекты с него.
Chat Completions не поддерживает function tools. Запрос с tools отклоняется вышестоящей системой на линиях официального релея (400 с указанием перейти на Responses) независимо от reasoning_effort или tool_choice. Это ограничение модели, а не проблема платформы. Существующий код Chat, использующий вызов функций, необходимо перенести на Responses при переходе на Astra.

Чем он выделяется

Создан для выполнения задач

Terminal-Bench 4.0 — с 37,3% до 57,9%, ScreenSpot-Pro — с 76,9% до 92,7%, OSWorld 2.0 — 72,6%. Наибольший прирост приходится на агентные задачи; OpenAI сообщает, что среднее время выполнения сложных задач сократилось примерно с 75 до 40 минут.

1,05M контекста, подтверждено измерениями

Тест «иголка в стоге сена» на 308K символов (210 657 tokens) был правильно выполнен за 10,3 с. OpenAI сообщает примерно на 70% меньше tokens на задачу, чем у GPT-5.6 Sol, поэтому реальная разница в стоимости одной задачи меньше, чем разрыв в цене за единицу в 2,5 раза.

Полная цепочка инструментов Responses

Вызов функций поддерживает одиночные, параллельные, циклические и потоковые сценарии; размещенные инструменты web_search и code_interpreter работают; зашифрованные элементы рассуждений воспроизводятся без сохранения состояния. Строгий вывод JSON Schema в точности соответствовал набору полей.

Три линии измерены, каждому отклонению присвоена причина

Одна и та же матрица запускалась на OpenAI напрямую, Azure и Codex_Reverse. Возможности модели идентичны во всех трех вариантах; все отклонения возникают в конвейере, и на этой странице каждое из них помечено как ограничение вышестоящего провайдера, специфичное для группы или специфичное для линии.

Информация о модели

Матрица измеренных возможностей

5 сентября 2026 года, 74 проверки на линию (официальные линии использовали вариант с длинным контекстом в 70K token, чтобы снизить стоимость):

Усилия рассуждения

Та же головоломка с переправой через реку в Responses, reasoning_tokens в каждой строке:
Не отправляйте none или minimal. minimal отклоняется везде (400 на официальных линиях, переписывается в low в Codex_Reverse). none ведёт себя тремя разными способами: 400 при прямом обращении к OpenAI, принимается в Azure, а в Codex_Reverse переписывается в medium, при этом input_tokens увеличивается с 14 до 4394 (около 4,2K tokens скрытых инструкций внедряются на стороне upstream). Допустимые уровни: low / medium / high / xhigh.
Тарификация reasoning tokens осуществляется по ставке $50 / 1M output. Используйте low / medium для детерминированных шагов и оставляйте xhigh для планирования и отладки. Считывайте использование из usage.output_tokens_details.reasoning_tokens в Responses или usage.completion_tokens_details.reasoning_tokens в Chat (присутствует на официальных линиях).

Тарификация

Группы официального релея (default / svip)

Два уровня в зависимости от количества входных tokens в каждом запросе; если вход превышает 272K, весь запрос тарифицируется по второму уровню, как в OpenAI:

Группа Codex_Reverse

0.5x от официальной цены: первый уровень — $5.00 за ввод / $25.00 за вывод / $0.50 за чтение из кэша / $6.25 за запись в кэш.
APIYI соответствует тарификации провайдера позиция в позицию; скидки предоставляются через группы и бонусы за пополнение, см. Акции. Различия между группами описаны в разделе В чём разница между группами Codex, ClaudeCode и Default. Актуальные цены указаны на странице тарифов моделей.

Выбор группы

Примеры

Эндпоинт Responses (рекомендуется)

Эндпоинт Chat Completions (миграция существующего кода, без инструментов функций)

Атрибуция отклонений

Запуск одной и той же матрицы на трёх линиях распределяет каждое отклонение по одной из трёх категорий.

Ограничения upstream (идентичны на всех трёх линиях)

Каждый запрос Chat, содержащий tools, возвращает 400 на обеих официальных линиях с текстом upstream, предлагающим использовать Responses; удаление reasoning_effort или добавление tool_choice: required ничего не меняет. Группа Codex_Reverse проходит только потому, что её пайплайн внутренне преобразуется в Responses, поэтому не считайте это доказательством поддержки. Используйте Responses для вызова функций.
В 3 из 3 запросов для max на всех трёх линиях возвращалось xhigh. На официальных линиях max явно расходует больше tokens рассуждения, чем xhigh (OpenAI напрямую: 278–379 против 246, Azure: 342–516 против 320), поэтому уровень может применяться при нормализованном возврате; в Codex_Reverse различий нет. Мы гарантируем четыре уровня.
Официальные линии отклоняют устаревший max_tokens с 400 и предлагают использовать max_completion_tokens; temperature возвращает 400 как неподдерживаемый, что обычно для моделей рассуждения. Codex_Reverse принимает оба и игнорирует их. Удаляйте оба при миграции существующего кода.
Все три линии возвращают 400 «Tool ‘computer_use_preview’ is not supported with gpt-6-astra». Возможность использования компьютера, указанная в материалах о запуске, сейчас не предоставляется через API с этим типом инструмента.

Только группа Codex_Reverse (5 пунктов)

Системные сообщения в стиле инструкций и в информационном стиле дают 0/3 в каждом случае; то же содержимое в сообщении developer даёт 3/3; обе официальные линии пропускают system 3/3. Используйте developer в Chat, он работает на всех трёх линиях.
При использовании max_output_tokens: 20, max_tokens: 20 или max_completion_tokens: 20 вывод составлял 403 tokens, а Responses возвращал max_output_tokens: null. Официальные линии корректно обрезают вывод до 20 с incomplete / length. Когда ограничения важны для контроля затрат, используйте группы официального релея.
store: true всё ещё возвращает false, а второй ход возвращает 200 без памяти о первом; обе официальные линии корректно помнят контекст. В этой группе храните историю на клиенте и объединяйте её с include: ["reasoning.encrypted_content"] для воспроизведения без сохранения состояния (проверено на всех трёх линиях). GET /v1/responses/{id} везде возвращает 503.
При использовании ссылки http(s) на изображение в Chat значение prompt_tokens было 15, и модель сообщила, что не видит изображения; та же ссылка работает на обеих официальных линиях. base64 работает на обоих эндпоинтах всех трёх линий. Отправляйте изображения как base64 в Chat в этой группе.
none переписывается в medium, а input_tokens увеличивается с 14 до 4394 (4224 отнесены к usage.attribution.request_fields.instructions по кэшированной ставке); minimal переписывается в low. В этой группе также отсутствует размещённый инструмент code_interpreter (400).

Только линия Azure (1 пункт)

Запросы, содержащие web_search / web_search_preview, на линии Azure возвращают 400 с уведомлением шлюза о том, что web_search временно отключён, пока тарификация Azure Bing находится на рассмотрении, и что другие инструменты не затронуты. Линия OpenAI напрямую и группа Codex_Reverse работают нормально. Эта страница будет обновлена после восстановления.

Руководство по миграции

В Responses измените только поле model. В Chat всё, использующее tools, необходимо перенести в Responses и удалить max_tokens и temperature. Цена в 2,5 раза выше текущего промотарифа Sol ($4 / $20 → $10 / $50), поэтому сначала проведите сравнительное тестирование на агентных задачах, автоматизации и сложных инженерных задачах; повседневный чат, классификацию и извлечение данных оставьте на Terra / Luna.
messagesinput, reasoning_effortreasoning: {"effort": ...}, response_formattext: {"format": ...}, systeminstructions, max_completion_tokensmax_output_tokens. Определения tools преобразуются из {"type": "function", "function": {...}} в {"type": "function", "name": ..., "parameters": ...}. Полное сопоставление приведено в руководстве по миграции Responses.
Когда объём входных данных превышает 272K tokens, весь запрос тарифицируется по второму уровню (стоимость входных данных удваивается, выходных — в 1,5 раза). Если вам действительно не нужен весь репозиторий за один раз, поддерживайте повседневный контекст ниже 272K и размещайте стабильные префиксы в начале, чтобы они попадали в кэш (кэшированные чтения стоят одну десятую стандартной цены входных данных).
Astra — первая модель, которую OpenAI отнесла к критическому уровню кибербезопасности в своей Preparedness Framework, и публичная версия отклоняет наступательные задачи, такие как поиск уязвимостей и написание exploit-кода. Защитная работа не затронута: во всех трёх линейках запрос об инженерных практиках защиты от SQL-инъекций вернул полный ответ, охватывающий параметризованные запросы, принцип наименьших привилегий и многое другое.

Связанные материалы