Skip to main content
GPT-6 Astra(gpt-6-astra)는 2026년 9월 3일 OpenAI가 출시한 차세대 플래그십으로, 컴퓨터 사용, 소프트웨어 엔지니어링, 과학, 장기 범위 에이전트 작업을 위해 설계되었습니다. 1,050,000-token 컨텍스트, 128,000-token 최대 출력, 조정 가능한 추론 수준을 제공합니다. APIYI는 응답채팅 완성 엔드포인트를 모두 제공하며, 출시 당일 OpenAI 직접 공식 릴레이, Azure를 통한 공식 릴레이, Codex_Reverse의 세 라인에서 동일한 74개 점검 매트릭스를 실행했습니다.
GPT-6 Astra가 APIYI에서 제공됩니다: 모델 이름은 gpt-6-astra입니다. default / svip 공식 릴레이 그룹은 OpenAI와 동일한 가격으로 제공되며, OpenAI 직접 및 Azure의 두 공식 라인에서 서비스됩니다. Codex_Reverse 그룹(Codex 리버스 엔지니어링 리소스)은 0.5배 할인으로 과금됩니다. 함수 호출과 에이전트 도구 체인은 응답에서만 제공되므로, 새 프로젝트는 여기서 시작하십시오.
채팅 완성은 함수 도구를 지원하지 않습니다. tools을 포함한 요청은 reasoning_effort 또는 tool_choice와 관계없이 공식 릴레이 라인에서 업스트림에 의해 거부되며(400, 응답으로 안내), 이는 플랫폼 문제가 아닌 모델 측 제한입니다. 함수 호출을 사용하는 기존 Chat 코드는 Astra로 이전할 때 응답으로 옮겨야 합니다.

차별화되는 이유

작업 완료를 위해 구축됨

Terminal-Bench 4.0은 37.3%에서 57.9%로, ScreenSpot-Pro는 76.9%에서 92.7%로, OSWorld 2.0은 72.6%를 기록했습니다. 가장 큰 향상은 모두 에이전트 작업에서 나타났으며, OpenAI는 복잡한 작업의 평균 완료 시간이 약 75분에서 40분으로 줄었다고 보고했습니다.

측정된 1.05M 컨텍스트

308K자(210,657-token) 니들 테스트에 10.3초 만에 정확히 답변했습니다. OpenAI는 작업당 GPT-5.6 Sol보다 약 70% 적은 tokens을 사용한다고 보고하므로, 실제 작업당 비용 차이는 단가 2.5배 차이보다 작습니다.

완전한 Responses 도구 체인

함수 호출은 단일, 병렬, 왕복 및 스트리밍을 통과하며, 호스팅된 web_searchcode_interpreter 도구도 작동합니다. 암호화된 추론 항목은 상태 비저장 방식으로 재실행됩니다. 엄격한 JSON Schema 출력은 필드 집합과 정확히 일치했습니다.

세 가지 라인을 측정하고 모든 차이를 분류함

동일한 매트릭스를 OpenAI 직접 연결, Azure 및 Codex_Reverse에서 실행했습니다. 모델 성능은 세 가지 모두 동일하며, 차이는 모두 파이프라인에 있고 이 페이지에서는 각각을 업스트림 제한, 그룹별 또는 라인별로 표시합니다.

모델 정보

측정된 기능 매트릭스

2026년 9월 5일, 라인당 74개 검사(공식 라인은 비용 절감을 위해 70K-token 긴 컨텍스트 변형을 사용함):

추론 노력

Responses에서 동일한 강 건너기 퍼즐을 실행했으며, 각 줄은 reasoning_tokens입니다:
none 또는 minimal을 전송하지 마십시오. minimal은 모든 곳에서 거부됩니다(공식 라인에서는 400, Codex_Reverse에서는 low로 재작성됨). none은 세 가지 방식으로 다르게 동작합니다. OpenAI 직접에서는 400, Azure에서는 허용되며, Codex_Reverse에서는 medium로 재작성되고 input_tokens가 14에서 4394로 증가합니다(업스트림에서 약 4.2K tokens의 숨겨진 지침이 주입됨). 사용할 수 있는 수준은 low / medium / high / xhigh입니다.
추론 tokens는 1M 출력당 $50 요율로 과금됩니다. 결정론적 단계에는 low / medium을 사용하고, 계획 및 디버깅에는 xhigh을 확보해 두십시오. 사용량은 Responses에서는 usage.output_tokens_details.reasoning_tokens, Chat에서는 usage.completion_tokens_details.reasoning_tokens에서 확인하십시오(공식 라인에 존재함).

가격

공식 릴레이 그룹(default / svip)

각 요청의 입력 token 수에 따라 두 가지 티어가 적용됩니다. 입력이 272K를 초과하면 OpenAI와 동일하게 요청 전체가 두 번째 티어로 과금됩니다.

Codex_Reverse 그룹

공식 가격의 0.5배입니다. 첫 번째 티어는 입력 $5.00 / 출력 $25.00 / 캐시 읽기 $0.50 / 캐시 쓰기 $6.25입니다.
APIYI는 제공업체 가격을 항목별로 동일하게 적용합니다. 할인은 그룹 및 충전 보너스를 통해 제공되며, 프로모션을 참조하세요. 그룹 간 차이는 Codex, ClaudeCode 및 Default 그룹의 차이점에서 설명합니다. 실시간 가격은 모델 가격 페이지에서 확인할 수 있습니다.

그룹 선택

예시

Responses 엔드포인트(권장)

Chat Completions 엔드포인트(기존 코드 마이그레이션, 함수 tools 없음)

편차 귀속

동일한 매트릭스를 세 라인에서 실행하면 모든 편차가 세 가지 버킷 중 하나로 분류됩니다.

업스트림 제한(세 라인 모두 동일)

tools를 포함하는 모든 Chat 요청은 두 공식 라인에서 400을 반환하며, 업스트림 텍스트는 Responses를 사용하라고 안내합니다. reasoning_effort를 생략하거나 tool_choice: required를 추가해도 달라지는 점이 없습니다. Codex_Reverse 그룹은 파이프라인이 내부적으로 Responses로 변환하기 때문에 통과할 뿐이므로, 이를 기능 지원의 증거로 간주하지 마십시오. 함수 호출에는 Responses를 사용하십시오.
max에 대한 요청 3/3건은 세 라인 모두에서 xhigh를 에코했습니다. 공식 라인에서는 max가 xhigh보다 명확히 더 많은 추론 tokens를 사용합니다(OpenAI 직접 연결 278 대 379, Azure 342 대 516 대 320). 따라서 에코가 정규화되더라도 해당 레벨이 적용될 수 있습니다. Codex_Reverse에서는 차이가 없습니다. 네 가지 레벨을 보장합니다.
공식 라인은 레거시 max_tokens를 400으로 거부하고 max_completion_tokens를 요청합니다. temperature는 추론 모델에서 일반적인 것처럼 지원되지 않아 400을 반환합니다. Codex_Reverse는 둘 다 허용하지만 무시합니다. 기존 코드를 마이그레이션할 때 둘 다 제거하십시오.
세 라인 모두 400 “Tool ‘computer_use_preview’ is not supported with gpt-6-astra”를 반환합니다. 출시 자료의 컴퓨터 사용 기능은 현재 이 tool 유형을 통해 API에 노출되지 않습니다.

Codex_Reverse 그룹만 해당(5개 항목)

지시형 및 정보형 system 메시지는 각각 0/3에 그쳤고, 동일한 내용을 developer 메시지로 전송하면 3/3에 성공했습니다. 두 공식 라인에서는 system가 3/3으로 통과합니다. Chat에서는 developer를 사용하십시오. 세 라인 모두에서 작동합니다.
max_output_tokens: 20, max_tokens: 20 또는 max_completion_tokens: 20를 사용해도 출력은 403 tokens였고 Responses는 max_output_tokens: null를 에코했습니다. 공식 라인에서는 incomplete / length로 20에서 올바르게 잘립니다. 비용 제어를 위해 상한이 중요할 경우 공식 릴레이 그룹을 사용하십시오.
store: true는 여전히 false를 에코하며, 두 번째 턴은 첫 번째 턴을 기억하지 못한 채 200을 반환합니다. 두 공식 라인은 올바르게 기억합니다. 이 그룹에서는 클라이언트에서 기록을 유지하고 상태 비저장 재실행을 위해 include: ["reasoning.encrypted_content"]와 함께 사용하십시오(세 라인 모두에서 검증됨). GET /v1/responses/{id}는 모든 곳에서 503을 반환합니다.
Chat에서 http(s) 이미지 링크를 사용하면 prompt_tokens는 15였고 모델은 이미지를 보지 못했다고 응답했습니다. 동일한 링크는 두 공식 라인에서 작동합니다. base64는 세 라인의 두 엔드포인트 모두에서 작동합니다. 이 그룹의 Chat에서는 이미지를 base64로 전송하십시오.
nonemedium로 다시 작성되고 input_tokens는 14에서 4394로 증가합니다(캐시 요율로 usage.attribution.request_fields.instructions에 4224가 귀속됨). minimallow로 다시 작성됩니다. 이 그룹에는 호스팅된 code_interpreter tool도 없습니다(400).

Azure 라인만 해당(1개 항목)

Azure 라인에서 web_search / web_search_preview를 포함하는 요청은 Azure Bing 과금이 검토 중인 동안 web_search가 일시적으로 비활성화되었으며 다른 tools는 영향을 받지 않는다는 게이트웨이 알림과 함께 400을 반환합니다. OpenAI 직접 라인과 Codex_Reverse 그룹은 정상적으로 작동합니다. 복구되면 이 페이지를 업데이트할 예정입니다.

마이그레이션 가이드

Responses에서는 model 필드만 변경하십시오. Chat에서는 tools을 사용하는 모든 항목을 Responses로 옮기고, max_tokenstemperature을 제거해야 합니다. 가격은 Sol의 현재 프로모션 요율의 2.5배($4 / $20 → $10 / $50)이므로, 먼저 에이전트, 자동화 및 복잡한 엔지니어링 작업에서 정면 비교를 실행하십시오. 일상적인 채팅, 분류 및 추출 작업은 Terra / Luna에 유지하십시오.
messagesinput, reasoning_effortreasoning: {"effort": ...}, response_formattext: {"format": ...}, systeminstructions, max_completion_tokensmax_output_tokens. 도구 정의는 {"type": "function", "function": {...}}에서 {"type": "function", "name": ..., "parameters": ...}로 평면화됩니다. 전체 매핑은 Responses 마이그레이션 가이드에서 확인할 수 있습니다.
입력이 272K tokens를 초과하면 전체 요청이 두 번째 티어로 과금됩니다(입력은 2배, 출력은 1.5배). 전체 리포지토리가 한 번에 반드시 필요한 경우가 아니라면, 일상적인 컨텍스트는 272K 미만으로 유지하고 안정적인 접두사는 먼저 배치하여 캐시에 적중하도록 하십시오(캐시된 읽기 비용은 표준 입력 가격의 10분의 1입니다).
Astra는 OpenAI가 Preparedness Framework의 Critical 사이버보안 수준에 배치한 첫 번째 모델이며, 공개 릴리스에서는 취약점 탐색 및 익스플로잇 코드 작성과 같은 공격적 작업을 거부합니다. 방어적 작업은 영향을 받지 않습니다. 세 가지 라인 모두에서 SQL 인젝션 방어를 위한 엔지니어링 관행을 요청했을 때, 파라미터화된 쿼리, 최소 권한 등을 다루는 완전한 답변이 반환되었습니다.

관련 자료