요청 측(base_url, auth, 모델 전환)은 Compatible Mode Calls에서 다룹니다. 이 페이지는 오직 응답 측만 다룹니다: 반환되는 내용을 어떻게 파싱하는지에 관한 설명입니다.
두 가지 모드, 하나의 엔드포인트
동일한/v1/chat/completions 엔드포인트이며, stream 플래그만 형식을 바꿉니다:
비스트리밍 응답
안정적인 구조입니다 —choices[0].message.content만 읽으면 됩니다:
스트리밍 응답 (SSE)
스트리밍은 청크를 Server-Sent Events로 한 줄에 하나씩data: {...} 형태로 전송하며, data: [DONE]로 끝납니다:
delta.content를 누적하는 것입니다:
통합 참고 사항: 몇 가지 차이는 있지만, 일관되게 처리할 수 있습니다
모델마다 스트리밍 세부 사항은 조금씩 다르지만, 아래 규칙을 따르면 하나의 코드 경로로 모두 처리할 수 있습니다.견고한 참조 파서
원시 SSE를 직접 처리할 때(SDK를 사용하지 않을 때), 이는 위의 모든 차이를 포괄합니다:추론 모델(grok, qwen, glm 등)은 먼저
delta.reasoning_content(사고의 흐름)를 스트리밍하고, 그다음 delta.content(답변)을 스트리밍합니다. 위의 파서는 content만 읽으므로, 추론 과정은 자동으로 건너뜁니다. 추론 과정을 표시하려면 추론 모델 출력을 참조하십시오.사용 및 과금
usage는 비스트리밍 응답에서는 인라인으로 반환되며, 스트리밍에서는 후행 청크로 도착합니다(위 표의 위치 — “존재할 때마다 기록”).- 필드 구성은 다릅니다: OpenAI 계열은
completion_tokens_details를 추가하고, Gemini/Claude는input_tokens/output_tokens를 추가하며, 추론 모델은reasoning_tokens를 추가합니다. 세 가지 표준 필드인prompt_tokens/completion_tokens/total_tokens를 기준으로 삼으십시오.
관련 링크
- 같은 그룹: 호환 모드 호출 · 추론 모델 출력 · 기본 호출
- 모델 및 가격: 모델 및 가격 개요
- token 가져오기 / 관리:
https://api.apiyi.com/token