Skip to main content

빠른 답변

max_tokens는 모델이 단일 응답에서 생성할 수 있는 최대 token 수를 제어합니다. APIYI는 max_tokens에 대해 추가 제한을 두지 않습니다 — 이 파라미터는 상위 모델로 직접 전달됩니다. 직접 설정할 수 있으며, 설정하지 않으면 모델의 기본값이 적용됩니다.
APIYI의 방식: 저희는 max_tokens 제한을 강제하지 않습니다. 사용자가 전적으로 제어할 수 있습니다. 설정하지 않으면 각 모델은 고유한 기본 출력 동작을 사용합니다.

max_tokens가 하는 일

max_tokens(최대 출력 token 수)는 LLM API를 호출할 때 가장 흔한 매개변수 중 하나입니다. 모델에게 다음과 같이 지시합니다: 응답에서 이만큼의 token을 넘지 않도록 생성하십시오.
  • 너무 낮게 설정하면: 모델의 응답이 중간에 잘릴 수 있습니다(finish_reason: "length"를 반환함)
  • 너무 높게 설정하면: 모델이 그만큼 token을 생성하도록 강제되지는 않지만, 비용이 더 높아질 수 있습니다(일부 모델은 출력 token당 과금합니다)
  • 설정하지 않으면: 모델의 기본값을 사용합니다(제공자마다 다릅니다 — 아래 표를 참조하십시오)
Token ≠ 문자. 영어에서는 대략 1단어 ≈ 11.5 token입니다. 중국어에서는 대략 1자 ≈ 12 token입니다. 4,096 token은 대략 영어 3,000단어에 해당합니다.

OpenAI 매개변수 명명 변화

OpenAI는 서로 다른 API와 시기마다 다른 매개변수 이름을 사용해 왔기 때문에 혼동을 일으킬 수 있습니다:

이름을 바꾼 이유

OpenAI가 2024년 9월 o1 추론 모델을 출시했을 때 “숨겨진 추론 tokens”를 도입했습니다. 이 모델은 응답에 나타나지 않는 방대한 내부 추론 tokens를 생성합니다. 원래의 max_tokens는 “생성된 tokens”와 “사용자가 받는 tokens”를 모두 의미했지만, 추론 모델에서는 이 둘이 더 이상 같지 않습니다. 그래서 OpenAI는 max_completion_tokens를 도입해 “응답에서 받는 tokens의 상한”을 명시적으로 의미하도록 했습니다. 이후 Responses API는 더 직관적인 이름 max_output_tokens로 통일했습니다.
중요: Chat Completions API에서 OpenAI의 o-series 추론 모델(예: o3, o4-mini)을 사용할 때는 max_completion_tokens를 사용해야 하며 max_tokens를 사용하면 오류가 발생합니다.

max_tokens를 설정하지 않으면 어떻게 됩니까?

제공업체마다 다르게 처리합니다:
특별 참고: Anthropic Claude API의 max_tokens필수 파라미터입니다. 포함하지 않으면 API가 오류를 반환합니다. Claude 모델을 사용할 때는 항상 설정하십시오.

최대 출력 token 참고

아래는 인기 있는 모델의 최대 출력 token 한도입니다. 최신 값은 항상 공식 문서를 확인하십시오, 모델은 자주 업데이트되기 때문입니다.
공식 문서(최신 값을 확인하려면):
  • OpenAI: platform.openai.com/docs/models
  • Anthropic Claude: docs.anthropic.com/en/docs/about-claude/models
  • Google Gemini: ai.google.dev/gemini-api/docs/models
  • DeepSeek: api-docs.deepseek.com/api/create-chat-completion

권장 사항

권장 사항: 모든 API 호출에서 max_tokens명시적으로 설정하는 것을 권장합니다. 그 이유는 다음과 같습니다:
  • 모델/제공자마다 기본값이 달라 예기치 않은 잘림이 발생할 수 있습니다
  • 출력 길이를 제어하고 불필요한 token 소모를 방지합니다
  • Claude API에서는 필수이므로, 일관된 습관을 들이면 오류를 줄일 수 있습니다
  • 일반적인 설정 예시: 일반 채팅 2048-4096, 긴 형식 생성 8192-16384, 코드 생성 4096-8192

자주 묻는 질문

아니요. APIYI는 max_tokens 매개변수를 추가 제한 없이 상위 모델로 직접 전달합니다. 설정한 값이 그대로 상위 모델에 전달됩니다. 유일한 제한은 모델 자체의 최대 출력 token 상한입니다.
오류는 발생하지 않습니다 — 모델은 단지 자체 최대치까지 생성합니다. 예를 들어, GPT-4o의 최대 출력은 16,384 tokens입니다. max_tokens: 100000를 설정하더라도 최대 16,384 tokens만 출력합니다.
둘은 같은 목적을 가집니다 — 출력 token 수를 제한하는 것입니다. 차이는 명칭입니다:
  • max_tokens: OpenAI의 원래 매개변수 이름으로, GPT 시리즈의 추론이 아닌 모델에 사용됩니다
  • max_completion_tokens: 2024년 9월부터 OpenAI의 o-series 추론 모델에 사용됩니다
  • max_output_tokens: OpenAI Responses API의 통합 매개변수 이름입니다
APIYI를 통해 호출할 때는 사용하는 모델과 API 형식에 따라 적절한 매개변수 이름을 사용하십시오.
이는 모델의 출력이 max_tokens 한도에 도달했음을 의미합니다. 해결 방법:
  1. max_tokens 값을 늘리십시오
  2. 더 간결한 응답을 얻도록 prompt를 최적화하십시오
  3. 올바른 매개변수 이름을 사용하고 있는지 확인하십시오(o-series 모델은 max_completion_tokens가 필요합니다)

관련 문서

올바른 AI 모델을 선택하는 방법?

사용 사례에 가장 적합한 모델을 선택하십시오

API 동시 실행 수 제한

다양한 모델의 동시 실행 수 제한에 대해 알아보십시오

Base URL 구성 가이드

다양한 도구에서 APIYI Base URL을 구성하는 방법

APIYI token 관리

API 키를 관리하고 사용량과 잔액을 확인합니다