빠른 답변
max_tokens는 모델이 단일 응답에서 생성할 수 있는 최대 token 수를 제어합니다. APIYI는 max_tokens에 대해 추가 제한을 두지 않습니다 — 이 파라미터는 상위 모델로 직접 전달됩니다. 직접 설정할 수 있으며, 설정하지 않으면 모델의 기본값이 적용됩니다.
APIYI의 방식: 저희는 max_tokens 제한을 강제하지 않습니다. 사용자가 전적으로 제어할 수 있습니다. 설정하지 않으면 각 모델은 고유한 기본 출력 동작을 사용합니다.
max_tokens가 하는 일
max_tokens(최대 출력 token 수)는 LLM API를 호출할 때 가장 흔한 매개변수 중 하나입니다. 모델에게 다음과 같이 지시합니다: 응답에서 이만큼의 token을 넘지 않도록 생성하십시오.
- 너무 낮게 설정하면: 모델의 응답이 중간에 잘릴 수 있습니다(
finish_reason: "length"를 반환함) - 너무 높게 설정하면: 모델이 그만큼 token을 생성하도록 강제되지는 않지만, 비용이 더 높아질 수 있습니다(일부 모델은 출력 token당 과금합니다)
- 설정하지 않으면: 모델의 기본값을 사용합니다(제공자마다 다릅니다 — 아래 표를 참조하십시오)
OpenAI 매개변수 명명 변화
OpenAI는 서로 다른 API와 시기마다 다른 매개변수 이름을 사용해 왔기 때문에 혼동을 일으킬 수 있습니다:이름을 바꾼 이유
OpenAI가 2024년 9월 o1 추론 모델을 출시했을 때 “숨겨진 추론 tokens”를 도입했습니다. 이 모델은 응답에 나타나지 않는 방대한 내부 추론 tokens를 생성합니다. 원래의max_tokens는 “생성된 tokens”와 “사용자가 받는 tokens”를 모두 의미했지만, 추론 모델에서는 이 둘이 더 이상 같지 않습니다. 그래서 OpenAI는 max_completion_tokens를 도입해 “응답에서 받는 tokens의 상한”을 명시적으로 의미하도록 했습니다.
이후 Responses API는 더 직관적인 이름 max_output_tokens로 통일했습니다.
max_tokens를 설정하지 않으면 어떻게 됩니까?
제공업체마다 다르게 처리합니다:최대 출력 token 참고
아래는 인기 있는 모델의 최대 출력 token 한도입니다. 최신 값은 항상 공식 문서를 확인하십시오, 모델은 자주 업데이트되기 때문입니다.공식 문서(최신 값을 확인하려면):
- OpenAI:
platform.openai.com/docs/models - Anthropic Claude:
docs.anthropic.com/en/docs/about-claude/models - Google Gemini:
ai.google.dev/gemini-api/docs/models - DeepSeek:
api-docs.deepseek.com/api/create-chat-completion
권장 사항
자주 묻는 질문
APIYI는 max_tokens 제한을 두고 있습니까?
APIYI는 max_tokens 제한을 두고 있습니까?
아니요. APIYI는
max_tokens 매개변수를 추가 제한 없이 상위 모델로 직접 전달합니다. 설정한 값이 그대로 상위 모델에 전달됩니다. 유일한 제한은 모델 자체의 최대 출력 token 상한입니다.max_tokens를 모델의 최대값보다 높게 설정하면 어떻게 됩니까?
max_tokens를 모델의 최대값보다 높게 설정하면 어떻게 됩니까?
오류는 발생하지 않습니다 — 모델은 단지 자체 최대치까지 생성합니다. 예를 들어, GPT-4o의 최대 출력은 16,384 tokens입니다.
max_tokens: 100000를 설정하더라도 최대 16,384 tokens만 출력합니다.max_tokens와 max_completion_tokens의 차이는 무엇입니까?
max_tokens와 max_completion_tokens의 차이는 무엇입니까?
둘은 같은 목적을 가집니다 — 출력 token 수를 제한하는 것입니다. 차이는 명칭입니다:
max_tokens: OpenAI의 원래 매개변수 이름으로, GPT 시리즈의 추론이 아닌 모델에 사용됩니다max_completion_tokens: 2024년 9월부터 OpenAI의 o-series 추론 모델에 사용됩니다max_output_tokens: OpenAI Responses API의 통합 매개변수 이름입니다
출력이 잘렸습니다(finish_reason가 'length'입니다) — 어떻게 해결합니까?
출력이 잘렸습니다(finish_reason가 'length'입니다) — 어떻게 해결합니까?
이는 모델의 출력이
max_tokens 한도에 도달했음을 의미합니다. 해결 방법:max_tokens값을 늘리십시오- 더 간결한 응답을 얻도록 prompt를 최적화하십시오
- 올바른 매개변수 이름을 사용하고 있는지 확인하십시오(o-series 모델은
max_completion_tokens가 필요합니다)
관련 문서
올바른 AI 모델을 선택하는 방법?
사용 사례에 가장 적합한 모델을 선택하십시오
API 동시 실행 수 제한
다양한 모델의 동시 실행 수 제한에 대해 알아보십시오
Base URL 구성 가이드
다양한 도구에서 APIYI Base URL을 구성하는 방법
APIYI token 관리
API 키를 관리하고 사용량과 잔액을 확인합니다