Skip to main content
Seed 2.1 Turbo (dola-seed-2-1-turbo-260628)는 2026년 6월 23일 바이트댄스의 Seed 팀이 출시한 프로덕션급 텍스트 모델입니다(BytePlus 제품명: Dola-Seed-2.1-turbo). 이 모델은 높은 요청량을 처리하는 저비용, 저지연 엔터프라이즈 워크로드를 대상으로 하며, 제품군 기준 256K 컨텍스트 윈도우를 제공합니다. APIYI는 두 엔드포인트를 모두 완전히 검증했습니다(15/15 테스트 케이스 통과) — Chat Completions와 Responses를 모두 호출할 준비가 되어 있습니다.
Seed 2.1 Turbo가 APIYI에 제공됩니다: 모델명 dola-seed-2-1-turbo-260628이며, default / svip 그룹에서 사용할 수 있습니다. 이 모델은 대부분의 모델과 구분되는 점이 하나 있습니다 — 심층 추론이 기본값으로 켜져 있습니다. 지연 시간이나 비용에 민감한 호출의 경우, thinking: {"type": "disabled"}를 명시적으로 전달하십시오(아래의 “심층 추론 제어”를 참조하십시오).

핵심 강점

프로덕션급 가격

$0.50 입력 / $2.50 출력, 1M tokens당 — 동세대 Seed 2.1 Pro의 절반 가격으로, 고빈도 호출에 맞게 설계되었습니다.

두 개의 네이티브 엔드포인트

Chat Completions와 Responses를 모두 네이티브로 지원합니다. 이벤트 스트림, 추론 항목, 그리고 멀티턴 previous_response_id가 Responses 쪽에서 모두 작동합니다.

제어 가능한 심층 추론

추론 스위치와 reasoning_effort 단계(low와 high는 측정된 추론 token 수가 4배 차이입니다)가 작업별로 추론 예산을 조정할 수 있게 해줍니다.

2단계 캐싱

암묵적 캐시 적중은 2번째 요청부터 자동으로 발생합니다. Responses에서 연쇄 호출과 함께 사용하는 명시적 캐싱은 전체 이전 컨텍스트를 적중하며 지연 시간을 대략 절반으로 줄입니다.

모델 정보

검증된 기능 매트릭스

2026년 7월 21일 기준 APIYI의 측정 결과(공식 주장 대비 실제 동작):

요금

과금 참고: 추론 콘텐츠는 일반 출력 tokens으로 과금됩니다 — 바로 그렇기 때문에 작업별로 사고 깊이를 예산에 반영해야 합니다. 충전 보너스는 실효 비용을 더 낮춰 주므로, 충전 프로모션을 참고하십시오.

심층 추론 제어

이 모델에서 가장 중요한 사항은 이것입니다: 심층 추론은 기본적으로 켜져 있으므로, 한 줄짜리 질문도 먼저 수백 개의 추론 토큰을 생성합니다. 저희 테스트에서는 한 문장짜리 자기소개가 출력 토큰 444개(그중 409개는 추론) 를 사용했고, 비스트리밍에서는 7~19초가 걸렸습니다.
지연 시간이나 비용에 민감한 워크로드(지원 봇, 고빈도 짧은 Q&A, 배치 작업)에서는 "thinking": {"type": "disabled"}를 명시적으로 전달합니다. 측정 결과: reasoning 토큰이 0으로 떨어지고 응답 속도가 크게 빨라집니다.

세 가지 사고 단계, 측정값 기준

max_output_tokens 여유를 두십시오: reasoning은 출력 예산에 포함됩니다. Responses에서는 예산이 작으면 사고에 의해 전부 소진되어 호출이 status: "incomplete" (reason: length)와 함께 빈 텍스트를 반환합니다. 출력이 없는 것처럼 보이지만, 실제로는 예산 문제입니다. 1500부터 시작하고, 상위 단계에서는 4000+를 사용하십시오.

캐싱으로 비용 절감하기

모델은 서로 다른 메커니즘을 가진 두 가지 캐싱 계층을 지원합니다. 서로 혼동하지 마십시오.

암묵적 캐싱(자동, 두 엔드포인트 모두)

추가 매개변수는 필요하지 않습니다. 반복되는 긴 접두사(예: 고정된 system prompt)는 2번째 요청부터 자동으로 캐시에 적중합니다. 측정 결과, 약 2,600 token의 system prompt를 사용했을 때 2번째와 3번째 요청에서 2,360 cached_tokens가 보고되었습니다. 캐시 적중 여부는 usage.prompt_tokens_details.cached_tokens(Chat) 또는 usage.input_tokens_details.cached_tokens(Responses)에서 확인하십시오.

명시적 캐싱(Responses 전용, 체인 필요)

명시적 캐싱을 사용하는 올바른 방법은 caching: {"type": "enabled"}previous_response_id 체인과 함께 사용하는 것입니다. 2번째 턴이 이전 response id를 전달하면 이전 컨텍스트 전체가 캐시에 적중합니다(측정 결과: 7,873 token이 완전히 캐시되었고, 지연 시간은 8초에서 4초로 감소했습니다).
체인 없이 활성화하면 두 측면 모두에서 손해입니다: caching.enabled를 설정했지만 previous_response_id가 없으면, 같은 접두사를 반복해도 매번 cached_tokens가 0으로만 나옵니다. 그리고 암묵적 접두사 캐시도 더 이상 적용되지 않습니다. 캐싱 매개변수를 생략하고 암묵적 캐싱에 의존하거나, 이를 활성화한 뒤 반드시 체인으로 연결하십시오.

코드 예제

채팅 컴플리션

응답 (기본 다중 턴 + 명시적 캐싱)

모범 사례

  1. Thinking을 기본값으로 끄고, 예외적으로 켭니다: thinking: {"type": "disabled"}을 기본 설정으로 두고, 정말로 복잡한 작업에만 reasoning_effort 티어로 전환하십시오. 단순한 질문에 대해 생각 비용을 지불하지 마십시오.
  2. max_output_tokens 여유분을 확보합니다: thinking을 켠 경우 3000+, 높은 티어에서는 4000+로 설정하여 reasoning이 실제 답변을 압박하지 않도록 하십시오.
  3. 고정 system prompt를 먼저 배치합니다: 암시적 캐싱은 접두사로 일치합니다. 변경되지 않는 부분을 앞에 두면 2번째 요청부터 자동으로 비용을 절감할 수 있습니다.
  4. 멀티턴에는 Responses 체이닝을 사용합니다: previous_response_id은 history를 다시 전송하지 않으며, 명시적 캐싱과 함께 사용하면 장문 컨텍스트 대화에서 비용과 지연 시간을 모두 줄입니다.
  5. 오류 로직에서 503을 처리합니다: 잘못 철자된 model 이름이나 누락된 group 권한은 503(사용 가능한 채널 없음)을 반환하며, OpenAI의 관례적인 404를 반환하지 않습니다. 재시도 로직의 기준을 404로 두지 마십시오.

자주 묻는 질문

기본적으로 심층 추론이 켜져 있기 때문입니다. 한 줄짜리 질문도 먼저 수백 개의 reasoning token(측정값 약 400개)을 생성합니다 — 느리고 비용도 큽니다. 요청 본문에 "thinking": {"type": "disabled"}를 추가하면, 측정되는 reasoning token이 0으로 떨어집니다.
max_output_tokens가 너무 작아서 추론이 전체 예산을 소진했습니다(incomplete_details.reasonlength입니다). 예산을 1500 이상으로 올리거나 추론 등급을 비활성화하거나 낮추십시오.
단일 턴 또는 직접 관리하는 기록(가장 폭넓은 생태계 호환성)에는 Chat Completions를 사용하십시오. 다중 턴 대화, 명시적 캐싱, 또는 MCP 도구에는 Responses를 사용하십시오 — 명시적 캐싱과 MCP는 Responses에서만 지원됩니다.
명시적 캐싱은 체이닝을 요구합니다: 2턴부터는 이전 턴의 previous_response_id을 전달해야 합니다. caching.enabled와 함께 독립적으로 반복된 요청은 절대 캐시 적중하지 않으며, 암묵적 prefix 캐시도 더 이상 적용되지 않습니다. 체이닝이 앱에 맞지 않으면 caching 매개변수를 제거하고 암묵적 캐싱에 의존하십시오.
공식 기능표에는 Responses API에서의 MCP 지원이 명시되어 있습니다. APIYI의 테스트 라운드는 MCP를 다루지 않았습니다(외부 MCP 서버가 필요합니다) — 운영 전에 낮은 트래픽으로 검증하십시오.
먼저 model 이름 철자를 확인하십시오. 이 model은 알 수 없는 model 이름에 대해 404 대신 503(“no available channels”)을 반환합니다. 이름이 올바른데도 503이 계속되면 그룹 권한을 확인하십시오(이 model은 default 또는 svip가 필요합니다) 또는 지원팀에 문의하십시오.

관련 리소스

Chat 플레이그라운드

Chat Completions 엔드포인트를 대화형으로 디버그합니다

Responses 플레이그라운드

Responses 엔드포인트를 대화형으로 디버그합니다

모델 정보

사용 가능한 모든 모델과 그룹을 살펴봅니다

API 매뉴얼

완전한 API 사용 가이드입니다