Responses:DeepSeek V4 Flash 文本生成(支持显式缓存链式调用)
curl --request POST \
--url https://api.apiyi.com/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "deepseek-v4-flash-ga-260731",
"input": "用一句话说明什么是 MoE 架构。"
}
'import requests
url = "https://api.apiyi.com/v1/responses"
payload = {
"model": "deepseek-v4-flash-ga-260731",
"input": "用一句话说明什么是 MoE 架构。"
}
headers = {
"Authorization": "Bearer <token>",
"Content-Type": "application/json"
}
response = requests.post(url, json=payload, headers=headers)
print(response.text)const options = {
method: 'POST',
headers: {Authorization: 'Bearer <token>', 'Content-Type': 'application/json'},
body: JSON.stringify({model: 'deepseek-v4-flash-ga-260731', input: '用一句话说明什么是 MoE 架构。'})
};
fetch('https://api.apiyi.com/v1/responses', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.apiyi.com/v1/responses",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'model' => 'deepseek-v4-flash-ga-260731',
'input' => '用一句话说明什么是 MoE 架构。'
]),
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>",
"Content-Type: application/json"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://api.apiyi.com/v1/responses"
payload := strings.NewReader("{\n \"model\": \"deepseek-v4-flash-ga-260731\",\n \"input\": \"用一句话说明什么是 MoE 架构。\"\n}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Authorization", "Bearer <token>")
req.Header.Add("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.post("https://api.apiyi.com/v1/responses")
.header("Authorization", "Bearer <token>")
.header("Content-Type", "application/json")
.body("{\n \"model\": \"deepseek-v4-flash-ga-260731\",\n \"input\": \"用一句话说明什么是 MoE 架构。\"\n}")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.apiyi.com/v1/responses")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer <token>'
request["Content-Type"] = 'application/json'
request.body = "{\n \"model\": \"deepseek-v4-flash-ga-260731\",\n \"input\": \"用一句话说明什么是 MoE 架构。\"\n}"
response = http.request(request)
puts response.read_body{
"id": "<string>",
"model": "<string>",
"output": [
{}
],
"caching": {},
"usage": {}
}DeepSeek V4 Flash
DeepSeek V4 Flash Responses API 参考
DeepSeek V4 Flash 正式版(deepseek-v4-flash-ga-260731)Responses API 参考与在线调试:支持显式缓存链式调用,实测每轮整体命中上一轮全部上下文。
POST
/
v1
/
responses
Responses:DeepSeek V4 Flash 文本生成(支持显式缓存链式调用)
curl --request POST \
--url https://api.apiyi.com/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "deepseek-v4-flash-ga-260731",
"input": "用一句话说明什么是 MoE 架构。"
}
'import requests
url = "https://api.apiyi.com/v1/responses"
payload = {
"model": "deepseek-v4-flash-ga-260731",
"input": "用一句话说明什么是 MoE 架构。"
}
headers = {
"Authorization": "Bearer <token>",
"Content-Type": "application/json"
}
response = requests.post(url, json=payload, headers=headers)
print(response.text)const options = {
method: 'POST',
headers: {Authorization: 'Bearer <token>', 'Content-Type': 'application/json'},
body: JSON.stringify({model: 'deepseek-v4-flash-ga-260731', input: '用一句话说明什么是 MoE 架构。'})
};
fetch('https://api.apiyi.com/v1/responses', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.apiyi.com/v1/responses",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'model' => 'deepseek-v4-flash-ga-260731',
'input' => '用一句话说明什么是 MoE 架构。'
]),
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>",
"Content-Type: application/json"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://api.apiyi.com/v1/responses"
payload := strings.NewReader("{\n \"model\": \"deepseek-v4-flash-ga-260731\",\n \"input\": \"用一句话说明什么是 MoE 架构。\"\n}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Authorization", "Bearer <token>")
req.Header.Add("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.post("https://api.apiyi.com/v1/responses")
.header("Authorization", "Bearer <token>")
.header("Content-Type", "application/json")
.body("{\n \"model\": \"deepseek-v4-flash-ga-260731\",\n \"input\": \"用一句话说明什么是 MoE 架构。\"\n}")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.apiyi.com/v1/responses")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer <token>'
request["Content-Type"] = 'application/json'
request.body = "{\n \"model\": \"deepseek-v4-flash-ga-260731\",\n \"input\": \"用一句话说明什么是 MoE 架构。\"\n}"
response = http.request(request)
puts response.read_body{
"id": "<string>",
"model": "<string>",
"output": [
{}
],
"caching": {},
"usage": {}
}右侧 Playground 可直接调试:在 Authorization 填
Bearer sk-your-api-key。
默认示例已带 caching: {"type": "enabled"} 与 store: true,是显式缓存链式调用的首轮写入形态。Responses 端相比 Chat Completions 多一层显式缓存。模型能力、定价、思考控制详见
DeepSeek V4 Flash 概览。
text.format的 json_schema 不生效:返回 200 但完全无视 schema,3/3 次被代码围栏包裹导致解析失败web_search后端不可用:工具已接通(能看到web_search_call、status: completed),但 6/6 次搜索报错、不返回resultsmcp返回AccessDenied:账号 / 渠道级内置工具权限问题,换合法 server 地址结果相同- 纯文本模型,传图片会报
Model do not support image input
参数说明速查
| 参数 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
model | string | ✓ | — | 固定 deepseek-v4-flash-ga-260731 |
input | string / array | ✓ | — | 字符串或标准 Responses 消息数组,纯文本 |
max_output_tokens | int | — | 硬上限 393,216,思考内容计入 | |
store | bool | true | 链式调用必须为 true | |
previous_response_id | string | — | 上一轮响应 id,配合 caching 命中显式缓存 | |
caching.type | string | — | enabled 写入显式缓存;响应会回显该字段 | |
reasoning.effort | string | — | minimal 实测思考 tokens 恒为 0;其余档位非单调 | |
stream | bool | false | SSE 流式,实测 TTFB 约 2.31 秒 | |
tools | array | — | function 类型可用;web_search / mcp 见上方警告 |
显式缓存:必须走链式调用
常见误用:把同一段长前缀重复发两次并带上
caching,cached_tokens 会一直是 0。
显式缓存不是按前缀匹配的,必须用 previous_response_id 把会话链起来。id。
| 轮次 | 调用方式 | input_tokens | cached_tokens | 耗时 |
|---|---|---|---|---|
| 1(写入) | caching: enabled + store: true | 15,629 | 0 | 4.10s |
| 2 | + previous_response_id | 15,664 | 15,629 | 5.18s |
| 3 | + previous_response_id | 15,701 | 15,664 | 4.57s |
| 4 | + previous_response_id | 15,738 | 15,701 | 4.54s |
链式调用示例
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["APIYI_API_KEY"],
base_url="https://api.apiyi.com/v1",
)
long_doc = open("report.md").read()
# 第 1 轮:写入缓存
first = client.responses.create(
model="deepseek-v4-flash-ga-260731",
input=long_doc + "\n\n请总结这份报告的核心结论。",
max_output_tokens=800,
store=True,
extra_body={"caching": {"type": "enabled"}},
)
print(first.output_text)
# 第 2 轮起:只传新问题,链上一轮 id
second = client.responses.create(
model="deepseek-v4-flash-ga-260731",
input="其中第三节提到的风险有哪些?",
previous_response_id=first.id,
max_output_tokens=800,
store=True,
extra_body={"caching": {"type": "enabled"}},
)
print(second.output_text)
print("缓存命中:", second.usage.input_tokens_details.cached_tokens)
隐式缓存
不传caching 时隐式缓存同样生效,相同长前缀重复请求命中 99.9%(15,633 → 15,616)。
两种缓存可按场景选择:同一份前缀被很多独立请求复用走隐式缓存,
同一个会话连续多轮追问走显式缓存链式调用。
输出项类型
响应的output 是数组,可能包含以下 item:
| type | 说明 |
|---|---|
reasoning | 思考内容(reasoning.effort 非 minimal 时出现) |
message | 最终回答,文本在 content[].text |
function_call | 工具调用,带 call_id 与 arguments |
web_search_call | 搜索调用记录,当前不含 results 字段 |
授权
在 API易控制台获取的 API Key
请求体
application/json
模型 ID,固定 deepseek-v4-flash-ga-260731
可用选项:
deepseek-v4-flash-ga-260731 输入内容。可为字符串,或 OpenAI Responses 标准的消息数组。纯文本,不支持图片
最大输出 tokens,硬上限 393,216。思考内容也计入
必填范围:
x <= 393216是否存储本轮响应。使用 previous_response_id 链式调用时需要为 true
上一轮响应的 id。配合 caching 使用可整轮命中显式缓存
显式缓存开关。首轮传 {"type": "enabled"} 写入,后续轮配合 previous_response_id 命中
Show child attributes
Show child attributes
思考控制。实测 effort=minimal 时 reasoning_tokens 恒为 0;其余档位不构成单调阶梯
Show child attributes
Show child attributes
是否流式输出(SSE)。实测 TTFB 约 2.3 秒
工具列表。function 类型实测可用;web_search 已接通但后端报错,mcp 返回 AccessDenied
此页面对您有帮助吗?
⌘I