Skip to main content
DeepSeek V4 Flash GA (deepseek-v4-flash-ga-260731) соответствует DeepSeek-V4-Flash-0731, open-source checkpoint DeepSeek, который DeepSeek перевёл в общедоступный статус 31 июля 2026 года. Архитектура соответствует апрельскому preview (284B total / 13B activated MoE, 1M context), и DeepSeek утверждает, что был переделан только этап post-training — однако агентные бенчмарки значительно улучшились. APIYI завершил 21 test cases plus a dedicated dual-endpoint retest; и Chat Completions, и Responses можно вызывать напрямую.
APIYI запустил DeepSeek V4 Flash GA: имя модели deepseek-v4-flash-ga-260731, доступна в группах default / svip. Обратите внимание: у этой модели по умолчанию много рассуждает — явно передавайте thinking: {"type": "disabled"} для простых задач (см. «Управление рассуждением» ниже).

Ключевые преимущества

Контекст 1M, который не подводит

Жёсткий верхний предел входных данных — 1,048,570 tokens. Тест «иголка в стоге сена» на 322K tokens дал правильное попадание за 14.77s; максимальный output — 393,216 tokens.

Два слоя кэширования

Неявный кэш не требует настройки и на втором проходе даёт попадание в кэш в 99.9% случаев; Responses добавляет цепочечное явное кэширование, которое охватывает весь предыдущий context.

Параллельные запросы без троттлинга

Все 20 параллельных запросов вернули 200, а общее время оказалось всего на 1.3s больше, чем у одного вызова — подходит для агентов с высокой concurrency и пакетных текстовых задач.

Очень низкая цена за единицу

$0.14 за input / $0.28 за output на 1M tokens, что соответствует прайс-листу BytePlus; попадание в кэш — всего $0.028.

Информация о модели

Матрица измеренных возможностей

Результаты тестирования APIYI 5 августа 2026 года (официальные заявления vs фактическое поведение):
Три возможности не совпадают с официальной таблицей — учтите это перед интеграцией: structured output silently fails on both endpoints (returns 200 while ignoring the schema entirely — use Function Call when you need enforcement); the online search tool is wired but its backend keeps erroring and returns no results; MCP returns AccessDenied (an account-level built-in-tool entitlement, not a model limitation).

Контроль рассуждений

Эта модель по умолчанию много рассуждает — вопрос в одну строку вроде «9.11 больше 9.9» в наших тестах потребовал 263 токена рассуждения (а родственная deepseek-v4-flash использовала только 44). Отключайте это явно для простых задач:
reasoning_effort — это не монотонная лестница. Два вопроса × пять уровней × пять выборок:high потребовал меньше рассуждений, чем low, по обоим вопросам, а дисперсия внутри уровня (low варьировало от 150 до 1993) намного превышает различия между уровнями. Только minimal надежно — не воспринимайте low → max как регулятор затрат.

Кэширование

Неявный кэш (автоматически на обоих эндпоинтах)

Идентичный длинный префикс даёт попадание в кэш со второго запроса: префикс длиной 15,634 token совпал по 15,616 token (99.9%), тарифицируется по $0.028 за миллион token.
Неявный кэш требует байт-в-байт идентичного префикса. Любые переменные данные — метки времени, случайные ID, имена пользователей — держите в конце prompt, никогда не смешивайте их с префиксом.

Явный кэш (Responses, требует цепочки)

Распространённая ошибка: повторная отправка одного и того же длинного префикса дважды с установленным caching приводит к тому, что cached_tokens остаётся на 0. Правильный шаблон — записать на первом вызове, затем продолжить цепочку с previous_response_id:

Быстрый старт

Нужен структурированный вывод? Используйте Function Call

response_format не оказывает влияния на эту модель и не вызывает ошибки — самая простая ловушка, в которую можно попасть. Аргументы tools — это то, что на самом деле ограничивается:

Цены

Соответствует прайс-листу BytePlus и сочетается с акциями на пополнение, чтобы ещё сильнее снизить ваши фактические затраты.
О «менее чем 1/10 от флагманской модели»: маркетинг поставщика сравнивает это с ценами V4-Pro в период preview — $1.74 / $3.48. По сравнению с текущей прайс-листовой ценой V4-Pro ($0.435 / $0.87), эта модель — примерно 1/3, а не 1/10.

Связанные страницы

Завершения чата

OpenAI-compatible чат-эндпоинт с интерактивной песочницей

Ответы

Endпоинт Responses с цепочечным явным кэшированием

Описание запуска и полные тестовые данные

Бенчмарки, трёхстороннее сравнение скорости и ловушки, с которыми мы столкнулись

Таблица цен моделей

Цены за единицу, эндпоинты и группы для каждой модели