deepseek-v4-flash-ga-260731) соответствует DeepSeek-V4-Flash-0731,
open-source checkpoint DeepSeek, который DeepSeek перевёл в общедоступный статус 31 июля 2026 года. Архитектура
соответствует апрельскому preview (284B total / 13B activated MoE, 1M context), и
DeepSeek утверждает, что был переделан только этап post-training — однако агентные бенчмарки
значительно улучшились. APIYI завершил 21 test cases plus a dedicated dual-endpoint retest;
и Chat Completions, и Responses можно вызывать напрямую.
APIYI запустил DeepSeek V4 Flash GA: имя модели
deepseek-v4-flash-ga-260731,
доступна в группах default / svip. Обратите внимание: у этой модели по умолчанию много рассуждает —
явно передавайте thinking: {"type": "disabled"} для простых задач (см. «Управление рассуждением» ниже).Ключевые преимущества
Контекст 1M, который выдерживает нагрузку
Жёсткий верхний предел входных данных — 1,048,570 tokens. Тест «иголка в стоге сена» с 322K-token вернулся за 14.77 с с корректным попаданием; максимальный вывод составляет 393,216 tokens.
Два слоя кэширования
Неявный кэш не требует настройки и даёт попадание 99.9% на втором проходе; Responses добавляет цепочечное явное кэширование, которое покрывает весь предыдущий контекст.
Параллельные запросы без троттлинга
Все 20 параллельных запросов вернули 200, а общее время выполнения было всего на 1.3 с больше, чем у одного вызова — подходит для агентов с высокой параллельностью и пакетных текстовых задач.
Тарификация
$0.44 input / $1.32 output на 1M tokens, а попадания в кэш — всего от $0.0136. DeepSeek перешёл на двухуровневую тарификацию по пиковым/непиковым периодам 17 August 2026; APIYI всегда тарифицирует по пиковому уровню.
Информация о модели
Матрица измеренных возможностей
Результаты тестирования APIYI 5 августа 2026 года (официальные заявления vs фактическое поведение):Контроль рассуждений
Эта модель по умолчанию много рассуждает — вопрос в одну строку вроде «9.11 больше 9.9» в наших тестах потребовал 263 токена рассуждения (а родственнаяdeepseek-v4-flash использовала только 44).
Отключайте это явно для простых задач:
Кэширование
Неявный кэш (автоматически на обоих эндпоинтах)
Идентичный длинный префикс даёт попадание в кэш со второго запроса: префикс длиной 15,634 token совпал по 15,616 token (99.9%), тарифицируется по $0.028 за миллион token.Явный кэш (Responses, требует цепочки)
Распространённая ошибка: повторная отправка одного и того же длинного префикса дважды с установленнымcaching приводит к тому, что
cached_tokens остаётся на 0. Правильный шаблон — записать на первом вызове, затем продолжить цепочку с
previous_response_id:
Быстрый старт
Нужен структурированный вывод? Используйте Function Call
response_format не оказывает влияния на эту модель и не вызывает ошибки — самая простая ловушка, в которую можно
попасть. Аргументы tools — это то, что на самом деле ограничивается:
Тарификация
DeepSeek перешёл на двухуровневую тарификацию в 00:00 17 августа 2026 года (UTC+8), при этом внепиковый тариф составляет половину
пикового. APIYI тарифицирует пиковый уровень в любое время, без привязки ко времени суток — см.
уведомление DeepSeek об изменении цен. Суммируется с
акциями на пополнение, чтобы ещё больше снизить вашу фактическую стоимость.
По поводу «менее 1/10 от флагмана»: в маркетинге поставщика сравнение идёт с предварительной ценой V4-Pro
в период предварительного просмотра — $1.74 / $3.48. Если сравнивать с текущей ценой V4-Pro ($1.32 / $3.96),
эта модель — примерно 1/3, а не 1/10.
Связанные страницы
Завершения чата
OpenAI-compatible чат-эндпоинт с интерактивной песочницей
Ответы
Endпоинт Responses с цепочечным явным кэшированием
Описание запуска и полные тестовые данные
Бенчмарки, трёхстороннее сравнение скорости и ловушки, с которыми мы столкнулись
Таблица цен моделей
Цены за единицу, эндпоинты и группы для каждой модели