deepseek-v4-flash-ga-260731) соответствует DeepSeek-V4-Flash-0731,
open-source checkpoint DeepSeek, который DeepSeek перевёл в общедоступный статус 31 июля 2026 года. Архитектура
соответствует апрельскому preview (284B total / 13B activated MoE, 1M context), и
DeepSeek утверждает, что был переделан только этап post-training — однако агентные бенчмарки
значительно улучшились. APIYI завершил 21 test cases plus a dedicated dual-endpoint retest;
и Chat Completions, и Responses можно вызывать напрямую.
APIYI запустил DeepSeek V4 Flash GA: имя модели
deepseek-v4-flash-ga-260731,
доступна в группах default / svip. Обратите внимание: у этой модели по умолчанию много рассуждает —
явно передавайте thinking: {"type": "disabled"} для простых задач (см. «Управление рассуждением» ниже).Ключевые преимущества
Контекст 1M, который не подводит
Жёсткий верхний предел входных данных — 1,048,570 tokens. Тест «иголка в стоге сена» на 322K tokens дал правильное попадание за 14.77s; максимальный output — 393,216 tokens.
Два слоя кэширования
Неявный кэш не требует настройки и на втором проходе даёт попадание в кэш в 99.9% случаев; Responses добавляет цепочечное явное кэширование, которое охватывает весь предыдущий context.
Параллельные запросы без троттлинга
Все 20 параллельных запросов вернули 200, а общее время оказалось всего на 1.3s больше, чем у одного вызова — подходит для агентов с высокой concurrency и пакетных текстовых задач.
Очень низкая цена за единицу
$0.14 за input / $0.28 за output на 1M tokens, что соответствует прайс-листу BytePlus; попадание в кэш — всего $0.028.
Информация о модели
Матрица измеренных возможностей
Результаты тестирования APIYI 5 августа 2026 года (официальные заявления vs фактическое поведение):Контроль рассуждений
Эта модель по умолчанию много рассуждает — вопрос в одну строку вроде «9.11 больше 9.9» в наших тестах потребовал 263 токена рассуждения (а родственнаяdeepseek-v4-flash использовала только 44).
Отключайте это явно для простых задач:
Кэширование
Неявный кэш (автоматически на обоих эндпоинтах)
Идентичный длинный префикс даёт попадание в кэш со второго запроса: префикс длиной 15,634 token совпал по 15,616 token (99.9%), тарифицируется по $0.028 за миллион token.Явный кэш (Responses, требует цепочки)
Распространённая ошибка: повторная отправка одного и того же длинного префикса дважды с установленнымcaching приводит к тому, что
cached_tokens остаётся на 0. Правильный шаблон — записать на первом вызове, затем продолжить цепочку с
previous_response_id:
Быстрый старт
Нужен структурированный вывод? Используйте Function Call
response_format не оказывает влияния на эту модель и не вызывает ошибки — самая простая ловушка, в которую можно
попасть. Аргументы tools — это то, что на самом деле ограничивается:
Цены
Соответствует прайс-листу BytePlus и сочетается с акциями на пополнение,
чтобы ещё сильнее снизить ваши фактические затраты.
О «менее чем 1/10 от флагманской модели»: маркетинг поставщика сравнивает это с ценами V4-Pro в период preview — $1.74 / $3.48. По сравнению с текущей прайс-листовой ценой V4-Pro ($0.435 / $0.87),
эта модель — примерно 1/3, а не 1/10.
Связанные страницы
Завершения чата
OpenAI-compatible чат-эндпоинт с интерактивной песочницей
Ответы
Endпоинт Responses с цепочечным явным кэшированием
Описание запуска и полные тестовые данные
Бенчмарки, трёхстороннее сравнение скорости и ловушки, с которыми мы столкнулись
Таблица цен моделей
Цены за единицу, эндпоинты и группы для каждой модели