DeepSeek выпустила DeepSeek V4.1 Flash и открыла веса модели на Hugging Face. Она принимает текст и изображения, отвечает текстом и поддерживает контекст до 1 млн токенов.
Главное отличие от DeepSeek V4 Flash — новая архитектура и более компактная память для длинных запросов. Глобальный KV-кэш занимает 890 байт на токен — примерно в четыре раза меньше, чем у предыдущей Flash-модели.
Читайте также: Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?
Нейросеть DeepSeek V4.1 Flash: что умеет и как работает
В основе модели — 552 млрд параметров. Дополнительно архитектура использует 196 млрд параметров Engram — отдельного механизма памяти, который обращается к данным разреженно. При обработке входных данных модель задействует 8 млрд параметров на токен, а при генерации ответа — 16 млрд. Такой подход сокращает вычисления: модель не использует всю сеть для каждого фрагмента запроса.
Архитектура состоит из 40 слоёв: 20-слойного causal encoder и 20-слойного decoder. Декодер получает уже подготовленные состояния из энкодера и не создаёт отдельный полный кэш на каждом слое. Дополнительное сжатие и повторное использование данных уменьшают расход памяти при работе с большими документами и длинными цепочками действий.
DeepSeek V4.1 Flash можно передавать текст и изображения в одном запросе, в том числе чередовать их внутри диалога. Модель анализирует визуальные и текстовые данные вместе, но выдаёт только текст.
Разработчики также добавили числовую настройку глубины рассуждения от 1 до 100. Чем выше значение, тем больше вычислений модель тратит на ответ. Параметр позволяет отдельно настраивать быстрые запросы и сложные задачи с инструментами.
Что показали тесты DeepSeek на бенчмарках
DeepSeek проверяла модель при максимальной глубине рассуждения (reasoning_effort=100) и контексте до 1 млн токенов. В DeepSWE v1.1 она решила 74,2% задач против 54,4% у DeepSeek V4 Flash. В Terminal-Bench 2.1 результат вырос с 82,7% до 90,6%.
Компания также сравнила разные оболочки для программирующих агентов. В DeepSWE v1.1 лучший результат модели составил 74,2% с mini-SWE-agent (выше, чем у Claude Opus 5 и GPT-5.6 Sol), а в Terminal-Bench 2.1 — 90,6% с минимальной оболочкой DeepSeek Harness.
Как получить доступ
Скачать веса DeepSeek V4.1 Flash и код для самостоятельного запуска можно на странице модели на Hugging Face. Репозиторий распространяется по лицензии MIT. Для запуска доступны инструкции для Transformers, vLLM, SGLang и Docker. Модель также доступна через API DeepSeek.
Ранее писали, что DeepSeek прокачала V4-Pro — она получила контекстное окно на 1 млн токенов, максимальный объём ответа до 384 тыс. токенов и управление глубиной рассуждений через API.
Источник / изображения: huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash





