Модель представлена в двух версиях: pro с 1,6 трлн параметров и flash с 284 млрд параметров. В основе архитектура MoE (Mixture-of-Experts), позволяющая активировать лишь часть системы для более эффективной работы. DeepSeek-V4 поддерживает контекстное окно в 1 млн токенов — это эквивалент 15–20 романов. Компания утверждает, что модель лидирует среди китайских разработчиков по объёму знаний об окружающем мире и производительности.
Напомним, в январе 2025 года DeepSeek потрясла технологическое сообщество и фондовые рынки, выпустив модель, сопоставимую с ведущими американскими аналогами при значительно меньших затратах на разработку. Китай в целом переживает стремительный рост в сфере ИИ: число пользователей генеративного искусственного интеллекта в стране достигло 602 млн человек, а за 2025 год их доля выросла на 141,7%.



























