DeepSeek выпускает экспериментальную мультимодальную модель V4-Flash-Vision-Exp

DeepSeek

модели/LLM офиц. + СМИ 4 ист. ~1 мин

DeepSeek выложила V4-Flash-Vision-Exp на своей API-платформе как первый мультимодальный релиз: модель достигает уровня V4-Flash на текстовых задачах (агенты, рассуждения, world knowledge) и добавляет понимание изображений с тарификацией до 384 токенов за изображение. На бенчмарке DeepSeek для мультимодальных агентов vision-модель идёт вровень с Opus-4.8 и в день релиза получает бесплатный Files API для повторного использования изображений и поддержку DeepSeek Harness 0.1.1.

Почему это важно

DeepSeek выходит за пределы чистого текста в мультимодальную гонку по ценам уровня Flash; в день релиза попало в китайскую финансовую прессу (Caixin), которая подаёт это как начало мультимодальной конкуренции наряду с Moonshot и Qwen.

Важность: 3/5

Первый мультимодальный релиз frontier-лаборатории из Китая; 4 независимых источника (2 официальных + 2 первичной прессы)

Источники