mimile
На главную

DeepSeek выпускает экспериментальную мультимодальную модель V4-Flash-Vision-Exp

AI-дайджест

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

DeepSeek выпускает экспериментальную мультимодальную модель V4-Flash-Vision-Exp

Китайская ИИ-компания DeepSeek выпустила экспериментальную мультимодальную модель V4-Flash-Vision-Exp, добавившую понимание изображений к текстовым возможностям. По внутренним бенчмаркам DeepSeek модель почти не уступает Opus 4.8 в агентных задачах. Релиз нацелен на визуальные агентные сценарии, с поддержкой API OpenAI и Anthropic и новым бесплатным Files API.

Ключевые факты

  • DeepSeek выпустила экспериментальную мультимодальную модель V4-Flash-Vision-Exp, расширяющую V4-Flash обработкой изображений.
  • По внутренним мультимодальным агентным бенчмаркам DeepSeek модель почти не уступает Opus 4.8.
  • Модель поддерживает форматы JPEG, PNG, GIF и WebP и определяет формат по содержимому файла, а не по имени или MIME-типу.
  • Один запрос может содержать до 600 изображений, максимальная длина стороны — 8 192 пикселя, снижаясь до 4 096 пикселей при 15 и более изображениях.
  • Каждое изображение стоит не более 384 токенов, тарификация соответствует ставкам V4-Flash.

Возможности модели

DeepSeek-V4-Flash-Vision-Exp расширяет DeepSeek-V4-Flash обработкой изображений, сохраняя текстовую производительность базовой модели в рассуждениях и знании мира, заявляет DeepSeek. Модель рассчитана на работу с различными агентными фреймворками и сочетает визуальное понимание с использованием инструментов. На практике она может описывать изображения, извлекать текст со скриншотов и анализировать диаграммы. Поддерживаются форматы JPEG, PNG, GIF и WebP, формат определяется по фактическому содержимому файла, а не по имени или заявленному MIME-типу, согласно документации API.

Интеграция с API и цены

Модель совместима с API Chat Completions и Responses от OpenAI и эндпоинтом Messages от Anthropic. DeepSeek также выпустила версию 0.1.1 своего фреймворка Harness, который поддерживает новую модель из коробки. Разработчики могут отправлять изображения через Base64, публичные URL до 32 МиБ или новый бесплатный Files API с лимитом 64 МиБ. Опциональное поле detail уменьшает изображения до 512 x 512 пикселей, экономя токены, когда высокая детализация не нужна. Перед обработкой модель автоматически нормализует изображения примерно до 800 x 800 пикселей в зависимости от соотношения сторон, каждое изображение стоит не более 384 токенов.

1 источник

DeepSeek выпускает экспериментальную мультимодальную модель V4-Flash-Vision-Exp