iXBT
Darth Sahara
Наука

DeepSeek добавила зрение в модель V4-Flash: новая модель нацелилась на уровень Claude в AI-агентах

0 просмотров
DeepSeek добавила зрение в модель V4-Flash: новая модель нацелилась на уровень Claude в AI-агентах

Экспериментальная версия V4-Flash-Vision-Exp умеет работать с текстом и изображениями в одном запросе, а в опубликованных DeepSeek тестах приблизилась к Anthropic Opus 4.8

DeepSeek 21 августа представила экспериментальную версию V4-Flash-Vision-Exp — мультимодальную модель, которая добавляет анализ изображений к возможностям линейки V4-Flash. Модель доступна через API и рассчитана прежде всего на ИИ-агентов, которым необходимо одновременно работать с текстом и визуальной информацией: скриншотами, графиками, документами и интерфейсами.

По данным DeepSeek, новинка сохраняет возможности V4-Flash в работе с агентами, рассуждениями и общими знаниями, но теперь может учитывать изображения непосредственно в процессе выполнения задачи. В опубликованных компанией тестах модель получила 83,9 балла в Terminal Bench 2.1, 57,7 в NL2Repo, 59,3 в DeepSWE, 63,6 в DSBench-Hard и 64,3 в Chartography. DeepSeek заявляет, что по совокупности результатов модель приблизилась к Anthropic Opus 4.8.

При этом сравнение не означает безусловного превосходства DeepSeek. Согласно опубликованной таблице, новая модель обошла Opus 4.8 в трёх из 11 тестов, включая DeepSWE, Agents' Last Exam и ZeroBench, но уступила в остальных. Разрыв особенно заметен в некоторых задачах: например, в NL2Repo разница составила 12 баллов, а в DSBench-Hard — 8,1 балла. Кроме того, результаты являются опубликованными самими разработчиками и зависят от конфигурации тестов, инструментов и настроек запуска.

Практически важным дополнением стал Files API. Изображение можно передать модели через Base64, внешнюю ссылку или загрузить один раз в API и затем обращаться к нему по 'file_id'. DeepSeek заявляет, что Files API предоставляется бесплатно, а изображения учитываются при тарификации V4-Flash — до 384 токенов на изображение.

Одновременно компания выпустила DeepSeek Harness 0.1.1 с поддержкой новой модели.

Для разработчиков главное изменение заключается в том, что визуальное восприятие теперь можно встроить непосредственно в тот же агентский сценарий, где модель рассуждает и вызывает инструменты. Это открывает более практичные сценарии для работы, однако V4-Flash-Vision-Exp остаётся экспериментальной моделью, поэтому её надёжность в конкретных задачах ещё предстоит проверять отдельно.

Оригинал публикацииМатериал опубликован источником «iXBT». На странице источника может быть больше деталей.
Открыть оригинал
Далее

Следующие новости

Непрерывная лента свежих материалов после статьи.

Следующие материалы появятся при прокрутке