Самая интересная часть Qwen-MM-Plugins находится не в длинном списке инструментов. Команда Qwen вынесла работу с изображениями, видео, аудио, документами и даже 3D-сценами в отдельный набор подключаемых возможностей. То есть разработчику не предлагают отказаться от привычного агента ради еще одного приложения: мультимодальность можно добавить к уже используемой среде.
В официальном репозитории Qwen-MM-Plugins сейчас перечислены семь направлений. Базовый модуль core умеет читать изображения, видео и документы с динамическим разрешением, выполнять OCR, находить объекты, сегментировать изображение, распознавать речь и обращаться к веб-поиску. Отдельные плагины предназначены для длинных видео, анализа аудио и видео, генерации и монтажа медиаконтента, управления Blender и FreeCAD. Есть и модуль для создания обучающих материалов.
Архитектура здесь интереснее самих функций. Каждая возможность состоит из skill, который сообщает агенту о доступном наборе инструментов, и при необходимости MCP-сервера, выполняющего сами операции. Благодаря этому Qwen-MM-Plugins не привязан исключительно к Qwen Code. Официальный установщик работает с Claude Code, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI, а для других оболочек предусмотрена ручная регистрация skill и MCP.
В результате мультимодальность становится свойством рабочего окружения, а не только конкретного чат-бота. Например, в одном и том же агенте можно попросить прочитать мелкий текст на 4K-скриншоте, разобрать страницу PDF, найти объекты на фотографии или получить расшифровку видео с временными метками. Для изображений, видео и документов Qwen заявляет автоматический подбор разрешения при передаче данных визуальной модели, поэтому предварительно уменьшать или вручную готовить файлы не требуется.
Есть ограничение, которое пока мешает считать систему одинаково удобной на всех платформах. В Windows официально поддерживается только запуск через WSL2, причем разработчики советуют хранить репозиторий внутри файловой системы Linux, а не на подключенном диске Windows. Нативная работа в Windows на момент публикации не подтверждена.
Часть возможностей также зависит от внешних сервисов. Для OCR, визуального диалога, распознавания речи, генерации и ряда других функций требуется ключ DashScope, а веб-поиск использует Serper API. При этом базовое чтение изображений, видео и документов, согласно документации проекта, может работать без API-ключа. Системные зависимости тоже остаются: для мультимедиа нужен ffmpeg, а отдельным функциям могут потребоваться LibreOffice, Blender, TeX Live или Chromium.
Поэтому Qwen-MM-Plugins пока интереснее воспринимать не как очередной набор инструментов для модели Qwen, а как попытку отделить мультимодальные функции от конкретной агентской оболочки. Если такой подход приживется, выбор между Codex, Claude Code или Qwen Code будет меньше зависеть от того, какая из программ сама умеет работать с изображениями и видео. Нужные возможности можно будет подключать поверх выбранного агента. Сам проект уже опубликован под лицензией Apache 2.0, но часть заявленных модулей пока имеет документацию со статусом TBD, поэтому фактическая зрелость разных возможностей заметно отличается.
Qwen научила чужих ИИ-агентов нормально работать с изображениями и видео
Qwen-MM-Plugins добавляет мультимодальные возможности уже существующим ИИ-агентам, не требуя перехода на отдельную оболочку Qwen. Плагины рассчитаны в том числе на Claude Code, Codex, Gemini CLI и Qwen Code, хотя набор функций и требования к установке пока заметно различаются.

Автор: QwenLM
Источник: GitHub







