Перейти к содержимому
Новость

ZDTaichu5.0-9B делает ставку на пространственное мышление, а не на рекорды в обычном VQA

ZDTaichu5.0-9B получила 78,27 балла в MindCube-tiny против 57,60 у Qwen3.5-9B, на базе которой построена ее языковая часть. При этом в нескольких обычных тестах понимания изображений исходная Qwen3.5-9B оказалась быстрее впереди. Это хорошо объясняет, зачем вообще понадобилась еще одна мультимодальная модель на 9 млрд параметров.

Впечатлительная
ZDTaichu5.0-9B делает ставку на пространственное мышление, а не на рекорды в обычном VQA

Автор: Taichu-AI

Разработчики открыли репозиторий ZDTaichu5.0-9B с весами и кодом мультимодальной модели, рассчитанной на работу с текстом, отдельными изображениями и видео. Внутри используется языковая основа Qwen3.5-9B и визуальный энкодер NVIDIA C-RADIOv4-H. Последний содержит около 653 млн параметров, а входные изображения обрабатываются плитками по 512 пикселей, причем код допускает до 12 таких фрагментов для одного изображения.
Самая интересная часть релиза находится не в числе параметров. Разработчики явно сместили акцент в сторону понимания расположения объектов, нескольких ракурсов одной сцены и задач, где модели приходится мысленно работать с трехмерным пространством. В ViewSpatial ZDTaichu5.0-9B набрала 62,50 балла, тогда как Qwen3.5-9B получила 48,20. В MMSI-Bench результат составил 47,20 против 38,70, а в MindCube-tiny разрыв вырос до 78,27 против 57,60. Эти числа опубликованы самими разработчиками, поэтому воспринимать их как независимое сравнение нельзя.
Картина становится интереснее, если посмотреть на обычные зрительные задачи. В MMStar новая модель получила 76,80 балла против 79,70 у Qwen3.5-9B, в RealWorldQA 76,99 против 80,30, в OCRBench 85,50 против 89,20. То есть добавленная специализация не превратила ZDTaichu5.0-9B в безусловно более сильную модель при любой работе с изображениями. Здесь скорее перераспределили возможности в пользу пространственного анализа и сценариев, связанных с агентами и embodied AI.
Архитектурно это тоже не отдельная система, созданная с нуля. Языковая часть перешла с прежней схемы Qwen3 на Qwen3.5 с гибридным сочетанием Gated DeltaNet и обычного внимания в соотношении 3:1. Визуальный C-RADIOv4-H при этом, согласно конфигурации модели, не менялся. Такая конструкция интересна именно как пример специализации: разработчики сохранили уже готовые языковую и зрительную основы, а модель обучили лучше связывать визуальную информацию с пространственными отношениями и последовательностью действий.
Практический смысл этой работы находится ближе к робототехнике и визуальным агентам, чем к обычному чат-боту с картинками. Модель рассчитана на определение пространственных отношений, сопоставление нескольких изображений одной сцены, понимание доступных действий и планирование. В RoboSpatial ее заявленный результат составил 56,00 балла против 54,10 у Qwen3.5-9B, а в VSI-Bench 59,69 против 55,68. В тесте ERQA разрыв заметнее: 48,00 против 41,50.
Есть и еще одно ограничение, которое легко потерять за красивыми таблицами. Для ряда тестов пространственного мышления разработчики добавляли к запросу специальное требование сначала сформировать внутреннюю цепочку рассуждений, а затем вывести ответ в заданном формате. Это часть опубликованной методики, поэтому прямое сравнение цифр с результатами моделей, проверенных немного иначе, требует осторожности. Независимых повторных измерений ZDTaichu5.0-9B пока нет.
Веса доступны открыто, репозиторий модели занимает около 19,6 ГБ. Лицензирование при этом составное: языковая основа Qwen3.5 распространяется по Apache 2.0, а компоненты C-RADIOv4-H и итоговые веса связаны с NVIDIA Open Model License. Поэтому ZDTaichu5.0-9B интереснее рассматривать не как очередную попытку выиграть общую таблицу VLM, а как сравнительно компактную открытую основу для экспериментов, где модели нужно понимать, где находится объект, как меняется сцена между ракурсами и какое действие можно выполнить дальше.

Источник: GitHub
3 показов