Название J-Space здесь легко понять неправильно. В июле 2026 года исследователи механистической интерпретируемости действительно описали J-space как область внутренних представлений языковой модели, связанную с вербализацией, внутренним рассуждением и передачей информации между вычислительными процессами. Для ее изучения использовался Jacobian Lens, работающий с внутренними активациями модели.
J-Space Cognition Suite V3.7 устроен иначе. Это сторонний набор инструкций и вспомогательных механизмов для AI-агентов. Он не вмешивается в веса DeepSeek V4 и не получает доступ к тому J-space внутри нейросети, который исследовали при помощи Jacobian Lens. Надстройка заставляет агента иначе организовывать длинную работу: сохранять состояние задачи, держать ключевые условия в общем рабочем контексте, фиксировать промежуточные проверки, возвращаться к нерешенным вопросам и загружать дополнительные инструкции по мере необходимости.
Идея сама по себе вполне проверяемая. Если агент реже теряет контекст и раньше замечает собственные ошибки, один и тот же базовый ИИ действительно способен выполнить больше длинных заданий. Проблема начинается там, где это превращается в конкретные проценты.
В актуальной версии отчета сравнивается экспериментальная DeepSeek V4-Flash-Vision-Exp без J-Space и с J-Space V3.7. Автор приводит рост Terminal Bench 2.1 с 83,9 до 85,5, DeepSWE с 59,3 до 61,8 и AutomationBench с 25,7 до 27,6. Среднее по выбранным строкам увеличивается с 56,99 до 58,61. Для некоторых длинных задач одновременно заявлено сокращение времени выполнения: на 27% в Terminal Bench 2.1, на 28% в DeepSWE и на 32% в AutomationBench.
Это результаты автора J-Space, а не независимая оценка DeepSeek. Полные журналы всех прогонов, достаточные для проверки опубликованной таблицы, вместе с отчетом не предоставлены.
Есть и более конкретное возражение. В одной из опубликованных попыток воспроизведения Terminal Bench 2.1 использовалась самостоятельно развернутая DeepSeek V4-Flash-0731 на восьми NVIDIA H20 96 ГБ с DeepSeek Harness и J-Space. Автор проверки сообщил о 69 успешно выполненных заданиях из 89, то есть примерно 77,5%. Это заметно ниже результата, который фигурировал в тогдашней версии отчета. Само сообщение не является полноценной рецензируемой проверкой: методику и исходные журналы тоже нужно оценивать отдельно. Но после такого расхождения исходные показатели уже нельзя подавать как подтвержденный прирост.
Дополнительную путаницу создает история самого репозитория. Первая версия отчета появилась 16 августа и относилась к DeepSeek V4-Flash-0731. Затем документ неоднократно менялся. 23 августа была опубликована версия 2.0, после чего корректировались и таблицы. Текущий вариант уже использует DeepSeek V4-Flash-Vision-Exp. Поэтому цифры из разных публикаций об этом проекте могут не совпадать даже при одинаковом названии J-Space.
DeepSeek V4 при этом не имеет отношения к спору о происхождении модели: семейство официально вышло 24 апреля 2026 года, а DeepSeek предлагает V4-Pro и V4-Flash через собственный API. Неофициальной здесь является именно J-Space Cognition Suite и заявления о том, насколько сильно она улучшает работу модели.
Наиболее интересная часть проекта пока находится уровнем ниже громких сравнительных таблиц. J-Space пытается решить реальную проблему длинных агентных задач без повторного обучения модели: вынести часть состояния и контроля выполнения во внешнюю систему. Такой подход может работать, но текущие данные не позволяют приписать ему прирост на несколько пунктов в бенчмарках как установленный факт. Для этого нужны воспроизводимые прогоны с опубликованными трассировками, одинаковыми условиями для контрольной группы и независимое повторение результатов.
J-Space обещает ускорить DeepSeek V4, но с цифрами есть проблема
J-Space V3.7 приписывает DeepSeek V4 рост результатов в агентных тестах и сокращение времени выполнения задач до 32%. Эти цифры опубликованы разработчиком самой надстройки, а попытки независимого воспроизведения уже дали заметно другой результат.

Автор: Tiger3807861189
Источник: GitHub







