У идеи Reverify есть полезное ограничение: языковой модели здесь изначально не доверяют. Если агент решил, что по определенному адресу находится нужная последовательность инструкций, импорт, строка или другая структура, одного ответа модели недостаточно. Утверждение отправляется на проверку инструментам анализа бинарных файлов, которые работают уже с самим содержимым файла. Проект распространяется как CLI и MCP-сервер и рассчитан на подключение к агентам, работающим с обратной разработкой.
Это небольшая, но принципиальная смена ролей. Модель остается полезной там, где требуется предложить направление поиска, восстановить возможную структуру или сформулировать гипотезу. Последнее слово отдается не еще одному запросу к ИИ, а проверке байтов, таблиц импорта, дизассемблированного кода или результата эмуляции. Если имеющихся данных недостаточно, предусмотрен отдельный статус INCONCLUSIVE вместо попытки заполнить пробел правдоподобным ответом.
Авторы уже проверяют этот подход на системных бинарных файлах. В одном из воспроизводимых тестов для 71 файла Windows использовалась типичная гипотеза о стандартном прологе функции. Она оказалась неправильной в 69 случаях из 71. Reverify отклонил все 69 ошибочных вариантов и ни разу не пометил неверное утверждение как VERIFIED. После передачи агенту фактических инструкций правильный вариант был получен для всех 71 файлов.
Эти цифры не доказывают, что система вообще не способна пропустить ошибку. Авторы сами приводят для результата 0 ложных подтверждений из 71 статистическую верхнюю границу около 5,1% при доверительной вероятности 95%. К тому же тест касается конкретного типа ошибки, а не любых возможных фантазий модели. Более широкая матрица проверок тоже пока остается тестовым набором самого проекта: в опубликованном прогоне для 2007 заведомо ложных утверждений не зафиксировано ни одного ложного VERIFIED.
За сутки проект успел заметно измениться по сравнению с состоянием исходной публикации от 4 сентября. В версии 0.11.0, датированной 5 сентября, разработчик добавил механизм переноса состояния между свежими сессиями Claude Code, Codex CLI, Gemini CLI и OpenCode. Проверенные и опровергнутые сведения хранятся отдельно от свободного текста модели, поэтому после очистки или переполнения контекста агент может восстановить именно подтвержденные факты, а не пересказ предыдущего разговора.
Здесь Reverify выглядит интереснее обычного требования "проверяй ответы ИИ". Проект пытается технически провести границу между гипотезой модели и установленным фактом. Насколько хорошо такой подход выдержит разбор более сложного поведения программ, зависит уже от качества используемых анализаторов и того, можно ли вообще проверить конкретное утверждение детерминированным способом. Сам Reverify этого ограничения не скрывает: для сведений о функциях, графах вызовов и перекрестных ссылках используются отдельные движки анализа, а результат может получать более слабый уровень достоверности вместо безусловного VERIFIED.
Reverify заставляет ИИ подтверждать выводы реальными байтами
Reverify не пытается сделать языковую модель осторожнее. ИИ здесь выдвигает гипотезу о бинарном файле, а отдельный набор инструментов сверяет ее с реальными данными и возвращает результат VERIFIED, REFUTED или INCONCLUSIVE.

Автор: 2akouwu
Источник: GitHub
2 показов







