Autoprompt добавляет к кодинг-агенту многоэтапный рабочий цикл: задача планируется, выполняется, проверяется, при необходимости исправляется и снова проходит контроль. Идея в том, чтобы не оставлять одной модели одновременно реализацию и окончательную оценку собственной работы.
В сравнении использовались OpenCode 1.18.7 и DeepSeek V4 Flash. Обычный OpenCode решил 60 из 89 заданий Terminal-Bench 2.1, версия с Autoprompt справилась с 73. Число провалов снизилось с 29 до 16, отсюда и заявленные 45%.
Но воспринимать эту цифру как доказанное преимущество Autoprompt во всех задачах рано. Для базового запуска сохранены результаты каждого из 89 заданий, а для запуска с Autoprompt остался только итоговый агрегированный результат. Повторно восстановить сравнение по каждому заданию невозможно.
Есть и цена такого подхода. Разработчик ориентирует на примерно втрое большее время выполнения и вдвое больший расход токенов, но эти величины не измерялись в том же тесте и названы оценочными. Поэтому интересен прежде всего сам результат 73 против 60 решенных задач. Заявление о снижении ошибок на 45% пока относится к конкретному эксперименту, а не к кодинг-агентам вообще.
Autoprompt сократил число провалов кодинг-агента с 29 до 16, но есть оговорка
Autoprompt показал на Terminal-Bench 2.1 снижение числа неудачных заданий на 45%. Цифра получена в одном сравнительном прогоне, причем полностью воспроизвести его результаты уже нельзя.

Автор: Spielewoy
Источник: GitHub







