За "лучшим ИИ" больше нет смысла гоняться
12 августа xAI выпустила Grok 4.6. Компания делает особый упор на длинные многоэтапные задачи, работу с кодом и автономных агентов. Независимое тестирование Artificial Analysis тоже показывает заметный скачок относительно Grok 4.5: новая модель получила 61 балл Intelligence Index и вышла примерно на уровень GPT-5.6 Sol.
Уже 13 августа Google ответила Gemini 3.7 Flash. Причем слово Flash здесь может немного сбивать с толку. Это уже не облегченная модель для коротких дешевых ответов. Google позиционирует ее в первую очередь для программирования, агентных сценариев и сложных последовательностей действий.
OpenAI еще 6 августа обновила GPT-5.6 Sol в ChatGPT, улучшив точность ответов и управление глубиной рассуждения. А 13 августа показала отдельный API-режим Ultrafast, где та же модель может генерировать до 750 токенов в секунду. Поэтому говорить, что ChatGPT сейчас просто "ждет следующего большого обновления", уже не совсем правильно. Текущая GPT-5.6 Sol сама появилась совсем недавно.
Anthropic в конце июля выпустила Claude Opus 5. Компания отдельно продвигает его для программирования и профессиональной работы с информацией. По данным Anthropic, Opus 5 приблизился к более дорогому Claude Fable 5 при вдвое меньшей стоимости API. Независимые тесты тоже помещают современные Claude в верхнюю часть рейтингов сложных интеллектуальных задач.
Получается довольно странная гонка. Пока статья готовится к публикации, один из выводов уже может немного устареть.

Почему бенчмарк не говорит, какой ИИ нужен именно вам
В августе Grok 4.6 набрал 61 балл в Artificial Analysis Intelligence Index. GPT-5.6 Sol находится примерно рядом. Claude Opus 5 тоже относится к лидирующей группе. Это хорошие ориентиры, но переносить такой рейтинг напрямую на повседневную работу я бы не стал.
Причина проста. Один тест проверяет программирование. Другой математическое рассуждение. Третий работу агента с инструментами. Где-то модели дают много времени на размышление, где-то ограничивают. А пользователю может быть нужно совсем другое: переписать три абзаца без канцелярита.
Есть и более неприятная проблема. Модель может прекрасно решить задачу, которую легко проверить автоматически, а затем придумать несуществующую ссылку на научную работу. В исследовании восьми популярных чат-ботов, опубликованном в 2025 году, полностью правильными оказались только 26,5% сгенерированных библиографических ссылок. Это уже хороший повод не воспринимать высокий общий балл как гарантию фактической точности.
Поэтому мой критерий выбора выглядит иначе: насколько хорошо сервис закрывает конкретный рабочий процесс целиком.

Для текста: Claude и ChatGPT решают похожую задачу по-разному
Если мне нужно не написать текст с нуля, а привести в порядок уже существующий материал, первым кандидатом я бы сейчас рассматривал Claude. Сильная сторона современных моделей Anthropic проявляется именно там, где текст большой и его нужно сохранить, а не пересказать своими словами.
Это принципиальное различие. Задача "напиши статью о SSD" для любой современной большой модели довольно простая. Гораздо труднее дать ей готовые 20 тысяч знаков и потребовать убрать повторы, сохранить все цифры, ничего не придумать и при этом не превратить авторский текст в обезличенную инструкцию.
Claude обычно интересен именно в таких задачах: большой контекст, редактирование, анализ документов, работа с кодом и длительные рабочие процессы. Sonnet 5 при этом может оказаться рациональнее Opus 5, если максимальная глубина рассуждений не нужна. Anthropic позиционирует Sonnet 5 как агентную модель, способную работать с браузером, терминалом и другими инструментами.
ChatGPT я бы поставил немного в другое место. Его преимущество сейчас в универсальности среды. В одном диалоге можно анализировать файлы, искать информацию, работать с текстом, генерировать изображение, а затем загрузить готовую картинку и продолжить ее редактировать. Поэтому разница часто заключается уже не в качестве одного ответа, а в числе переходов между сервисами.
Для редактора это существенно. Если нужно изучить тему, открыть источники, построить структуру, проверить противоречие, доработать текст и подготовить изображение, единая рабочая среда иногда экономит больше времени, чем несколько процентов преимущества модели в одном тесте.
Мой практический выбор для текста выглядел бы так. Большой исходник и аккуратная редактура: Claude. Исследование плюс редактирование плюс работа с файлами и изображениями: ChatGPT. Короткий текст можно спокойно отдавать и другим современным моделям. Здесь разрыв уже слишком мал, чтобы ради него менять сервис.


