За "лучшим ИИ" больше нет смысла гоняться
12 августа xAI выпустила Grok 4.6. Компания делает особый упор на длинные многоэтапные задачи, работу с кодом и автономных агентов. Независимое тестирование Artificial Analysis тоже показывает заметный скачок относительно Grok 4.5: новая модель получила 61 балл Intelligence Index и вышла примерно на уровень GPT-5.6 Sol.
Уже 13 августа Google ответила Gemini 3.7 Flash. Причем слово Flash здесь может немного сбивать с толку. Это уже не облегченная модель для коротких дешевых ответов. Google позиционирует ее в первую очередь для программирования, агентных сценариев и сложных последовательностей действий.
OpenAI еще 6 августа обновила GPT-5.6 Sol в ChatGPT, улучшив точность ответов и управление глубиной рассуждения. А 13 августа показала отдельный API-режим Ultrafast, где та же модель может генерировать до 750 токенов в секунду. Поэтому говорить, что ChatGPT сейчас просто "ждет следующего большого обновления", уже не совсем правильно. Текущая GPT-5.6 Sol сама появилась совсем недавно.
Anthropic в конце июля выпустила Claude Opus 5. Компания отдельно продвигает его для программирования и профессиональной работы с информацией. По данным Anthropic, Opus 5 приблизился к более дорогому Claude Fable 5 при вдвое меньшей стоимости API. Независимые тесты тоже помещают современные Claude в верхнюю часть рейтингов сложных интеллектуальных задач.
Получается довольно странная гонка. Пока статья готовится к публикации, один из выводов уже может немного устареть.

Почему бенчмарк не говорит, какой ИИ нужен именно вам
В августе Grok 4.6 набрал 61 балл в Artificial Analysis Intelligence Index. GPT-5.6 Sol находится примерно рядом. Claude Opus 5 тоже относится к лидирующей группе. Это хорошие ориентиры, но переносить такой рейтинг напрямую на повседневную работу я бы не стал.
Причина проста. Один тест проверяет программирование. Другой математическое рассуждение. Третий работу агента с инструментами. Где-то модели дают много времени на размышление, где-то ограничивают. А пользователю может быть нужно совсем другое: переписать три абзаца без канцелярита.
Есть и более неприятная проблема. Модель может прекрасно решить задачу, которую легко проверить автоматически, а затем придумать несуществующую ссылку на научную работу. В исследовании восьми популярных чат-ботов, опубликованном в 2025 году, полностью правильными оказались только 26,5% сгенерированных библиографических ссылок. Это уже хороший повод не воспринимать высокий общий балл как гарантию фактической точности.
Поэтому мой критерий выбора выглядит иначе: насколько хорошо сервис закрывает конкретный рабочий процесс целиком.

Для текста: Claude и ChatGPT решают похожую задачу по-разному
Если мне нужно не написать текст с нуля, а привести в порядок уже существующий материал, первым кандидатом я бы сейчас рассматривал Claude. Сильная сторона современных моделей Anthropic проявляется именно там, где текст большой и его нужно сохранить, а не пересказать своими словами.
Это принципиальное различие. Задача "напиши статью о SSD" для любой современной большой модели довольно простая. Гораздо труднее дать ей готовые 20 тысяч знаков и потребовать убрать повторы, сохранить все цифры, ничего не придумать и при этом не превратить авторский текст в обезличенную инструкцию.
Claude обычно интересен именно в таких задачах: большой контекст, редактирование, анализ документов, работа с кодом и длительные рабочие процессы. Sonnet 5 при этом может оказаться рациональнее Opus 5, если максимальная глубина рассуждений не нужна. Anthropic позиционирует Sonnet 5 как агентную модель, способную работать с браузером, терминалом и другими инструментами.
ChatGPT я бы поставил немного в другое место. Его преимущество сейчас в универсальности среды. В одном диалоге можно анализировать файлы, искать информацию, работать с текстом, генерировать изображение, а затем загрузить готовую картинку и продолжить ее редактировать. Поэтому разница часто заключается уже не в качестве одного ответа, а в числе переходов между сервисами.
Для редактора это существенно. Если нужно изучить тему, открыть источники, построить структуру, проверить противоречие, доработать текст и подготовить изображение, единая рабочая среда иногда экономит больше времени, чем несколько процентов преимущества модели в одном тесте.
Мой практический выбор для текста выглядел бы так. Большой исходник и аккуратная редактура: Claude. Исследование плюс редактирование плюс работа с файлами и изображениями: ChatGPT. Короткий текст можно спокойно отдавать и другим современным моделям. Здесь разрыв уже слишком мал, чтобы ради него менять сервис.
Для поиска информации я бы вообще не выбирал модель по качеству ее памяти
У генеративных моделей есть очень соблазнительная особенность. Даже неправильный ответ они способны написать гладко и уверенно.
Поэтому для поиска свежей информации значение имеет не столько сама LLM, сколько то, умеет ли конкретный продукт искать в интернете, показывать источники и возвращаться к ним во время анализа.
Grok исторически находится в сильной позиции при работе с текущей повесткой благодаря связи с X и собственным поиском. Но эту возможность легко переоценить. Социальная сеть дает скорость, а не автоматически достоверность.
Gemini получает другое преимущество: экосистему Google и мультимодальность. ChatGPT развивается в сторону объединения поиска, исследования и работы с подключенными источниками. Для серьезной статьи мне важнее именно эта часть, а не способность модели назвать дату из внутренних весов.
Правило здесь довольно жесткое: факт, который может измениться, должен проверяться по источнику независимо от имени модели.
Gemini сейчас особенно интересен не как чат
Gemini долго было легко воспринимать как "Google-версию ChatGPT". В 2026 году такое описание уже плохо работает.
Gemini 3.7 Flash умеет принимать текст, изображения, видео, аудио и PDF. Google также дает разработчикам контекст до миллиона токенов. Это меняет класс задач, которые удобно передавать модели. Например, можно анализировать длинную запись, большой комплект документов или мультимедийный материал в рамках одного рабочего процесса.
Еще интереснее скорость. По измерениям Artificial Analysis, Gemini 3.7 Flash относится к очень быстрым рассуждающим моделям. Для одиночного вопроса это приятная мелочь. Для агента, который за одну задачу делает десятки последовательных обращений к модели, скорость уже напрямую влияет на удобство работы.
Поэтому Gemini я бы рассматривал в первую очередь тем, кто работает внутри сервисов Google, анализирует мультимедийные данные или строит автоматизированные процессы. Покупать подписку исключительно ради того, чтобы задавать обычные вопросы в чате, намного менее убедительный сценарий.

А что с Grok 4.6
Grok за последний год прошел довольно необычный путь. Ранние версии сервиса чаще обсуждали из-за характера ответов и интеграции с X. Grok 4.6 уже пытается конкурировать в совсем другой области: длительные агентные задачи, программирование и профессиональная работа.
По Artificial Analysis новая версия прибавила пять пунктов относительно Grok 4.5. Рост для одного обновления заметный. При этом API Grok остается дешевле ряда моделей сопоставимого класса.
Есть сценарий, где я бы выбрал Grok почти без колебаний: анализ происходящего прямо сейчас в X и вокруг него. Когда нужно понять, откуда началось обсуждение, кто первым опубликовал материал и как развивается реакция, близость сервиса к этой платформе дает понятное преимущество.
Для обычной редакторской работы преимущество менее очевидно. Тут Grok конкурирует уже не с "старыми чат-ботами", а с очень зрелыми рабочими средами OpenAI, Google и Anthropic.

Российские ИИ: GigaChat и Алиса AI уже нельзя списывать в отдельную низшую лигу
С российскими моделями есть странный эффект. В англоязычных сравнениях их почти нет, поэтому легко решить, что технически они до сих пор находятся где-то далеко позади ChatGPT.
Сейчас картина сложнее.
У Сбера есть GigaChat 3 Ultra. По официальной документации, модель доступна физическим лицам в Freemium-режиме. Семейство GigaChat изначально серьезно ориентировано на русский язык, а исследования разработчиков описывают отдельную адаптацию моделей под русский корпус и русскоязычные тесты.
У Яндекса пользовательский продукт сейчас фактически строится вокруг Алисы AI. Она работает с файлами, поиском, генерацией текста и изображений. Летом Яндекс также добавил память о диалогах, адаптацию стиля общения и более длинные сценарии выполнения задач.
Но здесь я сознательно не буду рисовать таблицу с баллами "Алиса против GigaChat". В текущей рабочей среде у меня нет интерактивного доступа к их пользовательским чатам, чтобы честно прогнать обе системы через один набор промптов. Выдать результаты чужого сравнения за собственный тест было бы хуже, чем вообще отказаться от оценки.
По функциям выбор уже можно сделать. GigaChat интереснее рассматривать как самостоятельную русскоязычную LLM и API. Алиса AI сильнее привязана к пользовательской экосистеме Яндекса и привычному формату помощника.
Для пользователей из России у обоих есть еще одно преимущество, которое невозможно увидеть в бенчмарке: нормальный доступ без иностранной карты и дополнительных способов обхода региональных ограничений. Иногда этот пункт важнее разницы в несколько процентов на тестах.
Где сейчас генерировать изображения
С изображениями ситуация еще интереснее, чем с текстом. Одного абсолютного победителя здесь тоже нет.
Midjourney в июле перешел на V8.2. Разработчики улучшили качество изображения, эстетику и персонализацию. У Midjourney по-прежнему сильна сама художественная сторона генерации: когда нужен выразительный кадр, концепт или стилизованное изображение, сервис остается одним из первых кандидатов.
Но если мне требуется не придумать картинку с нуля, а изменить существующую, я бы чаще начинал с ChatGPT Images. Текущая версия умеет добавлять и удалять объекты, менять отдельные области изображения, сохранять композицию и работать с текстом внутри изображения. OpenAI в апреле выпустила Images 2.0, а генерация доступна непосредственно внутри ChatGPT.
Для практической работы это огромная разница. Написать "оставь устройство без изменений, убери надписи на фоне и сделай формат 16:9" намного удобнее, чем заново собирать весь промпт и надеяться, что генератор воспроизведет исходный объект.
У Google есть Nano Banana Pro и другие модели семейства Gemini Image. Их сильная сторона тоже заключается в сочетании генерации и редактирования. Для человека, который уже использует Gemini, это логичнее, чем подключать еще один сервис только ради изображений.
Если задача связана с текстом на плакате, схемой, карточкой товара или инфографикой, я бы обязательно сделал несколько проб в разных генераторах. Ошибки с буквами никуда полностью не исчезли.
Мой выбор получается таким:
для художественного изображения и работы со стилем: Midjourney;
для точечного изменения существующей картинки: ChatGPT Images;
для генерации внутри экосистемы Google: Gemini и Nano Banana;
для человека, которому нужен один сервис и для текста, и для изображений: ChatGPT сейчас выглядит наиболее удобным вариантом.
Это не рейтинг качества картинки. Это выбор рабочего процесса.
Для программирования выбор снова меняется
Здесь сейчас интересны сразу четыре семейства: Claude, GPT-5.6, Grok 4.6 и Gemini 3.7 Flash.
GPT-5.6 Sol хорошо показывает себя именно в агентном программировании. В испытаниях Artificial Analysis модель заняла лидирующие позиции в их Coding Agent Index. Claude Opus 5 Anthropic также ориентирует на программирование и длительную работу с кодовой базой. Grok 4.6 сделал большой шаг именно в агентных тестах, а Google фактически называет программирование одной из главных задач Gemini 3.7 Flash.
Из этого уже трудно сделать совет уровня "программистам нужен Claude".
Гораздо разумнее смотреть, где модель работает. Если весь проект находится в Codex, преимущество получает GPT. Если разработка строится вокруг Claude Code, логично использовать Claude. Если критична скорость многочисленных агентных вызовов, интереснее становится Gemini Flash. Если нужен недорогой API для агента, стоит смотреть на Grok.
Модель все чаще становится одной деталью среды разработки.
Что я бы выбрал для разных задач
Если платить только за один универсальный сервис, я бы начал с ChatGPT. Причина не в том, что GPT обязательно даст лучший ответ на каждый запрос. Он закрывает слишком много разных задач в одном месте: исследование, документы, код, изображения и их редактирование.
Если работа почти полностью состоит из больших текстов, документов и кода, я бы обязательно сравнил его с Claude. На длинном редактировании разница в поведении моделей заметнее, чем на обычных вопросах.
Если рабочая жизнь проходит в сервисах Google или приходится постоянно разбирать видео, аудио, PDF и большие массивы информации, Gemini выглядит все интереснее. После появления 3.7 Flash воспринимать его как отстающего конкурента уже точно не стоит.
Grok имеет смысл попробовать тем, кому нужна текущая информация из X, агентные задачи или сравнительно недорогой API.
GigaChat и Алиса AI становятся особенно интересными там, где иностранные сервисы использовать неудобно, а качество русского языка и местная экосистема важнее места в международном бенчмарке.
Для изображений я бы вообще не пытался назначать одну нейросеть основной навсегда. Midjourney, ChatGPT Images и Gemini решают немного разные задачи.
Почему я не советую выбирать ИИ один раз и надолго
Самое интересное изменение 2026 года связано даже не с ростом результатов моделей.
Еще пару лет назад пользователь выбирал между ChatGPT и несколькими альтернативами. Сейчас правильнее выбирать инструмент для каждой стадии работы.
Найти и сопоставить свежие источники можно в одном сервисе. Проверить огромный документ в другом. Отредактировать текст в третьем. Изображение сделать в четвертом. А затем через месяц схема снова изменится, потому что одна из компаний выпустит новую модель.
Поэтому универсального ответа на вопрос "какой ИИ лучший" сейчас нет. Зато появился более полезный вопрос: какой сервис убирает больше ручной работы именно из моей задачи?
Для текста это может быть Claude. Для исследовательской работы и смешанных задач ChatGPT. Для мультимедиа и Google-среды Gemini. Для X и части агентных сценариев Grok. Для российского пользователя вполне могут оказаться достаточными GigaChat или Алиса AI.
И если завтра очередная модель станет первой в бенчмарке, менять привычный инструмент только из-за этого я бы точно не стал.








