12 августа 2026 года xAI выпустила Grok 4.6. За месяц до этого OpenAI показала GPT-5.6, а ещё месяцем раньше Anthropic — Claude Fable 5. Три флагмана за 65 дней, и к каждому релизу прилагался график, где столбик автора выше соседних.
Читатель оказывается в неудобном положении. Заголовки хором объявляют нового лидера, а собственная работа от переключения движка почему-то не ускоряется. Ниже — что стоит за этими цифрами, чем задачи отличаются друг от друга и как за полчаса проверить кандидата на своём материале, никому не веря на слово.
Три релиза за 65 дней: что произошло по фактам
Claude Fable 5 вышел 9 июня 2026 года. По документации Anthropic: окно контекста в 1 миллион токенов, до 128 тысяч токенов в ответе, цена — 10 долларов за миллион входных токенов и 50 за миллион выходных. GPT-5.6 появился 9 июля сразу тремя уровнями — Sol, Terra и Luna, — с окном около 1,05 миллиона токенов у каждого. Grok 4.6 приехал 12 августа: окно 500 тысяч токенов, знания обрезаны 1 февраля 2026 года.
Заявка xAI и её мелкий шрифт
xAI сообщает, что Grok 4.6 набирает 61 балл в Artificial Analysis Intelligence Index — вровень с GPT-5.6 Sol и примерно на балл ниже Claude Fable 5. Прирост относительно версии 4.5 заметнее всего на агентных наборах: DeepSWE 54 → 65,9, APEX-Agents 47,1 → 57,5. Это заявленные вендором числа, повторённые обзорами; независимой перепроверки на момент выхода статьи почти нет, так что считайте их приблизительными.
И сразу мелкий шрифт: сравнение проводилось при уровне «усилия» по умолчанию у Grok и на максимальных режимах у конкурентов. Формально не обман. Фактически — как сравнивать расход двух машин, где одна ехала по трассе, а вторая по городу.
Заголовок «обошли конкурента» почти всегда описывает один прогон в одной обвязке на одном наборе задач. Вашей работы в этом наборе нет.

Что бенчмарк измеряет, а что пропускает
Индекс — это взвешенная сумма, а не «ум»
Artificial Analysis Intelligence Index версии 4.1 (июнь 2026) собран из девяти наборов: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR. Веса разложены по четырём группам: агентные задачи — 34%, код — 24%, научное рассуждение — 24%, общие способности — 18%. Если ваша работа — переписка с клиентами, тексты и таблицы, вы смотрите на шкалу, где больше половины веса отдано агентам и коду. Балл честный. Он просто не про вас.
Загрязнение: часть ответов уже видели на обучении
Есть эффект посерьёзнее перекоса весов. Команда OpenAI по фронтир-оценкам обнаружила, что топовые системы способны дословно воспроизвести эталонные патчи и формулировки заданий из набора SWE-bench Verified — по одному лишь идентификатору задачи. То есть часть балла заработана памятью, а не решением. Отсюда выросло целое семейство наборов, которые обновляются быстрее, чем идёт обучение: LiveBench с ежемесячным обновлением, LiveCodeBench со свежими олимпиадными задачами, SWE-ReBench с ишью, датированными позже среза обучения.
Обвязка сдвигает результат сильнее, чем смена поколения
Одни и те же веса дают разброс в 10–20 пунктов в зависимости от того, как устроен прогон: какие инструменты доступны, сколько попыток разрешено, как сформулировано задание. Показательная пара: Claude Opus 4.5 набирает 80,9% на SWE-bench Verified и 45,9% на SWE-bench Pro. Тридцать пять пунктов разницы — это не деградация ума, а другой тест и другая обвязка вокруг тех же весов.
Разрыв в один балл — это шум
Обзоры методологии напоминают: лидеры арен человеческих предпочтений регулярно попадают в перекрывающиеся 95-процентные доверительные интервалы. Считать первое место лучше третьего в такой ситуации — примерно то же, что торговать на шуме. У самого Artificial Analysis дисциплина строже: заявленный интервал меньше ±1% при десятке повторов на каждом наборе. У большинства публичных таблиц ничего подобного нет — там интервалы просто не публикуют.
Пять осей, по которым задачи расходятся
Публичная таблица сжимает всё в одно число. Работа так не устроена — вот пять направлений, по которым запросы реально отличаются друг от друга.
Длинный контекст и его настоящая цена
Окно на миллион токенов звучит как «загружу весь проект и спрошу». Практика скромнее, потому что длина тарифицируется отдельно. У Grok 4.6 объявленные 2 и 6 долларов действуют, пока запрос не превысил 200 тысяч токенов; за порогом вся заявка целиком пересчитывается по 4 и 12 — не последняя тысяча, а все 201. У GPT-5.6 логика похожая: на длинных запросах вход дорожает вдвое, выход — примерно в полтора раза. Половина рекламного окна стоит других денег, и это стоит заложить в расчёт заранее.
Код и агентность — разные умения
Написать функцию и двадцать шагов подряд не потерять цель — не одно и то же. Первое меряют SciCode и родственные наборы, второе — Terminal-Bench, τ³-Banking, DeepSWE. Именно поэтому в индексе агентная группа весит 34%: рынок в 2026 году платит за длинные цепочки действий, а не за одиночную реплику.
Рассуждение против скорости
У Grok 4.6 четыре ступени «усилия» — low, medium, high, xhigh, — и отключить рассуждение нельзя. У Claude Fable 5 та же история: адаптивное мышление всегда включено, глубину регулируют параметром effort, а сырую цепочку рассуждений наружу не отдают вовсе. Практический вывод: режим значит не меньше, чем имя на коробке. Поэтому в Schai GPT уровень вынесен прямо в интерфейс чата — быстрый ответ и глубокий разбор не должны жить в разных сервисах.
Цена считается за задачу, а не за токен
Дешёвый вариант, который приходится переспрашивать трижды и потом править руками, обходится дороже дорогого, отвечающего с первого раза. Разрыв между GPT-5.6 Luna (0,2 и 1,2 доллара за миллион) и Claude Fable 5 (10 и 50) — пятидесятикратный по прайсу. Но если младший уровень годится на восьми задачах из десяти, а оставшиеся две вы всё равно отдаёте флагману, реальный счёт выходит совсем другим. Считайте стоимость одного законченного результата с учётом переделок — это единственная цифра, которая имеет отношение к бюджету.
Отказы, доступность и язык
Тихая, но дорогая ось. Claude Fable 5 умеет отказать: API возвращает stop_reason «refusal» как успешный ответ, и интеграцию к этому надо готовить — с запасным маршрутом. Сюда же региональная доступность, задержка до сервера и качество русского. Последнее в публичных наборах почти не представлено: все девять составляющих индекса англоязычные, так что про русские тексты таблица не говорит ничего. Отсюда следствие: полезно держать альтернативу под рукой — в Schai GPT переключение делается в один тап.
Как проверить на своих задачах за полчаса
Это самая полезная часть, и она дешевле любого чтения обзоров. Понадобится таймер, десять реальных задач и немного дисциплины.
Минуты 0–10: соберите десять своих задач
Не придумывайте тест — откройте переписку за прошлую неделю и вытащите десять настоящих запросов. Берите разнородные: пара длинных документов, пара писем, один разбор таблицы, одна задача на аккуратность в фактах, одна на код или формулу. Десять — минимум, при котором результат перестаёт быть случайностью; на пяти вы меряете везение.
Минуты 10–18: заморозьте промпт и прогоните всех
Один и тот же текст запроса уходит каждому кандидату без правок. Соблазн «чуть подкрутить формулировку под этого» рушит эксперимент: вы перестаёте сравнивать движки и начинаете сравнивать свои промпты. Если уровни живут в одном интерфейсе — например, в Schai GPT они переключаются прямо в чате, — прогоните каждый и складывайте ответы в отдельный документ.
Минуты 18–24: оцените вслепую
Уберите из ответов имена, перемешайте и оценивайте по бинарной шкале: годен без правок / годен с правкой / не годен. Никаких «оценок по десятибалльной» — они плывут от настроения. Заодно ставьте отдельный флаг на выдуманные факты: одна уверенная выдумка в отчёте для клиента дороже десяти корявых формулировок.
Минуты 24–28: посчитайте деньги и секунды
Запишите две цифры на каждую задачу: сколько минут прошло от запроса до пригодного результата и сколько стоил прогон. Считаете по API — умножьте токены на тариф; сидите на подписке — считайте минуты. Здесь обычно и вскрывается правда: «умнее» часто означает «дольше думает», и на потоковой рутине это чистый проигрыш.
Минуты 28–30: решающее правило
Переезд оправдан, если новый кандидат выигрывает минимум на трёх задачах из десяти и ни на одной не проигрывает заметно. Победа на одной-двух — шум, ровно как разница в балл на публичной таблице. И главное: сохраните эти десять задач. Следующий флагман выйдет через пару месяцев, и повторная проверка займёт уже не полчаса, а десять минут.

Где такие сравнения врут
Условия почти никогда не равны
Классика жанра: своё запускают на максимальном режиме, чужое — на дефолтном. Или наоборот, как с Grok 4.6, где дефолт своей системы сравнивают с максимумом чужих. Добавьте разное число попыток, разные подсказки, разные версии наборов — и разрыв в пять пунктов растворяется.
Что не измеряется вообще
Ни один публичный набор не покажет: держит ли система ваш тон; помнит ли контекст проекта между сессиями; насколько предсказуемо ведёт себя на однотипной рутине; что делает при неполных вводных — переспрашивает или досочиняет. Последнее в рабочем процессе решает больше, чем пара пунктов в индексе, но метрики для этого не существует.
Победитель меняется у вас под руками
Тарифы и режимы правят чаще, чем выходят новые версии: кэшированный вход у Grok 4.6 подорожал с 0,3 до 0,5 доллара за миллион, OpenAI резала цену младшего уровня в конце июля. Ответ на вопрос «какая лучше» протухает за недели. Поэтому и нужен собственный набор задач, а не вера в чужую таблицу.
Практическая раскладка
Если свести всё к правилу, получается примерно так. Массовая рутина с предсказуемым форматом — младший дешёвый уровень, и не жалейте о баллах. Длинный документ, договор, свод отчётов — большое окно контекста, но с оглядкой на порог удорожания. Многошаговая работа, где нельзя потерять цель, — флагман с высоким усилием. Черновики, письма, посты — сравните два-три варианта на своих десяти задачах: разница удивит вас в обе стороны.
Удобнее всего, когда смена уровня не требует переезда: в Schai GPT черновик набрасываете дешёвым, а разбор договора отдаёте старшему — не меняя ни привычек, ни истории переписки. Это и есть здоровое отношение к гонке: не искать одну лучшую на все случаи, а держать под рукой несколько и знать, какую куда.
Следующий флагман выйдет примерно через два месяца. К этому моменту у вас уже будут те самые десять задач — и вопрос «стал ли он лучше» перестанет быть вопросом веры.


Пока нет комментариев