Статья

ИИ решает математические задачи: что на самом деле произошло в 2026 году

ИИ решает математические задачи: что на самом деле произошло в 2026 году

Борис ЛанскойБорис Ланской·3 ч назад·
1
··0·
Коротко: за 2026 год модели OpenAI, Google DeepMind и Anthropic закрыли несколько десятков открытых математических задач — почти все из них короткие задачи Пала Эрдёша, — а исследовательская версия Claude заметно улучшила одну из частичных оценок вокруг гипотезы Римана. Результаты настоящие, часть уже проверили живые математики. Но ни одна из великих гипотез не доказана, и сами лаборатории этого не утверждают. Я физик, а не математик, и разбирался как заинтересованный сосед по цеху. Дальше — что произошло по фактам, где кончается факт и начинается пресс-релиз, и почему всё это не поможет вашему ребёнку с домашкой.

Кто такой Пал Эрдёш и почему все считают именно его задачи

Пал Эрдёш (1913–1996) — венгерский математик, у которого не было ни дома, ни постоянной должности, ни имущества сверх того, что помещалось в чемодан. Он ездил по коллегам, жил у них по несколько недель, работал и уезжал дальше, оставив около 1500 статей более чем с 500 соавторами. Главное наследство он оставил не в статьях, а в вопросах. Эрдёш придумывал задачи сотнями и назначал за них премии из своего кармана — от десяти долларов до десяти тысяч, по своей оценке трудности. Формулируются они в одну-две строки и понятны школьнику: сколько точек на плоскости могут стоять так, чтобы между ними было много одинаковых расстояний. А решаются десятилетиями или не решаются вовсе. В 2023 году математик Томас Блум собрал их в одну базу — erdosproblems.com. На начало сентября 2026 года там 1220 задач, из них 576 (47%) помечены решёнными. Остальные открыты — точнее, никто из специалистов не нашёл решения в литературе, что не совсем одно и то же.

Какие математические задачи ИИ решил в 2026 году

В мае 2026 года внутренняя модель OpenAI опровергла гипотезу Эрдёша о единичных расстояниях, сформулированную в 1946 году. Модель построила контрпример — семейство наборов точек, где пар на одинаковом расстоянии заметно больше, чем предполагал Эрдёш. Причём пошла она не через привычную геометрию: она связала задачу с алгебраической теорией чисел и использовала критерий Голода — Шафаревича, доказанный в 1964 году. Именно это и удивило математиков — не сам факт ответа, а выбор инструмента.
Если бы эту статью написал человек и подал в Annals of Mathematics, я бы рекомендовал её к публикации без малейших колебаний. — Тимоти Гауэрс, филдсовский лауреат
Дальше события пошли плотно. В январе 2026 года команда Google DeepMind из 24 человек прогнала через модель около 700 гипотез: четыре задачи решены, ещё для девяти нашлись старые решения, о которых все забыли. В августе OpenAI объявила, что её модель Astra дала десять математических продвижений, среди них решения трёх задач Эрдёша. Отдельная линия — любители и студенты с публичными чат-ботами: до середины 2026 года большинство новых результатов в базе Блума приходило именно от них.
Кто, что решил и кто это проверял: результаты ИИ-лабораторий в математике за 2026 год
То же строкой: OpenAI (май) — опровергнута гипотеза о единичных расстояниях, препринт разбирали математики со стороны; Astra (август) — 3 задачи Эрдёша из 10 продвижений, полной внешней рецензии нет; DeepMind (январь) — 4 задачи плюс 9 забытых решений, проверка людьми; Anthropic (август) — дзета-функция с 41,6% до 67,2%, два внешних рецензента и проверка в Lean.

Почему падают именно задачи Эрдёша, а не математика вообще

Здесь важно быть честным. Задачи Эрдёша — не случайная выборка из математики, а почти идеальный полигон для машины. Они короткие: условие помещается в абзац, его не надо реконструировать из десятка предыдущих статей. Они формализуемые: расплывчатых понятий почти нет, всё сводится к числам, множествам и графам. Они лежат в комбинаторике, теории чисел и теории графов — там рассуждение чаще складывается из множества обозримых шагов, а не из одной длинной идеи, которую надо удерживать целиком. Ответ во многих случаях проверяем: нашёл контрпример — предъяви набор точек и посчитай. И под них есть готовая размеченная база: тысяча с лишним задач со статусом «открыта/решена» и ссылками на литературу. Сложите это вместе — получится не «ИИ понял математику», а «ИИ очень хорош в задачах ровно такого типа». Разница принципиальная. Построить теорию, придумать новое понятие, объяснить, почему вопрос вообще стоит задавать, — этого в списке побед пока нет. Модели закрывают вопросы, которые кто-то сформулировал за них.

ИИ доказал гипотезу Римана? Нет — вот что произошло на самом деле

10 августа 2026 года Anthropic опубликовала результат, вокруг которого сразу поднялся шум с заголовками про Римана. Разберём спокойно. Есть дзета-функция Римана — функция, через которую выражается распределение простых чисел. У неё есть нули: точки, где она обращается в ноль. Гипотеза Римана (1859) утверждает, что все нетривиальные нули лежат на одной вертикальной прямой — её так и называют критической. Это одна из семи «задач тысячелетия», приз за неё — миллион долларов. Доказать «все» никто не может уже 167 лет. Поэтому доказывают частичные утверждения: хотя бы такая-то доля нулей лежит на прямой. В 1989 году Брайан Конри довёл гарантированную долю до 40%, к 2018-му усилиями нескольких групп её подняли до 41,6% — примерно 1,7 процентного пункта за 31 год. Исследовательская версия Claude подняла её до 67,2%, соединив два направления работ, которые до неё никто не догадался совместить. Это сильный результат. Но 67,2% — по-прежнему «не все»: оставшаяся треть нулей не покрыта, и сам подход не масштабируется до ста процентов. Он даёт оценку снизу, а гипотеза требует утверждения обо всех нулях сразу.
Шкала доказанной доли нулей дзета-функции на критической прямой: 40% (1989) → 41,6% (2018) → 67,2% (2026) и недостижимые 100%
Мы не ожидаем, что приёмы, использованные Claude, приведут к доказательству гипотезы Римана. — из публикации Anthropic

Как ИИ решает математическую задачу: 60 подагентов и 31 миллион токенов

Самое интересное здесь — не результат, а то, как он получен: представление «модель подумала и выдала ответ» не работает совсем. По описанию Anthropic, работа заняла две сессии и около 31 миллиона выходных токенов. Полтора дня система координировала около шестидесяти собственных подагентов: двое выдали ключевые математические идеи, тринадцать — вспомогательные, тридцать безуспешно пытались придумать что-то новое, тринадцать работали проверяющими, двое писали черновик статьи. Порядка 650 идей были испробованы и отброшены, выполнено около 2400 команд в командной строке и тысячи численных проверок против уже известных нулей дзета-функции. То есть «ИИ решил» означает здесь организованный перебор гигантского пространства подходов, с внутренней критикой и отбраковкой, работающий полтора суток без перерыва. Это ближе к работе исследовательского института, чем к вспышке озарения, — и объясняет, почему такое пока не запускают из чата.

Кто проверяет доказательства ИИ и что такое Lean

Результат по дзета-функции читали двое математиков самой Anthropic — Левент Альпёге и Ральф Фурман, — и в короткие сроки его отсмотрели внешние специалисты: Брайан Конри (тот самый, чей рекорд 1989 года) и Дэн Голдстон. Сверх того доказательство формализовали в Lean. Это язык, на котором утверждение записывается настолько строго, что его проверяет компьютер: не «выглядит убедительно», а «каждый шаг выводится из предыдущих по правилам». Опирается он на Mathlib — большую библиотеку уже формализованной математики. Если формализация прошла проверку, ошибки в логике там нет. Совсем. Формальная проверка снимает главный страх «а вдруг машина складно соврала». Но она трудоёмка, и делают её далеко не для всех результатов: из перечисленных в этой статье побед в Lean проверена одна.

Тревожная часть: доказательства, которые никто не прочитал

Томас Блум, хранитель базы задач Эрдёша, формулирует проблему прямо.
ИИ активно пользуются люди, которые не математики. Они любят действовать быстро: попросили ИИ проверить, текст растёт и растёт. Мы видим всё больше таких статей на 100–200 страниц... Но ни один человек их не прочитал и не собирается. — Томас Блум
Математика веками держалась на том, что доказательство читают коллеги. Это не бюрократия, а способ отличить истину от правдоподобия. Когда поток текстов растёт быстрее, чем способность людей их читать, механизм захлёбывается: формально «доказано», фактически — не проверено никем. Отсюда и интерес к Lean: если людей не хватает, пусть логику проверяет машина, которой всё равно, сколько там страниц. И оговорка, о которой стоит помнить: почти все цифры в этой статье пришли от самих лабораторий, у которых есть очевидный интерес в громком заголовке. Модель Anthropic не выпущена — воспроизвести её результат нельзя, можно только перепроверить готовое доказательство. У части результатов OpenAI внешней рецензии нет вовсе.

Что об этом говорят сами математики

Ноге Алону из Принстона за карьеру поддались несколько десятков задач Эрдёша. Теперь он ими не занимается.
Как только ИИ начал их решать, в этом больше нет смысла. — Нога Алон
Сказано без трагизма: он просто считает, что действие переместилось в другое место. Второй сигнал заметнее. Джейкоб Цимерман из Университета Торонто получил Филдсовскую премию в июле 2026 года — за работу над гипотезой Андре — Оорта — и в тот же день объявил, что уходит в OpenAI заниматься безопасностью ИИ. Формально это отпуск, должность он сохранил, но его формулировка звучит определённо: математическая карьера в нынешнем виде, по его мнению, не сохранится. Есть и другая позиция. Вутер ван Дорн, один из самых активных участников базы Эрдёша, признаёт, что современные системы думают о математике лучше него, — и продолжает писать доказательства сам, потому что его тексты проще и понятнее для людей. Он сравнивает это с игрой на фортепиано: смысл не только в том, чтобы прозвучала музыка.

Решит ли нейросеть школьную задачу по фото

«Нейросеть решает открытую задачу Эрдёша» и «нейросеть решит вам домашку по фото» — утверждения из разных вселенных, и второе выполняется хуже. В задаче Эрдёша условие записано формально и однозначно, ответ проверяется вычислением, а на решение брошены часы работы и десятки проверяющих подагентов. В школьной задаче по фотографии модель сначала должна разобрать почерк и криво снятый лист, догадаться, что именно спрашивают, учесть ожидаемый учителем способ решения — и выдать ответ за две секунды, без всякой проверки. Ошибка на любом шаге даёт уверенно написанную чушь, и чаще всего именно это и происходит. Вывод простой: для объяснения темы и проверки хода мысли модель годится отлично, для готового ответа без проверки — нет.

Частые вопросы

ИИ доказал гипотезу Римана?

Нет. Была улучшена частичная нижняя оценка: доказано, что не менее 67,2% нулей дзета-функции лежат на критической прямой, вместо прежних 41,6%. Гипотеза утверждает, что там лежат все нули, и она остаётся открытой. Anthropic прямо пишет, что не ожидает, что этот путь приведёт к её доказательству.

Сколько задач Эрдёша осталось нерешёнными?

На начало сентября 2026 года в базе erdosproblems.com 1220 задач, решёнными помечены 576 — открытыми остаются около 644. Статус «открыта» означает лишь, что решения не нашли в литературе; иногда оно обнаруживается в старой статье.

Можно ли повторить результат Anthropic самому?

Нет. Работала неопубликованная исследовательская версия модели, доступа к ней нет. Проверить можно только готовое доказательство — его текст и формализацию в Lean опубликовали. Это важное отличие от обычной научной работы, где метод воспроизводим.

Останутся ли математики без работы?

Пока речь о конкретном классе задач: коротких, формализуемых, из комбинаторики и теории чисел. Постановка новых вопросов и построение теорий остаются за людьми. Но профессия меняется на глазах, и уход филдсовского лауреата в ИИ-лабораторию — ясный сигнал.

Какая нейросеть лучше всех решает математику?

Сравнить нельзя: громкие результаты 2026 года получены на внутренних, не выпущенных наружу моделях, и каждая лаборатория меряет по-своему. Из публичных сервисов задачи Эрдёша чаще всего закрывали энтузиасты с топовыми чат-ботами, перебирая и перепроверяя ответы вручную.

Можно ли доверять решению, которое выдал чат-бот?

Только после проверки. В историях успеха проверка была обязательной частью процесса: сотни отброшенных идей, отдельные проверяющие агенты, численные тесты, живые рецензенты, формализация в Lean. Ответ, который никто не перепроверил, — это не результат, а гипотеза, красиво оформленная.
Источники: Quanta Magazine, «Why the Legendary Erdős Problems Are Falling to AI» (3 августа 2026); публикация Anthropic о нулях дзета-функции (10 августа 2026); база задач erdosproblems.com Томаса Блума (данные на 3 сентября 2026).
0

Пока нет комментариев

ИИ решает математические задачи: что произошло в 2026