Статья

ИИ пишет научные статьи: где он силён, а где бесполезен

ИИ пишет научные статьи: где он силён, а где бесполезен

Игорь ПчёлкинИгорь Пчёлкин·3 ч назад·
3
··0·
Если коротко: ИИ уже хорошо ИСПОЛНЯЕТ научную работу и по-прежнему плохо ВЫБИРАЕТ, что именно делать. Летом 2026 года агенту дали настоящий нерешённый научный вопрос, шесть дней, три тысячи долларов на вычисления и полную свободу — он безупречно прогнал сотни экспериментов и собрал две статьи, которые авторы исходных работ отклонили. На практике это значит: черновик обзора литературы, код для расчётов, вычитку и оформление нейросети поручить можно, а выбор темы, постановку гипотезы и решение «этот путь тупиковый, начинаем заново» — нет.
Меня зовут Игорь Пчёлкин. Этот эксперимент мне нравится редкой честностью: обычно про ИИ в науке спорят на уровне ощущений, а тут есть цифры, логи и приговор живых экспертов. И вывод из него объясняет большинство разочарований от длинных задач, порученных нейросети.

Как устроен эксперимент, в котором ИИ дали настоящий научный вопрос

Первоисточник — препринт «Can AI agents conduct open-ended AI research?» (arXiv:2607.27191, 30 июля 2026), первый автор Питер Кёргис, среди соавторов Саяш Капур из Принстона. О работе писал MIT Technology Review, но детали ниже я беру из самого препринта.
Метод назвали теневой оценкой. Из сильной, но ещё не опубликованной работы вынимают центральный исследовательский вопрос, отдают его ИИ-агенту, а готовую статью оценивают те самые авторы — как обычные рецензенты. Агент идёт «в тени» настоящего исследования: тот же вопрос, но без доступа к чужим выводам.
Взяли два вопроса из неопубликованных заявок на NeurIPS 2026: можно ли управлять «характером» языковой модели, редактируя её веса, и как заметить, что табличная предсказательная модель перестала быть надёжной на сместившихся данных. Агентом был Claude Opus 4.8 в агентной оболочке с повышенным уровнем рассуждения.
Что агенту дали и что из этого вышло. Источник: препринт arXiv:2607.27191
Дали много: 120 часов плюс сутки продления, 3000 долларов кредитов на вызовы модели, отдельный бюджет на GPU, виртуальную машину и открытый интернет. Цель — статья, достойная конференции верхнего уровня. Люди вмешивались только в логистику. Обе получившиеся статьи авторы исходных работ отклонили без колебаний.

Почему этот тест честнее привычных тестов на ИИ

Главная беда обычных бенчмарков — загрязнение. Задания лежат в интернете годами, а модели учат на интернете, поэтому вместе с умением рассуждать модель заучивает и ответы. В наборе MMLU нашли следы загрязнения примерно у 29% вопросов, задачники вроде GSM8K обнаруживались в обучающих данных десятков моделей, а при подмене загрязнённых заданий на чистые аналоги той же сложности результаты некоторых моделей падали на десяток процентных пунктов.
Теневая оценка обходит это по построению: ответов не было ни в интернете, ни в обучающих данных — они жили только в черновиках двух научных групп. И оценивали не случайные рецензенты, а люди, потратившие на тот же вопрос месяцы.

Что именно пошло не так: пять узнаваемых сбоев

Разбор логов дал пять причин провала. Каждая узнаётся и в бытовой работе с нейросетью — просто в науке видна крупным планом.

1. Нет ощущения планки

Агенту сказали: нужна статья уровня NeurIPS. Но внутренней модели этой планки у него, судя по планам, нет. Он сам себя рецензировал и в основном ставил «слабый отказ» работам, которым живые эксперты поставили «уверенный отказ». Проблемы он видел, но не чувствовал их веса: убийственные замечания лежали в одном списке с мелкими придирками.

2. Крошечные синтетические данные вместо настоящих

Обе рецензии сошлись на одном: данные выбраны плохо. Агент работал на маломощных синтетических наборах и вручную подобранных примерах. Во втором эксперименте он взял реальные наборы, но сдвиги смоделировал искусственно, а к настоящим сместившимся данным добрался лишь на финальных прогонах — подтвердить уже сделанный вывод.

3. Раннее залипание на первом подходе

В начале агент выдал много живых гипотез — авторы исходных работ признали их разумными и похожими на собственные первые мысли. А потом слишком быстро сузился до одного направления, задолго до того, как это оправдывали данные.

4. Не умеет отступить и переосмыслить

Самый интересный пункт. Инструменты для отката у агента были: он мог запустить подагента с чистым контекстом, без памяти о провалах, и регулярно делал это для других целей. Но почти никогда — чтобы начать заново. Самые амбициозные цели он похоронил в первый же день, а фундаментальной смены подхода не случилось ни разу.

5. Не чувствует ни ресурсов, ни инструкций

Оба прогона закончились с потраченной меньше чем половиной бюджета на модель. Один агент объявил проект завершённым за семь часов до дедлайна — вскоре после того, как исчерпал собственный контекст. Заодно копился дрейф инструкций: ограничения по длине нарушены в обеих статьях, а оплаченный доступ к лучшему рецензирующему инструменту использован лишь однажды.
Почему модель не отступает? У неё нет копящегося годами ощущения «что-то здесь не то». У исследователя оно складывается из сотен провалов: он телом помнит, как выглядит тупик за два шага до него. Модель оценивает текущий результат, а не траекторию, и оценивает мягко — авторы называют это разрывом между генератором и проверяющим.
ИИ проиграл не там, где не хватило вычислений. Он проиграл там, где надо было сказать: это тупик, начинаем заново.

Где ИИ полезен в научной работе, а где нет

Собираю по этапам: этап работы → справляется ли ИИ → почему.
Обзор литературы → да → читает и сводит быстрее человека. Код и запуск расчётов → да → сотни прогонов без вмешательства и без усталости. Оформление, вычитка, формат → да → формальные правила ему даются легко. Постановка гипотезы → частично → идеи разумные, но проверяет их слабо. Выбор данных → нет → берёт синтетику и удобные примеры вместо настоящих. Выбор темы и вопроса → нет → нет чувства, что здесь важно, а что нет. Отступить и переосмыслить → нет → залипает на первом подходе. Оценка «это уровень публикации?» → нет → себя судит заметно мягче экспертов.
Этап научной работы и способность ИИ: разрыв проходит между исполнением и выбором
Граница проходит ровно между исполнением и решением. Поэтому длинные автономные задачи так часто разочаровывают: вы получаете безупречно выполненную не ту работу.

Что это значит для студента, который пишет диплом

Хорошо ИИ делает вот что: черновик обзора литературы и карту темы; код для расчётов и графиков; проверку формулировок; вычитку и единообразие оформления; перевод и сокращение своих же кусков. Это экономит недели.
Плохо он делает ровно то, за что вам ставят оценку: выбирает тему, формулирует гипотезу, решает, какой метод адекватен данным, и понимает, что путь ведёт в никуда. В эксперименте это провалилось при бюджете в три тысячи долларов и полной свободе — в вашем чате тем более не появится.
И честно о рисках. Первый — выдуманные ссылки: модель порождает правдоподобные комбинации из реальных фамилий, журналов и годов, которых не существует, и масштабные проверки корпусов публикаций в 2025–2026 годах фиксируют быстрый рост таких «мёртвых» цитат. Проверять надо каждую — по DOI или в каталоге. Второй — требования вуза: правила о допустимом использовании ИИ стоит прочитать до начала, а не после. Третий — детекторы: в системах проверки появился модуль с оценкой доли сгенерированного текста, и он ошибается в обе стороны — написанный руками текст тоже иногда красят.

Как пользоваться правильно: пять приёмов

Общий принцип один: не «напиши мне работу», а «сделай этот шаг», где выбор шага остаётся за вами.
1. Дробите на шаги с приёмкой. Один запрос — одна задача, результат которой вы проверите за пять минут. Длинная автономия — ровно то, на чём в эксперименте всё и посыпалось. 2. Просите варианты, а не ответ. «Дай пять подходов к этой гипотезе и по два возражения к каждому» работает лучше, чем «предложи гипотезу»: вы получаете материал для выбора, а не чужой выбор. 3. Держите выбор за собой явно. Решения про тему, метод и данные записывайте своими словами отдельно — сразу видно, когда модель решила за вас. 4. Ставьте стоп-точки: «что говорит против текущего подхода и при каком результате его надо бросить». Сама модель этот вопрос не задаст. 5. Проверяйте источники руками. Любая ссылка от нейросети — гипотеза о существовании статьи, пока вы не открыли её в каталоге.

При чём тут «рекурсивное самоулучшение»

Идея рекурсивного самоулучшения проста: как только ИИ научится вести исследования по ИИ, он начнёт улучшать сам себя, каждое улучшение ускорит следующее, и процесс разгонится. Мысль сформулировали ещё в 1965 году, но всерьёз обсуждают её именно сейчас.
Эксперимент бьёт в узкое место схемы. Самоулучшение требует не исполнения, а выбора: понять, что направление тупиковое, и развернуться. Именно этого у модели нет. Пока агент с почти неограниченными временем и деньгами не меняет подход ни разу за шесть дней, самоускоряющийся цикл — разговор о будущем. Без злорадства: инженерную часть работы агенты уже тянут целиком, и это немало.

Честные ограничения этого вывода

Две задачи и по сути одна модель — крошечная выборка; авторы говорят это сами и называют результаты ранними свидетельствами. Оценка не слепая: статьи отклоняли те же люди, чьи вопросы взяли, и они знали, что текст написан ИИ, — это могло сделать их строже обычного рецензента. Выбор вопросов и трактовка логов — тоже решения самих исследователей.
И четвёртое, самое важное. Модели меняются быстро, и вывод «конкретно Opus 4.8 не справился» протухнет в ближайшие месяцы. А вот вывод про разрыв между «делает» и «решает» устойчивее: он про то, чему модель не учат напрямую, и именно его стоит держать в голове, поручая ИИ что-то длинное.

Частые вопросы

Какой ИИ пишет научные статьи лучше всех?

Правильнее спрашивать не «какой пишет», а «какой в чём помогает». Для поиска литературы удобнее инструменты, привязанные к настоящим базам публикаций: они не сочиняют ссылки, а достают их. Для текста и кода — обычные большие модели. Целую работу уровня публикации сегодня не делает ни один из них.

Может ли нейросеть написать научную работу целиком?

Технически — соберёт связный документ со списком литературы. По существу — на маленьких искусственных данных и с гипотезой наугад. Живой рецензент такое отличает быстро.

Как ИИ помогает с обзором литературы?

Это его сильная сторона: он быстро собирает поле темы, группирует подходы и делает сводные таблицы по методам и выборкам. Дальше — читать ключевые работы самому и сверять каждую ссылку руками.

Определит ли вуз, что текст написан нейросетью?

Иногда да: в системах проверки есть модуль оценки сгенерированного текста, да и руководитель замечает разрыв между стилем работы и тем, как студент говорит на защите. Детекторы ошибаются в обе стороны, поэтому лучший ответ не «как обойти», а «использовать ИИ на разрешённых участках и уметь объяснить каждый абзац».

Почему ИИ выдумывает ссылки на несуществующие статьи?

Он не ищет источник, а достраивает правдоподобное продолжение текста. Фамилия, журнал, год и заголовок по отдельности выглядят настоящими — вместе они образуют работу, которой нет. Поэтому любая ссылка проверяется по DOI или в каталоге.

Заменит ли ИИ учёных?

Судя по этому эксперименту — нет, но распределение труда меняется. Инженерную часть агенты уже выполняют сами. Ценность человека смещается туда, где надо решать: какой вопрос задавать, какие данные честные и когда пора всё бросить и начать иначе.
Материал справочный: требования к использованию ИИ различаются у вузов и журналов — сверяйтесь со своими правилами.
0

Пока нет комментариев

ИИ пишет научные статьи: что показал эксперимент