Я backend-разработчик, и отношения у меня с ИИ сугубо рабочие: он подсказывает куски кода, объясняет чужие библиотеки, разбирает логи. И примерно раз в неделю повторяется одна и та же сцена. Модель выдаёт ответ, который выглядит безупречно: правильный тон, аккуратная структура, ссылка на документацию. Открываешь ссылку — 404. Метода, который она предложила, в этой библиотеке нет и никогда не было.
Обиднее всего не то, что она ошиблась. Обиднее, что она ошиблась уверенно — тем же голосом, каким за минуту до этого сказала чистую правду.
Она не знает — она продолжает
Внутри языковой модели нет базы фактов, из которой она достаёт ответы. Там статистика того, какие куски текста за какими обычно идут. Модель берёт ваш вопрос и раз за разом выбирает следующий фрагмент — токен — так, чтобы продолжение вышло максимально правдоподобным.
Ключевое слово — правдоподобным, а не верным. Отдельной операции «сверить с реальностью» в этом цикле просто нет. Поэтому выдуманная цитата выглядит ровно как настоящая: та же грамматика, та же структура ссылки, тот же спокойный уверенный тон. Форма правильная — содержания под ней нет. Это, кстати, объясняет и почему модель ошибается именно на мелочах: номера страниц, даты, фамилии, точные названия функций — самая «редкая» и самая правдоподобно достраиваемая часть текста.

Галлюцинация — это не сбой, это режим работы
В сентябре 2025 года вышла работа Адама Калаи, Офира Нахума, Сантоша Вемпалы и Эдвина Чжана «Why Language Models Hallucinate» (arXiv:2509.04664); в 2026-м её опубликовал Nature. Меня в ней зацепили два тезиса.
Первый: часть ошибок закладывается ещё на предобучении и математически неизбежна. Авторы сводят задачу к бинарной классификации — если «верное утверждение» невозможно отличить от «неверного», ошибки возникают сами собой, из статистики. Факт, встретившийся в данных один раз или ни разу, модели просто нечем удержать, и она достраивает его по аналогии.
Второй тезис неприятнее, и как инженера он меня задел сильнее: мы сами доучиваем модели блефовать. Почти все бенчмарки считают результат по схеме «попал — не попал»: верный ответ даёт балл, «не знаю» — ноль, неверный ответ — тоже ноль. Значит, модель, которая всегда угадывает, статистически обгоняет ту, что честно признаёт неуверенность. Это экзамен, где за прочерк и за ошибку снимают одинаково: рационально написать хоть что-нибудь.
Модель не выбирала врать. Она оптимизировалась под метрику, в которой молчание стоит ровно столько же, сколько ошибка.
Отсюда и предложение авторов: чинить не только модели, но и сами оценки — штрафовать уверенную неправду сильнее, чем отказ отвечать.
Спор о том, чего моделям не хватает
Есть гипотеза глубже, и к 2026 году она вышла в центр дискуссии: дело не в объёме данных, а в том, что модель не строит модель мира — связное внутреннее представление о том, как устроено то, о чём она говорит.
Самый наглядный эксперимент — у Кейона Вафы с коллегами (NeurIPS 2024). Модель обучили на миллионах реальных поездок такси по Манхэттену, и маршруты она прокладывает отлично. Но когда исследователи восстановили её внутреннюю «карту» города, та оказалась бессвязной: улицы, которых не существует, связи поверх кварталов. А стоило заставить модель свернуть на объезд — качество разваливалось. Продолжение той же линии, работа 2025 года на ICML: модель учили на траекториях небесных тел, орбиты она предсказывает точно, но законов Ньютона из этого не выводит. Вместо общего закона — набор частных приёмов под конкретную задачу.
В апреле 2026 MIT Technology Review поставила world models в список главного, что происходит в ИИ прямо сейчас. Фей-Фей Ли строит World Labs, Ян Лекун ушёл из Meta ради стартапа именно про модели мира, DeepMind и OpenAI вкладываются в симуляцию среды. Логика простая: система, у которой есть работающая карта реальности, ошибается предсказуемее и реже.
Ради честности: консенсуса тут нет. Сэм Альтман и Дарио Амодеи считают, что у нынешнего подхода запас хода ещё большой, а Демис Хассабис публично спорит с Лекуном, хотя сам занимается моделями мира. Спор решится не в статьях, а в проде — и пока он идёт, надёжность приходится вытягивать руками.
Что делают инженеры прямо сейчас
Заземление на источники
Модель отвечает не по памяти, а по документам, которые ей подложили перед ответом. Сверху добавляют построчную сверку: каждое утверждение сопоставляется с фрагментом источника, неподтверждённое помечается. Ошибки это не убирает, но делает их видимыми — а видимая ошибка уже не опасна.
Инструменты вместо памяти
Посчитать — калькулятором, узнать курс — запросом, проверить код — запуском. Всё, что можно вычислить, лучше не вспоминать. Это самый скучный и самый эффективный приём: он переносит ответственность с вероятностной машины на детерминированную.
Сузить область
Ассистент, у которого есть только база знаний компании и прямой запрет уходить за её пределы, врёт заметно реже универсального собеседника. Скучно, зато предсказуемо.
Разрешить отказ
И на уровне инструкции, и на уровне метрик: «не знаю» должно быть допустимым ответом, а не поражением. Пока «не знаю» стоит дешевле ошибки только в теории, модели будут угадывать.
Как страховаться, пока это не починили
У меня выработалось простое правило: доверять модели ход мысли и не доверять ей конкретику. Структура ответа, подход к задаче, набор вариантов — обычно хороши. Цифры, имена, ссылки и цитаты — под проверку всегда.

И ещё один разговорный приём: попросите модель отдельно перечислить, что в её ответе — факт из источника, а что — предположение. Это не гарантия, но граница между «знаю» и «додумал» после такого вопроса обычно проступает.
Мне кажется, самое здоровое отношение к нынешнему ИИ — как к очень начитанному стажёру: быстрый, эрудированный, никогда не скажет «я не в курсе». С таким работать можно, но подпись под результатом всё равно ставите вы.
А вы уже ловили ИИ на уверенной неправде — и что после этого изменили в том, как им пользуетесь?


Пока нет комментариев