Знакомая сцена. Полчаса объясняете ассистенту задачу, он всё понимает, а на сороковом сообщении вдруг переспрашивает то, о чём вы договорились в самом начале. Первая мысль — «отупел» или «сломали модель». На самом деле произошло другое: то, что вы считали памятью, памятью не было.
Разберём по-человечески, без формул: что именно видит модель в момент ответа, куда девается остальное и почему длинная переписка иногда работает хуже короткой.
Окно контекста — это стол, а не шкаф
Модель не «помнит» разговор. Перед каждым ответом ей заново кладут на стол пачку текста: системную инструкцию, приложенные файлы, кусок переписки, ваш новый вопрос. Всё это она читает целиком и с нуля — и после ответа стол убирают. Размер стола и есть окно контекста, он измеряется в токенах.
Токен — это не слово и не буква, а кусочек текста, на которые разбивается ввод. Английское слово чаще укладывается в один токен, русское регулярно рвётся на два-три. Отсюда бытовое наблюдение, которое многие замечали: одна и та же по смыслу переписка на русском «весит» заметно больше, чем на английском.
Ключевое: стол убирают каждый раз. Не бывает так, что модель «дочитала» ваш диалог вчера и сегодня помнит. Всё, чего нет на столе прямо сейчас, для неё не существует.

Почему середина разговора теряется первой
Логично предположить: чем больше стол, тем лучше. Производители так и соревнуются — сотни тысяч токенов, у некоторых моделей заявлен миллион. Но исследователи давно заметили неприятное: качество проседает задолго до формального лимита.
В феврале 2025 года Adobe Research показала это на простой задаче — связать два факта, разнесённых по тексту. На коротком фрагменте GPT-4o давал 99% верных ответов, на 32 тысячах токенов — 70%. Claude 3.5 Sonnet просел с 88% до 30%, Gemini 2.5 Flash — с 94% до 48%, Llama 4 Scout — с 82% до 22%.

В июле 2025-го команда Chroma прогнала похожие проверки на восемнадцати моделях и закрепила за явлением название context rot — «протухание контекста». Главный вывод там не про цифры, а про характер провала: он неровный. Модель может держаться на 32 тысячах и посыпаться на 64 — не плавно, а обрывом.
Заявленный размер окна — это сколько текста влезет. Не обещание, что модель одинаково внимательна ко всему, что влезло.
Отдельно любопытно, что нужный кусок находится тем хуже, чем сильнее он похож на остальной текст. Найти телефон в договоре легко, а вот выцепить один абзац из тридцати похожих абзацев — уже лотерея.
Память — это не история чата
Дальше начинается путаница в словах. История чата и память ассистента — разные механизмы, и путают их постоянно.
История
Это просто список сообщений, сохранённый на сервере: чтобы диалог открылся и с телефона, и с ноутбука. Хранится он целиком, но в модель уезжает не весь — только хвост, который влезает в окно. Отсюда эффект «помнит последнее, забыл начало».
Память
Это отдельные факты, вытащенные из разговора и сложенные в сторонку: чем вы занимаетесь, как вас зовут, какой формат ответов любите. В нужный момент подходящие факты подкладываются на тот самый стол. Не стенограмма — выжимка.
В январе 2026 года MIT Technology Review посвятил этому большой материал: авторы из Center for Democracy & Technology разбирали, что крупные сервисы уже перешли к постоянной памяти — Google подтягивает в Gemini почту и историю поиска, Anthropic заводит отдельные области памяти под разные проекты. И предупреждали о главном риске: у большинства всё сваливается в одно неразделённое хранилище, где сведения о здоровье лежат рядом с рабочими задачами.
Как это сделано у нас — честно
В Schai GPT история переписки лежит на сервере, поэтому чат подхватывается с любого устройства. Память устроена отдельно: из разговора вытаскивается не более шести фактов за ход, каждый — коротким предложением. Когда вы задаёте новый вопрос, система ищет среди сохранённого по смыслу, берёт до восьми самых близких записей и подкладывает их в запрос блоком примерно на пару тысяч символов.
Из этого прямо следуют границы. Ассистент не помнит, «что мы обсуждали в среду в третьем сообщении» — этого в памяти нет, там только факты. Быстро протухающие показатели вроде «сегодня 40 посетителей» мы намеренно не сохраняем: такие числа устаревают за часы, и потом всплывают как враньё.
Ещё одна честная деталь — уровни моделей. Дешёвая модель отвечает быстрее и стоит копейки, у топовых окно больше и рассуждают они аккуратнее, но каждый ход обходится дороже. А задачи, которые агент выполняет на сервере, живут с потолками: не больше трёх одновременно на человека и до восьми шагов внутри задачи — иначе один пользователь занял бы всю машину.
Где это упирается в деньги и скорость
Внимание внутри модели устроено так, что каждый новый токен сверяется со всеми предыдущими. Удвоили длину — работы стало вчетверо больше. Поэтому огромное окно это не только «дороже», но и «медленнее»: ответ на сотой странице приложенного PDF придётся ждать.
И второе, менее очевидное: за контекст платят заново на каждом ходу. Вы не загружаете документ один раз — он едет в модель при каждом вашем сообщении, пока лежит в переписке. Длинный тред — это счётчик, который тикает всё быстрее.
Что с этим делать
Начинайте новый чат под новую задачу. Тред на двести сообщений не делает ассистента умнее — он делает его дороже и рассеяннее.
Важное повторяйте коротко и рядом с вопросом. «Напомню: пишем для новичков, без терминов» в текущем сообщении работает надёжнее, чем та же фраза где-то в начале переписки.
Не кидайте всю папку целиком. Один нужный кусок вместо ста страниц — это и точнее, и заметно дешевле.
И проверяйте, что ассистент про вас запомнил. Память — вещь полезная ровно до того момента, пока в ней не осел устаревший факт, который теперь тихо портит каждый ответ.


Пока нет комментариев