Статья

Книгу разрезали, отсканировали, выбросили: на чём учат нейросети

Книгу разрезали, отсканировали, выбросили: на чём учат нейросети

ProfileProfile·3 ч назад·
13
··0·
В августе 2026 года издание 404 Media выпустило материал, который за сутки разошёлся по мировой и российской прессе: журналисты спрятали AirTag в посылке с редкими книгами и посмотрели, куда она приедет. Приехала она на склад Amazon, где, по словам сотрудников, книгам срезают корешки и сканируют постранично. Мы в Schai сами делаем ИИ-продукт, поэтому не будем ни возмущаться, ни оправдывать индустрию. Разберём спокойно: что такое деструктивное сканирование, откуда вообще берутся тексты для обучения моделей, что изменили суды и что из всего этого следует автору.

Повод: метка в посылке с тысячей книг

Что именно сделали журналисты

Репортёр 404 Media Эмануэль Майберг оттолкнулся от наблюдения букинистов: последнее время на площадках подержанных книг стали появляться странные оптовые заказы — сотни и тысячи разрозненных названий, часто редких и давно не переиздававшихся, скупаемых списком по ISBN. Продавцы подозревали, что покупатель — кто-то из ИИ-компаний, но доказать не могли: посредник есть посредник. Журналист оформил через маркетплейс Biblio заказ примерно на тысячу книг и вложил в один малоизвестный том обычный Apple AirTag.
Метка отметилась в Калифорнии, Висконсине и Колорадо и остановилась в Лас-Вегасе — на складе Amazon с кодом LAS8. Внутри работает подразделение с внутренним именем VGT3; на его логотипе — тираннозавр с книгой в лапах.

Что компания ответила — и чего не сказала

Дальше начинается зона, где важно не спешить. AirTag доказал ровно одно: маршрут посылки. Что происходит с книгами после приёмки, известно из рассказов складских сотрудников — они описывают конвейер: сканирование штрихкода, срезание корешка, постраничная оцифровка. Связь полученных данных с обучением моделей Amazon Nova — это вывод журналистов, а не заявление компании.
Сама Amazon ответила короткой формулировкой: книги закупаются «через коммерческие каналы, чтобы улучшать продукты и сервисы, которыми пользуются клиенты». На вопросы об уничтожении экземпляров и о масштабе операции в компании отвечать не стали. Это не отрицание, но и не подтверждение — и подавать историю как доказанный корпоративный умысел преждевременно. Зато сама практика документирована в другом месте: в судебных материалах.

Деструктивное сканирование: почему режут, а не фотографируют

Как устроен процесс

Технически всё просто. Книгу зажимают в гидравлический резак — по сути гильотину — и одним движением отделяют блок страниц от переплёта. Получается стопка отдельных листов, которую кладут в протяжный сканер: такой аппарат берёт лист за листом со скоростью десятков страниц в минуту и человека почти не требует. Дальше OCR превращает изображения в текст. Практика не новая: так десятилетиями оцифровывали архивы, подшивки газет и диссертации. Новым стали масштаб и цель.

Почему бережная съёмка проигрывает

Альтернатива — планетарный сканер: книга лежит раскрытой в люльке, камера снимает разворот сверху, страницы переворачивает оператор или робот. Экземпляр остаётся целым, но цена растёт в разы. Нужен человек, нужно бороться с искривлением страницы у корешка, с бликами, с тенью от прижимного стекла, а потом ещё и выправлять геометрию в софте. Именно так шёл проект Google Books с библиотеками — и именно поэтому он занял годы.
Когда книга воспринимается не как ценность, а как расходник, из которого нужно достать только текст, экономика однозначна: резать быстрее, дешевле и даёт более чистое распознавание. Про этот выбор известно не по слухам. В деле Bartz против Anthropic подробно описано, как компания скупала бумажные тиражи, срезала переплёты, сканировала и выбрасывала оригиналы — а руководить процессом позвала бывшего главу партнёрств Google Books с задачей «получить все книги мира».

Откуда берутся данные для обучения

Книжный конвейер — только один источник, и по объёму далеко не главный. Полезно видеть всю картину: у каждого типа данных своя цена, своё качество и свой уровень юридического риска.
Шесть типов источников обучающих данных: от бесплатного веб-краула до дорогих лицензий

Открытый интернет

Основа основ — веб-краулы вроде Common Crawl: петабайты страниц, форумов, документации, новостей. Дёшево, огромно и грязно: много мусора, дублей, спама. С 2023 года добавилась новая беда — всё больше текста в сети написано самими нейросетями, а учиться на собственном отражении модели вредно. Как отличить машинный текст от живого, мы разбирали отдельно.
Именно поэтому «доИИшные» тексты — всё, что гарантированно написано человеком до 2022 года, — резко подорожали. Старая бумажная книга в этом смысле идеальный товар: она заведомо чистая.

Общественное достояние и открытые библиотеки

Проект «Гутенберг», государственные документы, научные препринты, открытые энциклопедии. Юридически безупречно и бесплатно, но объём ограничен, а язык часто архаичный: на текстах XIX века современный ассистент не научится отвечать про налоговый вычет.

Лицензированные корпуса: компании стали платить

Самая быстрорастущая категория. OpenAI и News Corp — пятилетнее соглашение дороже 250 млн долларов, крупнейшая раскрытая сделка на рынке. Reddit и Google — порядка 60 млн долларов в год за доступ к обсуждениям. Microsoft и HarperCollins — часть каталога нон-фикшн по 5000 долларов за книгу, из которых половина идёт автору. Отдельно торгуются архивы фотостоков, научных издательств и медиахолдингов.
Публично раскрытые сделки по данным и счёт, который выставил суд

Купленные физические архивы

То, с чего мы начали: легально приобретённые бумажные книги, превращённые в текст. Формально это покупка вещи, а не прав, и именно на этом строится юридическая позиция компаний — экземпляр мой, что хочу, то с ним и делаю.

Спорные источники

Пиратские библиотеки и «теневые» коллекции — например, набор Books3, собранный из нелегальных копий и годами кочевавший по исследовательским проектам. Сюда же — данные, собранные в обход robots.txt и пользовательских соглашений. Это ровно та часть, из-за которой возникли самые дорогие иски.

Пользовательские и синтетические данные

Переписка с ассистентами, если пользователь не отключил обучение, оценки ответов «нравится / не нравится», а также тексты, сгенерированные другими моделями. Синтетика дешёвая и бесконечная, но на ней легко получить вырождение. Что из вашего разговора с ассистентом вообще может стать данными — тема отдельного разбора.

Почему компании стали платить: что изменили суды

Что суд разрешил

В июне 2025 года судья Уильям Алсуп в деле Bartz против Anthropic впервые прямо высказался про обучение больших языковых моделей. Вывод получился двойным. Покупка бумажных книг, их деструктивная оцифровка «для себя» и обучение на получившемся тексте признаны добросовестным использованием: смена формата не создаёт дополнительных экземпляров и ничего не распространяет наружу.
Одно из самых трансформативных применений, которые мы увидим при своей жизни, — так суд охарактеризовал обучение модели на законно купленных книгах.

Что суд не разрешил

А вот скачивание миллионов книг с пиратских сайтов и хранение их в постоянной внутренней библиотеке защитой не прикрылось: суд назвал такое копирование неисправимо нарушающим — независимо от того, для чего файлы потом пригодились. Итогом стало крупнейшее в истории США мировое соглашение по авторскому праву: 1,5 млрд долларов за примерно 482 тысячи произведений (в среднем порядка трёх тысяч долларов на книгу до вычета издержек) и обязательство уничтожить скачанные файлы. Окончательное одобрение суд дал 20 июля 2026 года; заявки подали свыше 90 % правообладателей из списка.

Как это изменило рынок

Правило получилось внятным: способ получения важнее способа использования. Обучаться можно, воровать нельзя. Отсюда и волна лицензионных сделок, и очереди за бумажными тиражами — покупка книги внезапно оказалась самым надёжным способом легально получить текст.
Соседние решения добавили нюанс. В деле Kadrey против Meta суд встал на сторону компании, но прямо указал: истцы просто не доказали «размывание рынка», а доказали бы — исход мог быть другим. А в деле Thomson Reuters против Ross Intelligence, где ИИ-продукт напрямую конкурировал с оригиналом, добросовестного использования не нашли вовсе. То есть вопрос «законно ли учить модель на моей книге» до сих пор не имеет одного ответа: всё зависит от того, откуда взяли текст и с чем конкурирует результат.

Оцифрована — не значит сохранена

Что исчезает вместе с переплётом

Текст — не вся книга. У редкого экземпляра есть тираж и год, издательские пометки, вклейки и карты, качество бумаги, дарственные надписи, экслибрисы, читательские пометы на полях, реклама на форзацах, следы бытования. Историк книги читает всё это как самостоятельный источник — иногда более ценный, чем содержание. OCR не сохраняет ни одного из этих слоёв: на выходе получается строка символов, часто без иллюстраций и без вёрстки. Если экземпляров осталось три и один разрезан, исчезла треть материального свидетельства — и никакой скан её не вернёт.

Приватная копия — это не библиотека

Второе отличие тоньше. Оцифровка ради сохранности заканчивается публичным каталогом: скан можно найти, процитировать, сверить с оригиналом, им пользуется следующий исследователь. Оцифровка ради обучения заканчивается закрытым корпусом внутри компании. Книга «есть» в модели примерно в том смысле, в каком в вас есть прочитанное: как след, а не как файл, который можно открыть. Публичного доступа не появилось, а бумажный экземпляр исчез. Для читателя это чистая потеря, даже если юридически всё безупречно.

Что это значит для авторов

Проверьте, попали ли вы в известные списки

По урегулированию с Anthropic работает официальный реестр произведений — если вы издавались на английском, свою книгу стоит поискать там; это единственный на сегодня работающий способ получить деньги задним числом. По другим искам публикуются похожие перечни, и следить за ними полезнее, чем за новостями об очередной модели.

Смотрите в договор до подписания

В новых издательских контрактах появился отдельный пункт про обучение ИИ. Ключевых вопроса три: нужно ли ваше отдельное согласие на лицензирование текста ИИ-компаниям; как делится вознаграждение (сложившийся ориентир — 50 на 50, как в сделке HarperCollins с Microsoft); можно ли разрешение отозвать. Если пункта нет вовсе, это не значит, что права остались у вас: внимательно читайте формулировку про «любые способы использования, в том числе неизвестные на момент подписания» — она закрывает вопрос не в вашу пользу.

Бумага больше не защита

Раньше «не выкладывать в сеть» было рабочей стратегией: нет файла — нет проблемы. Скупка тиражей эту логику отменяет. Ваш текст может оказаться в обучающем корпусе, даже если вы никогда не публиковали его онлайн: достаточно, чтобы кто-то купил экземпляр на букинистической площадке. Технических способов помешать этому не существует — есть только договорные и судебные.

Трезвые ожидания

Полностью «выписаться» из обучения нельзя: универсального механизма отказа для книг нет, а тот, что появляется, работает только для новых лицензий. Реалистичная позиция автора сегодня — не запрет, а условия: лицензия, оплата, указание источника. Именно к этому индустрия и движется под давлением судов. Ровно тот же сюжет разворачивается в музыке, и там он зашёл чуть дальше.
Итог без пафоса. История с AirTag не открыла новой этической бездны — она показала действующий и в значительной части законный производственный процесс, о котором просто не принято рассказывать. Спорным в нём остаётся одно: невосполнимый бумажный экземпляр расходуется на закрытый корпус, из которого читателю не достанется ничего. Это вопрос не к нейросетям как технологии, а к тому, кто, у кого и на каких условиях покупает данные — и что при этом соглашается потерять.
0

Пока нет комментариев

Как книги режут и сканируют для обучения нейросетей