Статья

Сайты воюют со сборщиками данных: от robots.txt до подмены шрифта

Сайты воюют со сборщиками данных: от robots.txt до подмены шрифта

ProfileProfile·2 ч назад·
4
··0·
Ars Technica описала защиту, которая выглядит как шутка типографа: специальный шрифт заставляет робота-сборщика утащить со страницы совсем не тот текст, который видит живой читатель. Проект называется ShieldFont, его сделали дизайнеры Isaque Seneda и Gabriel Abrucio вместе с копенгагенской словолитней Playtype на основе гарнитуры Optik — шесть начертаний от Regular до Black. Код выложен открыто, сама гарнитура остаётся коммерческой.
История шире одного шрифта. Последние три года владельцы страниц перепробовали всё: вежливые файлы-просьбы, жёсткие заслоны, лабиринты-ловушки, счета за каждый обход. Разберём цепочку целиком — как устроен сбор материала для обучения моделей, почему главный «стоп-знак» веба ничего не запрещает, чем плох каждый рубеж обороны и в какой момент защита начинает бить по своим.

Как устроен сбор материала для обучения

Три разных робота под одной вывеской

Фраза «ИИ-краулер» скрывает три непохожие сущности, и путаница между ними стоит владельцам страниц дорого. Первая — обучающие обходчики: GPTBot, CCBot, Bytespider. Они забирают текст в датасет и не возвращают ничего. Вторая — поисковые: OAI-SearchBot, PerplexityBot, Claude-SearchBot. Они наполняют индекс, из которого ассистент берёт ссылки для ответа, то есть теоретически способны привести читателя. Третья — выборка «по требованию»: когда пользователь сам вставил адрес в чат, помощник идёт по нему прямо сейчас. Perplexity, например, открыто заявляет, что для таких запросов файл-просьбу не читает: это не массовый обход, а действие человека.

Кто забирает больше, чем отдаёт

Разрыв между «взял» и «привёл» измеряется отношением обходов к переходам. По данным Cloudflare Radar на май 2026 года ClaudeBot доходил до 10 300 обходов на один визит, GPTBot держался около 904, PerplexityBot — около 193. У классического Googlebot соотношение 5,2 к одному: старая модель обмена, где за индексацию платили трафиком. Именно эта арифметика, а не абстрактная «этика ИИ», и запустила гонку вооружений.
Отношение обходов к переходам у популярных роботов, данные Cloudflare Radar

robots.txt: просьба, а не замок

Что решил суд

Текстовый файл в корне домена появился в 1994 году как джентльменское соглашение и таковым остался. В декабре 2025 года по иску издательского холдинга Ziff Davis к OpenAI федеральный судья Стайн прямо написал: такой файл не является «технической мерой, эффективно контролирующей доступ» в смысле американского закона DMCA. Судья сравнил его с табличкой «по газонам не ходить»: она полагается на добрую волю проходящего и сама по себе ничего не преграждает. Игнорирование инструкций из файла — не «обход защиты», и соответствующая претензия истца отпала. Часть претензий по авторскому праву при этом двинулась дальше в суд.

Почему файл всё равно нужен

Крупные компании директивы в основном соблюдают — репутационные издержки дороже пары гигабайт текста. Но статистика показывает, насколько инструмент недоиспользован: по замерам Cloudflare, robots.txt есть лишь у 37 % доменов из первой десятки тысяч, а GPTBot запрещён всего в 7,8 % существующих файлов. Поверх старого формата уже строят новые: рабочая группа AIPREF в IETF описывает машиночитаемые предпочтения по обучению, Creative Commons готовит CC Signals, Cloudflare раздаёт «управляемый robots.txt» даже бесплатным клиентам. Обилие конкурирующих стандартов говорит об одном: победителя пока нет.

Арсенал обороны и цена каждого решения

Пять рубежей обороны сайта и слабое место каждого

Сетевой заслон и плата за обход

Следующая ступень — блокировка на стороне CDN или межсетевого экрана, лимиты частоты запросов, проверка подлинности робота. Плюс: заслон работает независимо от доброй воли. Минусы начинаются сразу. Часть сборщиков меняет строку user-agent и сети — Cloudflare летом 2025 года публично обвинила Perplexity в такой маскировке и убрала её из списка проверенных ботов. Слишком жёсткие правила заодно режут агрегаторы, читалки и живых людей с нестандартными браузерами. Отдельная ветка — не запрещать, а выставить счёт. С 1 июля 2025 года Cloudflare запустила pay per crawl: сервер отвечает роботу кодом 402 «нужна оплата», владелец назначает цену за запрос, минимум — один цент. Позже логику стали смещать от «плати за скачивание» к «плати за использование» и добавили блокировку ботов на страницах с рекламой.

Ловушки, лабиринты и задачки на входе

Творческий фланг обороны родился в опенсорсе. Nepenthes затягивает обходчика в бесконечный лабиринт сгенерированных страниц без выхода. Cloudflare сделала похожий AI Labyrinth: подозрительного гостя уводят по цепочке правдоподобных пустышек, чтобы он жёг своё время и деньги. Anubis идёт другим путём — это обратный прокси, который до пропуска на сайт требует от браузера решить вычислительную задачу; его поставили у себя GNOME, архивы списков рассылки ядра Linux и даже ЮНЕСКО. Цена такая: лабиринт потребляет и ваши ресурсы, а страница-проверка перед входом раздражает часть аудитории и мешает мобильным читателям.

Договор вместо войны

Крупные издатели выбрали переговоры. News Corp заключила с OpenAI соглашение, которое оценивают в 250 млн долларов на пять лет; Google платит Reddit порядка 60 млн в год; Amazon договорилась с The New York Times на сумму порядка 20–25 млн ежегодно. В сентябре 2025 года появился открытый стандарт RSL (Really Simple Licensing), к декабрю доведённый до версии 1.0: он дописывает к старому файлу машиночитаемые условия — атрибуция, оплата за обход, оплата за каждое использование в ответе. Слабое место очевидно: чеки выписывают тем, у кого есть юристы и узнаваемый бренд. Владелец блога с посещаемостью в тысячу человек в переговорную комнату не попадает.

Шрифт, который врёт роботам

Как работает подмена

ShieldFont меняет саму физику страницы. На этапе сборки скрипт подменяет слова в разметке: существительное на существительное, глагол на глагол, примерно равной частотности. В код уходит «редакция сажает свой параллельный фарватер», а расширенные таблицы подстановок OpenType (GSUB) рисуют человеку исходную фразу. По замерам авторов подмена задевает около четверти всех слов и почти половину знаменательных. Ключевой приём — не превратить текст в кашу, а сделать подделку правдоподобной: обходчик не отбраковывает мусор, а уносит в датасет грамматически гладкую ложь. Смысл замысла авторы формулируют как право автора решать, участвует ли его работа в обучении моделей.
Задача не в том, чтобы сборщик получил битые символы, а в том, чтобы он получил уверенный ответ — и ошибочный.

Где ломается

Ограничения признают сами разработчики. Обходчик, который рисует страницу как браузер и распознаёт картинку, получит подлинный текст: по подсчётам авторов, такой путь в разы дороже простого чтения разметки, но технически он открыт. Ленты RSS отдают чистый текст мимо защиты. Файлы шрифта можно скачать и восстановить словарь подстановок. Хуже другое: с разметкой работают не только роботы-сборщики. Поисковая система проиндексирует подложные слова, переводчик переведёт их, копипаста вернёт бессмыслицу, а экранный диктор прочитает незрячему читателю неправильную фразу — авторы предлагают отдельную процедуру разблокировки для вспомогательных технологий. Это плата за защиту, и вносит её не только владелец домена.

Почему тотальный запрет невыгоден самой площадке

Из индекса, куда вы не попали, вас не процитируют

Соблазн закрыть всё разом понятен, но он путает две категории роботов. Запрет обучающего обходчика почти ничего не стоит. Запрет поискового убирает ресурс из базы, по которой ассистент собирает ответ со ссылками, — а именно оттуда сегодня приходит новая аудитория. Любопытно, что связь слабее, чем кажется. Исследование по четырём миллионам цитирований (март 2026) показало: среди ресурсов, закрывших ChatGPT-User, в ответах всё равно упоминались 70,6 %, а среди закрывших Google-Extended — 92,3 %. Модель помнит то, что прочитала раньше, и берёт факты из чужих пересказов. Полная невидимость недостижима, а вот потерять переходы легко.

Считайте не запреты, а трафик

Фон у решения невесёлый. По данным Pew Research Center, при наличии сгенерированной сводки над выдачей по обычным ссылкам кликают 8 % пользователей против 15 % без неё, а по ссылкам внутри самой сводки — около 1 %. Chartbeat на выборке более 2500 новостных ресурсов зафиксировала падение поисковых переходов примерно на треть за 2025 год. Вывод не «сдаться», а «считать». Если материал приносит деньги показами рекламы, глухая стена ускорит спад посещаемости. Если это документация продукта, попадание в ответы ассистента ценнее самого трафика.

Что делать владельцу сайта: чек-лист

Базовый уровень, полчаса работы

1. Посмотрите логи и выясните, кто вообще к вам ходит: доля автоматических визитов часто удивляет. 2. Заведите robots.txt, если его нет, и разведите роли: обучающим обходчикам — Disallow, поисковым — доступ. 3. Добавьте на страницы мета-тег noai/noimageai и заголовок ответа сервера: часть сборщиков их учитывает. 4. Включите базовую защиту от ботов у хостера или CDN, начните с мягкого режима. 5. Опишите условия использования материалов в отдельном документе — это пригодится при любом разбирательстве. 6. Проверьте ленты RSS и открытые API: они часто отдают то, что вы закрыли на страницах. 7. Поставьте лимит частоты запросов на тяжёлые разделы — поиск, архивы, фильтры каталога.

Если тексты и фото — ваш актив

8. Опубликуйте машиночитаемые условия по стандарту RSL: без них разговор о деньгах невозможен. 9. Оцените платный обход (тот самый ответ 402) — у крупных CDN он включается настройкой. 10. Для ценных разделов рассмотрите ловушку-лабиринт, но замерьте собственный расход ресурсов. 11. Экраны-проверки ставьте точечно, перед архивами и поиском, а не перед главной страницей. 12. Раз в квартал сверяйте список известных обходчиков: имена и правила меняются быстро.

Чего лучше не делать

Не закрывайте всё подряд одним правилом: вместе с датасетами уедут поисковая выдача и агрегаторы. Не ставьте шрифтовую подмену на разделы, которые кормят вас переходами из поиска, — а также на инструкции, медицинские и юридические тексты, где ошибка стоит дорого. Не полагайтесь на одну меру: связка «правила плюс сетевой заслон плюс лицензия» устойчивее любого отдельного трюка. И не забывайте про доступность: читатель с экранным диктором не должен становиться сопутствующей потерей.

Что это значит для авторов

Экспериментальный шрифт важен не как готовое средство — его слабости честно перечислены самими разработчиками, — а как симптом. Договор о том, что робот берёт текст и возвращает читателя, распался, и теперь стороны нащупывают новый: где-то через лицензию, где-то через счёт за обход, где-то через типографскую диверсию. Практический смысл для автора простой. Полностью спрятать опубликованное невозможно, а вот зафиксировать свои условия, разделить полезных роботов и бесполезных и перестать раздавать всё бесплатно — вполне реально. Побеждает не тот, кто выше стена, а тот, кто заранее решил, что именно продаёт и кому.

🔗 Что ещё почитать на Schai

Если хотите разобраться в теме глубже, начните с этих материалов:
0

Пока нет комментариев

Сайты против ИИ-скрейперов: robots.txt и шрифты