Проблема поисковой выдачи искусственного интеллекта становится всё заметнее. ChatGPT, Claude и другие ИИ-сервисы при поиске в интернете зачастую работают не со всей сетью, а лишь с той её частью, которая разрешает доступ автоматическим роботам. И самое неприятное здесь в том, что именно качественные источники всё чаще закрывают перед ИИ двери.
Около 60% авторитетных новостных сайтов уже блокируют AI-краулеры. Consumer Reports, например, запрещает доступ GPTBot, поисковому роботу Google для ИИ и Common Crawl. Причина довольно прозаичная. Трафик от ботов и краулеров в интернете уже превысил человеческий, поэтому владельцы дорогого профессионального контента не хотят бесплатно отдавать свои материалы для обучения и работы чужих нейросетей.
В результате формируется своеобразный «открытый интернет», который ИИ ещё способен читать. И качество этой части сети вызывает вопросы. Исследователи изучили 26 тыс. источников, которые цитировали ИИ-поисковики, и обнаружили, что примерно каждый шестой материал был написан другим искусственным интеллектом. Ещё интереснее, что около 44% ссылок ChatGPT приходились на подборки в стиле «лучшие товары», причём встречались и рейтинги, где компания сама объявляла собственный продукт номером один.
Параллельно возникает целая индустрия контента, созданного специально под ИИ. Сайты клонируют чужие материалы, штампуют подборки и оптимизируют страницы уже не столько для человека или Google, сколько для того, чтобы их заметила нейросеть. Получается довольно странный замкнутый круг, где ИИ всё чаще ищет информацию среди текстов, которые другой ИИ написал специально для первого ИИ.
Есть ещё одна неприятная особенность, post hoc citation. Модель может сначала сформировать ответ, а потом подобрать ссылки, которые его подтверждают. Поэтому красивая ссылка под утверждением уже не означает, что источник действительно содержит именно эту информацию.
Отсюда простое правило новой цифровой гигиены. Если ИИ приводит источник, его стоит открыть и посмотреть самостоятельно. Кто написал материал, откуда взяты данные и действительно ли на странице есть то, что нейросеть вам пересказала. Парадоксально, но чем умнее становится поиск, тем больше ручной проверки он начинает требовать.