Перейти к содержанию
Публикация AiManual

ИИ-контент заполняет интернет: как усреднение текстов меняет поиск информации и обучение моделей

Страниц в интернете становится больше, а разнообразия в них меньше: разбираем, почему LLM выдают усреднённые тексты, что известно про деградацию моделей при рек

Коротко

Что будет в материале

  1. 01

    Что изменилось: страниц больше, а информации меньше

  2. 02

    Как LLM порождают усреднённый текст: токены, вероятности и обучающие данные

  3. 03

    Деградация моделей при рекурсивном обучении: что говорит исследование Nature

  4. 04

    «Вавилонская библиотека» Борхеса как метафора современного интернета

Количество страниц в интернете растёт, а разнообразия в них становится меньше. Показательный бытовой тест описан в разборе на Habr: из восьми открытых по одному запросу вкладок семь рассказывают одно и то же, одними и теми же оборотами, в одном и том же порядке (разбор на Habr). Это наблюдение автора, а не измерение, но оно совпадает с тем, на что жалуются разработчики и все, кто ищет техническую документацию: выдача выглядит наполненной, а нового знания в ней мало.

Причина не в том, что тексты исчезли. Изменился баланс между объёмом и разнообразием: генерация дешёвая, публикация мгновенная, а проверка и личный опыт по-прежнему стоят времени. Когда тысячи сайтов собирают материал одним и тем же способом, результат сходится к среднему.

Речь о тренде, а не о том, что весь интернет уже написан нейросетями. Человеческие тексты, документация, исследования и форумы никуда не делись. Проблема в пропорции: их всё труднее найти среди усреднённого слоя.

Что изменилось: страниц больше, а информации меньше

Механика простая. Большинство сайтов, которые сегодня выкладывают статьи про ИИ, работают с одними и теми же инструментами: берут популярную модель, дают ей типовой промпт, получают гладкий текст и публикуют. Пятьдесят таких сайтов дадут пятьдесят почти одинаковых страниц, потому что источник у них общий — обучающие данные модели.

Усугубляет картину поисковая выдача. Алгоритмы ранжирования поощряют страницы, похожие на уже успешные: если топ занимает обзор со структурой «что это, зачем нужно, как начать», следующий автор воспроизводит ту же структуру, чтобы не потерять позиции. Так усреднение закрепляется на уровне формата, а не только формулировок.

Для читателя это выглядит как дефицит информации при избытке текста. Ответ вроде бы есть на каждом сайте, но он не отвечает на конкретный вопрос, потому что написан не про конкретный случай, а про общий.

Почему поиск стал чаще возвращать одно и то же

Ключ к происходящему в том, что усреднение возникает на входе, а не на выходе. Модель не решает выдать шаблон, она выдаёт наиболее вероятное продолжение, а вероятности выучены из корпуса, где типовые формулировки встречаются чаще редких.

Возьмите запрос про запуск локальной LLM. Десять статей в выдаче почти наверняка совпадут по костяку: требования к VRAM, упоминание квантизации, предупреждение про размер контекста, пара команд запуска. Все десять могут быть корректными, но ни в одной не будет того, что читатель искал: как поведёт себя конкретная модель на конкретной карте при заданной длине контекста.

Это не доказывает коллапс интернета. Это указывает на дефицит разнообразия, а следом и на дефицит проверки: усреднённый абзац не ссылается на первоисточник, потому что его источник — статистика, а не документ.

Данные Ahrefs и Graphite: что именно они показывают

Рост доли ИИ-сгенерированного контента фиксируют в отчётах разные команды: Ahrefs публиковал свои оценки в апреле 2025 года, Graphite — в мае 2026 года. Обе работы указывают на одно направление тренда: сгенерированных страниц в выдаче и в общем объёме веба становится больше.

Конкретные проценты из этих отчётов здесь не привожу сознательно. Методики различаются: кто-то считает по детекторам ИИ-текста, кто-то по поведению сайтов, кто-то по выборке страниц. Цифры при таком разном подходе плохо сопоставимы, а пересказ числа без доступа к первичной публикации превращается в догадку. Поэтому опираюсь на сам тренд, а не на конкретные значения.

Что эти данные показывают точно: доля машинного текста растёт. Чего они не показывают: что интернет деградировал целиком. Рост доли и полный коллапс — два разных утверждения, и второе из первого не следует.

Как LLM порождают усреднённый текст: токены, вероятности и обучающие данные

Для модели текст существует как последовательность токенов. Любая строка, от осмысленного абзаца до случайного набора символов вроде «RFg♴4#-f体$fÆmZ», для неё в конечном счёте набор чисел. Смысл за этими числами придумывают люди и пытаются передать сети во время обучения (разбор на Habr). Токенизация не несёт семантики сама по себе: она лишь разбивает текст на единицы, с которыми работает модель.

Дальше начинается генерация. Модель не хранит тексты и не выдаёт их из базы. Она предсказывает следующее продолжение по вероятностям, выученным на корпусе. Чем чаще какая-то формулировка встречалась в обучающих данных, тем выше шанс, что она появится в ответе.

Отсюда усреднение. Если корпус собран из тысяч статей про локальные LLM, ответ будет похож на усреднённую такую статью: те же шаги, те же предупреждения про память, те же команды. Ничего не скопировано дословно, но и ничего своего в тексте нет.

Почему «усреднение» — это не баг, а свойство модели

Вероятностная генерация даёт усреднение по построению. Модель выбирает правдоподобные продолжения, а правдоподобное совпадает с частым. Это не поломка, которую можно выключить флагом.

Практическое следствие простое: чем типичнее запрос, тем типичнее ответ. Запрос «что такое RAG» даст гладкий обзор, неотличимый от десятка других в выдаче. Нестандартный результат получается другими средствами: нестандартной постановкой задачи, своими данными, подачей контекста через RAG, примерами в промпте.

Ограничение тут же: нестандартный промпт меняет форму ответа, но не его достоверность. Красиво сформулированный абзац остаётся вероятностным текстом, а не проверенным фактом.

Что это значит для обучения будущих моделей

Если следующее поколение моделей обучать на текстах предыдущего, усреднение накапливается. Корпус всё сильнее состоит из уже усреднённых формулировок, а редкие детали вымываются. Это тот же процесс, который Борхес описал иначе, но про него ниже.

На практике обучать на синтетике всё равно можно и нужно, вопрос в пропорции. Смешивание с человеческими данными, фильтрация, отбор источников — рабочая стратегия, и она уже применяется в индустрии. По состоянию на середину 2026 года крупных LLM, обученных только на человеческих текстах, не существовало; причины, экономика сбора корпуса и инструменты фильтрации синтетики разобраны в отдельном материале про претрейнинг.

Деградация моделей при рекурсивном обучении: что говорит исследование Nature

Эффект, при котором модель, обученная на собственных выходах, теряет качество, называют model collapse. Механизм описали Shumailov и соавторы в работе, опубликованной в Nature. Логика такая: рекурсивное обучение сужает распределение данных и постепенно убивает разнообразие.

Почему обучение на сгенерированных данных ведёт к деградации

Разберём по шагам.

  1. Первая модель учится на человеческих данных с длинным хвостом распределения: редкие случаи, ошибки, странные примеры, исключения из правил.
  2. Она генерирует текст, тяготеющий к типичному: хвост распределения в её выводе представлен слабо.
  3. Вторая модель учится на этом выводе. Редкие случаи попадают в корпус реже, а часть исчезает совсем.
  4. Каждый следующий цикл сужает распределение дальше. В пределе модель уверенно воспроизводит среднее и почти не умеет работать с тем, что в среднее не входит.

Аналогия: пересказывать одну и ту же историю по кругу. Первый пересказ теряет немного, десятый оставляет общий сюжет и общие слова, а детали, ради которых историю и стоило слушать, пропадают. Хвост распределения — это и есть те самые детали.

Какие есть оговорки и почему это не приговор

Оговорки существенны. Результаты зависят от условий: доля синтетики в корпусе, число циклов, размер модели, способ фильтрации. Не всякое обучение рекурсивно. Модель, которую дообучают на смеси своих выходов и живых данных, деградирует иначе, чем модель, которую учат на своих выходах с нуля.

Практика это учитывает. Курируемые наборы данных, отбор примеров людьми, контроль доли синтетики работают; пример такого подхода к сбору данных разбирается на примере Community Library Creator от Microsoft. Откуда вообще берётся обучающий корпус и какие у этого юридические последствия, разобрано в материале про иск против Anthropic.

Исследование Nature указывает на риск, а не на неизбежный коллапс. Из него следует требование к качеству данных, а не вывод о том, что учить модели больше нельзя.

«Вавилонская библиотека» Борхеса как метафора современного интернета

В 1941 году аргентинский прозаик Хорхе Луис Борхес написал рассказ о библиотеке, в которой стоят все возможные книги, то есть любые сочетания знаков, какие вообще можно уложить в книгу. Рассказ называется «La biblioteca de Babel», в переводе «Вавилонская Библиотека», и вышел он в сборнике «El jardín de senderos que se bifurcan» в 1941 году. Детали и сама аналогия с интернетом разобраны в статье на Habr (источник).

Библиотека у Борхеса устроена как мир из шестигранных комнат. Стены комнат служат полками: двадцать полок, по пять длинных на каждой стене, кроме двух, чья высота едва превышает средний рост библиотекаря. Среди всех возможных книг там лежат все настоящие тексты человечества, все их черновики, все переводы и все опечатки к ним.

И при этом примерно 99,9% книг — шлак и бред. В этом суть метафоры: из-за бесконечности вариантов в библиотеке может найтись и точная биография любой жизни, и перевод Библии на несуществующий язык, и словарь к этому языку, и каталог, где указано место всех словарей. Полезное существует, но тонет в шуме.

Аналогия с интернетом принадлежит автору того разбора, и это мнение, а не измеренный факт. Отношусь к ней так же: как к способу увидеть пропорции, а не как к диагнозу. Интернет не стал библиотекой Борхеса и вряд ли станет: там генерируются новые тексты, а не выкладываются все возможные.

Что именно общего у библиотеки Борхеса и интернета с ИИ-контентом

Общего два: объём и пропорция. Текстов много, полезного среди них мало, и найти его трудно именно из-за объёма.

Различие важнее. Библиотека Борхеса содержит все возможные комбинации знаков, включая ещё не написанное. ИИ-контент работает иначе: он усредняет то, что уже есть в обучающих данных, и стягивает пространство текстов к середине. Дописать несуществующее он не может по определению, потому что не генерирует варианты, а взвешивает вероятности.

Почему это «хуже»: дефицит проверки, а не текста

Проблема не в количестве. Текста стало больше, а проверенного знания нет. Сгенерированный абзац выглядит гладко, не противоречит сам себе и не содержит грамматических ошибок, и именно поэтому его легко принять за источник.

В библиотеке Борхеса истина существовала, её надо было искать. В интернете с ИИ-контентом истину размывает усреднённая формулировка: она повторяется так часто, что перестаёт указывать на первоисточник. Сверка с оригиналом становится обязательным шагом, а не формальностью.

Что это значит на практике: как искать информацию и не обманываться

ИИ приносит реальную пользу, когда его используют как инструмент, а не как оракула. Разница проявляется в том, что вы делаете с ответом дальше.

Как отличить правдоподобный ответ LLM от проверенного

Рабочие критерии, которые можно применять сразу.

  • Проверяемость. Есть ли у утверждения первоисточник: документация, релиз, статья, спецификация. Уверенное «модель поддерживает X» без ссылки на документацию — повод проверить.
  • Воспроизводимость. Можно ли получить тот же результат самому: запустить команду, открыть файл конфигурации, посмотреть карточку модели.
  • Согласованность. Совпадает ли факт с независимыми источниками, а не с десятью пересказами одного и того же.
  • Дата и версия. Устаревшие сведения о моделях и требованиях к железу выглядят так же уверенно, как свежие.
  • Конкретика. Точное число, имя параметра или шаг настройки проверяются; общая фраза про «гибкость и производительность» не проверяется никак, потому что ничего не утверждает.

Тон модели не связан с достоверностью. Уверенность в ответе — свойство стиля, а не показатель того, что данные проверены.

Как сохранить навык сверки с первоисточниками

Привычки, которые снижают риск ошибки.

  • Для решений, которые дорого откатывать, сначала первоисточник: официальная документация, карточка модели, научная работа, релиз. ИИ при этом годится как навигатор и черновик.
  • Обращайте внимание на даты. Для железа и моделей полгода — заметный срок.
  • Держите список доверенных источников по своим темам: репозитории проектов, документация, авторы, которых вы читаете регулярно.
  • При работе с RAG проверяйте, на какие документы ссылается система и попадают ли они в контекст. Ответ без опоры на найденный документ означает работу по памяти модели.

Тот же принцип работает там, где LLM обрабатывает большие объёмы текста: машинный проход даёт черновик, а расхождения и терминологию вычитывает человек. Как это устроено на примере перевода книг локальной моделью, разобрано в разборе пайплайна перевода с ручной вычиткой.

Гарантии истины эти привычки не дают. Они снижают вероятность того, что правдоподобный ответ уйдёт в работу непроверенным.

Итог: не коллапс интернета, а дефицит проверки

Рост ИИ-контента не доказывает коллапс интернета. Он указывает на дефицит проверки информации, а не на дефицит текста. Усреднение формулировок объясняется вероятностной природой LLM и массовым использованием одинаковых инструментов на одинаковых данных, а не чьим-то злым умыслом.

Деградация моделей при рекурсивном обучении на сгенерированных данных — реальный риск, описанный в Nature, но не приговор: доля синтетики в корпусе, фильтрация и отбор примеров управляемы, а доступ к человеческим данным сохраняется.

Что можно сделать со своей стороны уже сейчас: держать в голове ограничения LLM, не считать уверенный тон доказательством, для важных решений открывать первоисточник и проверять, на чём основан ответ. Это не отказ от ИИ, а способ пользоваться им без потери качества решений.

Подписаться на канал