Фундаментальная физика уже больше десяти лет не получала подтверждённого отклонения от Стандартной модели, которое потребовало бы новой физики. В статье «Кризис физики: теория должна уметь умереть» на Хабре кризис описан иначе: проблема не в дефиците данных, а в том, что механизм отсева теорий перестал успевать за их производством. Пространство допустимых теорий растёт быстрее, чем эксперименты успевают его сокращать.
Если сжать до одного абзаца: фальсифицируемость работает на уровне отдельной модели, но не на уровне исследовательской программы целиком. Тёмная материя даёт десятки проверяемых моделей, каждая из которых может быть закрыта, при этом сама программа остаётся эластичной и переживает любой отрицательный результат. ИИ работает как ускоритель этого дисбаланса: он снижает стоимость генерации гипотез и текстов, тогда как стоимость измерения остаётся высокой.
Дальше разберём механизм, три риска (фабрику эпициклов, синтетический консенсус и переобучение на Вселенной), а также два практических ответа: эмпирический контракт теории и разделение ролей между ИИ-агентами.
Почему кризис физики - это кризис фальсифицируемости, а не нехватка частиц
Привычное объяснение кризиса звучит так: коллайдеры не нашли ничего нового, значит, нужны машины мощнее. Объяснение верное лишь отчасти. Данные не отсеивают теории с той скоростью, с какой те появляются, и накопление необработанного пространства гипотез даёт эффект, который выглядит как застой.
Что такое эмпирическая дискриминация и почему она ломается
Эмпирическая дискриминация - это отбор теорий данными. Каждый эксперимент обладает конечной разрешающей способностью: он различает не «теорию вообще», а конкретный класс моделей в определённом диапазоне параметров. Детектор проверяет не идею, а предсказание: скорость событий, сечение, сдвиг частоты, форму спектра.
Поломка происходит из-за асимметрии двух издержек. Сформулировать новую модель можно за вечер, проверить её - за годы. Подземный детектор расставляет ограничения шаг за шагом и стоит сотни миллионов долларов. Один сеанс на коллайдере занимает годы подготовки и обработки. Пока экспериментаторы закрывают один диапазон параметров, теоретики открывают десять новых.
Результат: отрицательный результат перестаёт убивать программу. Он убивает модель, а на её месте появляется модификация. Попперовский критерий «теория запрещает наблюдение» выполняется формально, но запрет касается узкого угла, а не всей программы.
Тёмная материя как пример эластичной исследовательской программы
Моделей тёмной материи много, и они разные по типу: слабовзаимодействующие массивные частицы (WIMP), аксионы и аксионоподобные частицы, стерильные нейтрино, первичные чёрные дыры. Каждая конкретная модель делает проверяемое предсказание: массу, сечение взаимодействия, характерный сигнал в детекторе. WIMP ищут прямыми детекторами вроде XENONnT и LUX-ZEPLIN, аксионы - резонансными схемами вроде ADMX, стерильные нейтрино - по рентгеновским линиям, первичные чёрные дыры - через микролинзирование.
Отрицательные результаты не закрыли программу. Они сдвинули интерес к другим массам и механизмам: если WIMP не виден в чувствительных детекторах, проверяются аксионы; если и там пусто, остаются стерильные нейтрино и первичные чёрные дыры. Лакатос описал такую конструкцию как исследовательскую программу с твёрдым ядром и защитным поясом гипотез: эксперимент бьёт по поясу, ядро остаётся нетронутым.
Независимые основания у тёмной материи при этом есть: кривые вращения галактик, гравитационное линзирование, структура реликтового излучения, поведение скоплений при столкновениях. Это набор наблюдений, которые плохо объясняются одной видимой материей. Именно поэтому программа живёт: у неё сильная эмпирическая мотивация при слабой селективности моделей.
Эмпирическая жёсткость теории: как отличить науку от подгонки
Полезный критерий - эмпирическая жёсткость: способность теории принимать удары данными, не обрастая спасательными надстройками. Жёсткая теория ломается при расхождении, эластичная выкручивается: подстраивает параметр, добавляет поле, расширяет сектор. Жёсткость ничего не говорит об истинности, но определяет, сколько информации приносит проверка.
Жёсткие и эластичные теории: примеры и критерии
Общая теория относительности - пример жёсткой конструкции: красное смещение, отклонение света, задержка сигнала, гравитационные волны, смещение перигелия Меркурия. Убрать любой из этих эффектов, не разрушив теорию, нельзя. Стандартная модель в проверяемой части тоже жёсткая: она связывает большое число измерений небольшим набором параметров, и каждое новое измерение проверяет согласованность всей конструкции.
Эластичная теория обычно имеет свободные параметры, которые можно двигать после того, как данные пришли. Инфляционные модели и большинство моделей тёмной материи попадают сюда: качественные эффекты они предсказывают, а количественные детали настраивают.
Практические критерии, по которым жёсткость оценивают:
- число свободных параметров и то, насколько легко они подгоняются после факта;
- количество независимых наблюдений, которые теория связывает одним механизмом;
- наличие запретов: говорит ли теория, что чего-то не будет;
- цена спасения: сколько допущений нужно добавить, чтобы пережить отрицательный результат.
Почему эластичность не всегда плоха
Квантовая механика в середине 1920-х выглядела рыхло: несколько формулировок, подгонка спектров, споры о том, что считать наблюдаемым. Жёсткой она стала позже, когда предсказала эффект Комптона, тонкую структуру спектра водорода и поведение ансамблей частиц. Эластичность на раннем этапе - плата за вход в новую область, где нет ни данных, ни языка описания.
Опасность начинается там, где эластичность становится постоянным режимом. Программа, которая десятилетиями не может ни подтвердиться, ни закрыться, тратит ресурс сообщества на поддержание защитного пояса.
Как ИИ усиливает дисбаланс: фабрика эпициклов и синтетический консенсус
LLM меняют соотношение издержек в пользу генерации. Текст статьи, обзор литературы, вариант модели с новым полем - всё это модель выдаёт быстро. Эксперимент ускорить так же не получается: физика упирается в железо, время наблюдения, статистику и обработку данных. Разрыв между производством гипотез и возможностью их проверить увеличивается.
Почему удешевление генерации гипотез - не всегда благо
Научный конвейер требует фильтра. Если фильтрация дорогая, а генерация дешёвая, на выходе растёт доля текстов, которые нечем проверить. Автор оригинала называет это фабрикой эпициклов: система автоматически порождает всё более сложные модели, чтобы сохранить старую идею живой.
Историческая параллель - эпициклы Птолемея. Каждый новый эпицикл улучшал согласие с наблюдениями, и модель в целом работала. Проблема была в другом: сложность росла, а точность не окупала её. Гелиоцентрическая схема выиграла потому, что описывала те же наблюдения заметно меньшим числом допущений.
Тот же критерий применим к ИИ-гипотезам: если новая модель уменьшает сложность или даёт новое проверяемое предсказание, она полезна. Если только подгоняет уже известные данные, это переобучение на Вселенной. Датасет один и тот же - наблюдаемая Вселенная, и подогнать под него можно очень многое.
Синтетический консенсус: как ИИ создаёт иллюзию научного согласия
Второй эффект работает через тексты. Модель пишет обзор, другой агент опирается на этот обзор, третий делает мета-обзор, четвёртый встраивает вывод в учебный материал. Эмпирической проверки не было ни на одном шаге, но в корпусе текстов накапливается утверждение, выглядит как согласованно поддержанное.
Дальше включается петля обучения: корпус с этим утверждением попадает в датасет следующего поколения моделей, и оно возвращается как факт. Деградация при обучении на сгенерированных данных описана для LLM и здесь работает в усиленном виде, потому что проверка в фундаментальной физике не быстрая.
В физике это проявляется конкретно: в литературе появляется длинный список моделей, каждая из которых ссылается на предыдущую, а не на данные. Цитируемость создаёт видимость прогресса при нулевом эмпирическом приросте.
Эмпирический контракт теории: практический ответ на кризис
Если проблема в отсутствии фильтра, фильтр нужно сделать явным и дешёвым. Эмпирический контракт теории - это набор обязательств, которые автор фиксирует заранее и не переписывает задним числом.
Из чего состоит эмпирический контракт
| Пункт | Что фиксирует | Контрольный вопрос |
|---|---|---|
| Область утверждений | Какие явления модель описывает, а какие её не касаются | Что модель запрещает предсказывать? |
| Критерии отказа | Какие результаты измерений означают смерть модели | Какого результата достаточно, чтобы закрыть работу? |
| Замороженные предсказания | Перечень предсказаний, зафиксированных до получения данных | Предсказание записали раньше результата или после? |
| Бюджет спасения | Сколько модификаций допускается до признания провала | После какой правки модель считается новой? |
| Мощность исключения | Какие альтернативы отсекает положительный результат | Что мы перестанем рассматривать, если модель подтвердится? |
Мощность исключения важнее, чем кажется. Эксперимент, который подтверждает модель и не отсекает ничего другого, почти не двигает пространство теорий. Эмпирическая ценность измеряется тем, сколько альтернатив он вычёркивает.
Как применять контракт на практике
Работает это как заполнение формы. Для выбранной модели: опишите диапазон параметров и тип взаимодействия; назовите конкретный наблюдательный результат, который её закроет; зафиксируйте предсказания до обработки данных; определите, сколько уточнений допустимо, прежде чем модель станет другой теорией; перечислите альтернативы, которые уйдут вместе с ней.
Если модель не может заполнить все пять пунктов, вопрос не в бюрократии, а в эмпирической ценности. Модель, для которой нельзя назвать ни одного результата-убийцы, не проверяема, и её место - в обзоре, а не в списке приоритетов.
Логика здесь та же, что в разработке через API-контракты: сначала фиксируется интерфейс и ожидаемое поведение, потом пишется код. На AI-Manual об этом есть отдельный разбор, проектирование вместо кода. В физике контракт играет роль интерфейса между теорией и экспериментом.
ИИ как проектировщик экспериментов: разделение ролей
Генерация гипотез - лишь часть работы, которую можно переложить на модели. Тот же вычислительный ресурс, который засоряет пространство теорий, разворачивается в обратную сторону: ИИ отбирает эксперименты, сильнее всего сокращающие это пространство.
Информационный выигрыш как критерий выбора эксперимента
Критерий называется информационным выигрышем: ожидаемое сокращение неопределённости в распределении по конкурирующим моделям. Простыми словами, эксперимент полезен настолько, насколько сильно он меняет вероятности гипотез после получения результата.
Считается это в духе активного обучения: модель сама выбирает объекты, разметка которых даст больше всего информации. В физике «разметка» - это измерение. Если все конкурирующие модели предсказывают одинаковый сигнал в доступном диапазоне, эксперимент не различает ничего, каким бы дорогим он ни был. Обратный случай: измерение, где предсказания расходятся в разы, стоит приоритета.
ИИ здесь полезен как вычислительный инструмент: он быстро прогоняет пространство моделей, считает расхождения предсказаний и ранжирует варианты измерений. Формулировка задачи прозрачная: максимизировать ожидаемое уменьшение энтропии при фиксированном бюджете.
Роли теоретика, прокурора, экспериментатора и аудитора
Продуктивная схема - развести функции по разным агентам, чтобы они не подыгрывали друг другу.
- Теоретик генерирует гипотезы и формулирует предсказания.
- Прокурор ищет опровержения: какой результат убьёт модель, где границы применимости, какие допущения держат конструкцию.
- Экспериментатор планирует измерения с максимальным информационным выигрышем и оценивает издержки.
- Аудитор проверяет соблюдение контракта: не переписаны ли предсказания, не превышен ли бюджет спасения, не подменены ли критерии отказа.
Технически это разные системные промпты, разные наборы инструментов и, желательно, разные модели. Ключевое правило: агент не оценивает собственную гипотезу. Прокурор и аудитор выигрывают от того, что находят ошибку, а не от согласия с теоретиком, и это снижает риск синтетического консенсуса внутри самой системы.
Что это значит для практиков AI-Manual
Описанные механики работают не только в фундаментальной науке. Любая задача, где ИИ генерирует варианты, а проверка стоит дорого, сталкивается с той же асимметрией: контент, код, гипотезы, аналитические записки.
Применение эмпирического контракта к AI-проектам
Перенос прямой. Область утверждений: какие задачи решает модель, на каких данных, чего она не делает. Критерии отказа: метрика и порог, ниже которого подход признаётся непригодным. Замороженные предсказания: тестовый набор фиксируется до экспериментов с промптами и дообучением. Бюджет спасения: сколько итераций промпта и дообучений допускается, прежде чем решение считается провалившимся. Мощность исключения: какие альтернативы отсекает победа этой модели, например отказ от более крупной модели или от облачного API в пользу локального запуска.
Без такого контракта проект становится эластичным: качество всегда можно «дотянуть» ещё одной итерацией, критерий успеха плавает, а решение не принимается. Разборы на AI-Manual показывают, где ИИ-ассистенты действительно экономят время, а где добавляют переделку, экономия времени или потеря экспертизы.
Разделение ролей в AI-агентах для автоматизации
Схема «генератор, критик, исполнитель, аудитор» уже используется в агентных пайплайнах. В RAG-контуре она выглядит так: один агент собирает гипотезу по найденным документам, второй ищет противоречащие фрагменты и проверяет цитируемость, третий выполняет действие, четвёртый сверяет результат с исходными требованиями.
Чтобы конструкция не превращалась в синтетический консенсус, ролям нужны разные источники: критик не должен читать только выводы генератора. Ещё одно условие - журнал решений: какие утверждения приняты, на каких основаниях и что их опровергло. Как это устроено в корпоративных сценариях, разобрано в материале о корпоративных ИИ-агентах.
Ограничения и риски: чего ИИ пока не может
Галлюцинации и переобучение на Вселенной
LLM оперируют символами и статистикой текста. Физической интуиции, проверяющей, держится ли конструкция, у них нет. Отсюда галлюцинация: уверенное утверждение, у которого нет основания в данных или логике.
Опаснее выглядит другой сценарий. Модель строит выражение, которое точно описывает известные измерения, и подаёт его как теорию. Предсказательной силы нет: любое новое измерение окажется за пределами подгонки. Для ИИ это переобучение, для физики - та же болезнь под другим названием, потому что датасет ровно один: наблюдаемая Вселенная.
Почему ИИ не заменит экспериментальную проверку
Генерация гипотез не заменяет измерение. ИИ ускоряет отсев, помогает планировать эксперименты, проверяет логическую согласованность и цитируемость, но решение о том, что теория мертва, принимает эксперимент. Формулировка из оригинала точная: теория должна уметь умереть, а умирает она от данных, а не от аргумента в тексте.
Ограничение второго порядка - стоимость проверки. Если измерение стоит годы и сотни миллионов, ускорение генерации не устранит дисбаланс само по себе. Контракт и разделение ролей снижают потери, но не отменяют потребность в экспериментах, которые что-то различают.
Заключение: как сохранить фальсифицируемость в эпоху ИИ
Ключевые выводы
- Кризис фальсифицируемости - это дисбаланс между стоимостью генерации теорий и стоимостью их проверки. Отрицательные результаты закрывают модели, но не программы.
- Эмпирическая жёсткость помогает оценить, сколько информации приносит проверка. Жёсткая теория ломается, эластичная ищет спасение.
- ИИ усиливает дисбаланс: фабрика эпициклов, синтетический консенсус и переобучение на Вселенной растут вместе с доступностью генерации.
- Эмпирический контракт задаёт фильтр: область утверждений, критерии отказа, замороженные предсказания, бюджет спасения, мощность исключения.
- Разделение ролей между ИИ-агентами (теоретик, прокурор, экспериментатор, аудитор) превращает модели из генераторов текста в инструмент отбора.
Что читать дальше
Первоисточник идей - статья «Кризис физики: теория должна уметь умереть» на Хабре: там подробно разобраны эмпирическая жёсткость, эластичность исследовательских программ и роль ИИ в генерации гипотез.
Практическую часть стоит проверять на своих задачах. На AI-Manual есть материалы о локальных LLM, AI-агентах, RAG и автоматизации, включая разбор того, как агентные системы закрывают исследовательские запросы аналитиков, побочный продукт ИИ-агента. Начните с одной модели и одного контракта к ней: зафиксируйте, что она должна делать, какой результат закроет подход и сколько попыток вы готовы потратить.