Перейти к содержанию
Публикация AiManual

ООН переводит статистику на AI-агентов: как UN System Data Commons и MCP меняют доступ к данным

ООН заменила UNData на UN System Data Commons и открыла статистику своих агентств для AI-агентов через MCP: 26 подключённых структур и цель в 80% наборов к 2027

Коротко

Что будет в материале

  1. 01

    Что такое UN System Data Commons и зачем ООН заменила UNData

  2. 02

    Как MCP меняет доступ AI-агентов к авторитетным данным

  3. 03

    Почему LLM не справляются со статистикой: тест UNICEF и цифры, которые всё объясняют

  4. 04

    Рост трафика из AI-ассистентов: почему ООН адаптируется под новый канал

Что такое UN System Data Commons и зачем ООН заменила UNData

ООН заменила портал UNData на UN System Data Commons, открытую платформу на базе проекта Google Data Commons. Платформа автоматически объединяет метрики, временные рамки и географические границы, создавая связанную среду, где данные говорят на одном языке. К системе уже подключились 26 структур ООН, данные почти 20 из них доступны на старте, а к 2027 году организация рассчитывает перенести на неё 80% своих статистических наборов.

Ключевая техническая деталь в другом: данные отдаются и людям, и AI-агентам через Model Context Protocol (MCP). Агент запрашивает конкретный показатель на естественном языке и получает цифру с привязкой к исходному набору данных ООН. Поводом для перехода стал тест UNICEF: на более чем 133 000 ответов шести LLM средняя точность по показателям глобального развития составила 21,2%.

Дальше разберём, из чего собрана платформа, как MCP меняет работу агентов с авторитетной статистикой, какие ограничения остаются и что из этого стоит забрать в свои проекты.

Почему UNData устарела: изолированные системы и конфликтующие форматы

Проблема была не в отсутствии данных, а в их несовместимости. Агентства системы ООН ежегодно собирают огромные массивы статистики для отслеживания глобальных вызовов: общественного здравоохранения, борьбы с бедностью, образования, климата. Раньше эти данные хранились в изолированных системах с конфликтующими форматами, и согласование занимало у аналитиков месяцы ручной работы.

Один и тот же индикатор в разных агентствах мог иметь разную периодичность, разные определения и разные географические привязки. Чтобы сравнить показатель по гендерному равенству из двух агентств, аналитику приходилось вручную свести форматы: привести годы к одному ряду, сопоставить названия стран и регионов, проверить совпадение методик сбора. Каждая такая операция создаёт место для ошибки, а результат почти невозможно воспроизвести через полгода.

Роль Google Data Commons и что даёт открытая архитектура

Платформа построена на базе открытого проекта Google Data Commons. Это даёт единую модель данных: метрика, временной ряд и география связаны между собой, а не лежат отдельными таблицами. Запрос опирается на эту структуру, поэтому пользователю не нужно знать, в каком именно агентстве живёт нужный показатель.

Финансирование у истории смешанное. Google.org выделила $2 млн на инфраструктуру, но развивать и поддерживать систему ООН планирует самостоятельно. Для долгосрочной устойчивости это хороший знак: ключевой игрок здесь ООН, а не вендор, который может сменить приоритеты. Обратная сторона в том, что темпы развития зависят от внутренних ресурсов организации.

Как MCP меняет доступ AI-агентов к авторитетным данным

Поддержка Model Context Protocol делает данные платформы готовыми для AI-агентов. Агент может автономно извлечь авторитетные цифры, связать информацию из разных областей и собрать готовый отчёт, график или инфографику. Разница с обычным веб-поиском принципиальная: модель не вспоминает число из обучающих данных, а получает значение из структурированного источника, прошедшего валидацию.

Для статистики это ключевой момент. Схема «спроси LLM назвать показатель и проверь ответ» упирается в то, что модель отвечает уверенно и одинаково убедительно как с верной цифрой, так и с выдуманной. MCP переносит вопрос из плоскости доверия к модели в плоскость доступа к источнику.

MCP простыми словами: зачем AI-агенту протокол доступа к данным

MCP описывает, как подключить модель к внешнему источнику так, чтобы она могла запрашивать конкретные значения, а не полагаться на память. На практике это набор инструментов, которые агент вызывает по мере необходимости. Запрос «доля женщин среди министров обороны за 2024 год» превращается в вызов, который возвращает число и метаданные к нему.

Стандарт набирает поддержку у разных вендоров, и это меняет архитектуру приложений: интерфейс уходит на второй план, действия выполняет агент. Подробнее про эту логику и кейсы Selectel, NVIDIA и Anthropic мы разбирали в материале про MCP как новый интерфейс продукта. ООН здесь интересна тем, что по этому протоколу впервые отдаётся официальная межгосударственная статистика.

Прослеживаемость: почему каждая цифра привязана к источнику ООН

Агент получает не голое число, а значение вместе с привязкой к исходному набору данных. Все данные на платформе проходят валидацию статистиками и техническими экспертами системы ООН. Это критично для отчётов, где важна проверяемость: если агент формирует документ по Цели устойчивого развития № 5, каждая цифра должна вести к конкретному показателю и агентству, а не к пересказу модели.

Проверяемость работает в обе стороны. Пользователь видит, откуда взялось значение, а статистики ООН сохраняют контроль над трактовкой. Если показатель обновился или методику пересмотрели, это отражается в источнике, и агент получает новую версию, а не зафиксированный в весах модели старый снимок.

Почему LLM не справляются со статистикой: тест UNICEF и цифры, которые всё объясняют

Именно тест UNICEF дал ООН повод действовать. Проверили более 133 000 ответов шести моделей: GPT-4o и GPT-4o-mini, Claude Sonnet 4.5 и Claude Haiku 4.5, Gemini 2.5 Flash и Gemini 2.0 Flash. Средняя точность по показателям глобального развития составила 21,2%.

21,2% точности: что стоит за средней цифрой

Больше четырёх ответов из пяти содержали неверную цифру либо не содержали её вовсе. Порядка трёх из пяти ответов вообще не дали пригодного числа: модель рассуждала вокруг темы, но конкретного значения не приводила. Остальные цифры относились к другому году, региону или определению показателя.

Важная оговорка: в отчёте приведена средняя точность по шести моделям, без разбивки по каждой из них. Нельзя утверждать, что все модели ошибались одинаково, как и выбирать из списка «лучшую» по этому тесту.

Нестабильность ответов: почему одна и та же цифра меняется при повторном запросе

При повторном прогоне тех же вопросов модели давали идентичную цифру лишь примерно в половине случаев. Это опаснее простой ошибки. Даже если ответ случайно оказался верным, при следующем запросе он может измениться, а значит отчёт, построенный на таком ответе, невозможно воспроизвести.

Причина в природе генерации: модель подбирает следующий токен вероятностно, и при ненулевой температуре один и тот же промпт даёт разные тексты. Для творческих задач это плюс, для статистики минус. Практический вывод простой: любую цифру из LLM нужно проверять, а когда отчёт строится на десятках показателей, проверка съедает всю экономию времени.

Рост трафика из AI-ассистентов: почему ООН адаптируется под новый канал

Пользователи всё чаще добираются до статистики через AI-интерфейсы. Переходы на сайт данных UNICEF из ответов ChatGPT выросли на 67% год к году, а в целом на AI-ассистентов приходится примерно каждый десятый визит. Это уже не эксперимент, а заметный канал.

Логика ООН понятна: если люди спрашивают цифры у ассистента, правильный ход не бороться с этим, а отдать ассистенту проверенный источник. MCP-доступ закрывает такой сценарий: посредник получает структурированные данные и ссылку на первоисточник вместо пересказа статьи. Рост трафика из ассистентов стоит считать важным фактором, но не единственной причиной запуска платформы.

Что это значит на практике: как использовать UN System Data Commons в своих AI-инструментах

Архитектурно всё просто: MCP-сервер подключается к вашему агенту как источник инструментов, и дальше модель сама решает, когда запросить данные. На стороне приложения работает MCP-клиент, который принимает вызовы агента и передаёт их серверу. Агенту не нужен парсер веб-страниц и не нужна выгрузка CSV в контекст. Это тот же принцип, что и в корпоративных агентных системах, где MCP-инструменты вынесены в отдельный шлюз: пример такой схемы с ролевыми агентами и запросами к Athena и S3 мы разбирали в кейсе AvioBook на Amazon Bedrock AgentCore.

Сценарии для разработчиков: отчёты, дашборды, визуализации

Первый сценарий: агент по запросу «покажи динамику по гендерному равенству в образовании за 10 лет» собирает ряд и строит график. Второй: подготовка черновика отчёта, где цифры подставляются автоматически вместе со ссылками на источники. Третий: RAG-система поверх валидированных данных, где модель отвечает по фактам из источника, а не по памяти.

С инженерной точки зрения важно, что MCP даёт структурированный доступ, а не парсинг. Это снимает целый класс проблем с версткой, обновлениями страниц и неоднозначным разбором таблиц. Конкретный набор методов и параметров зависит от реализации сервера: перед встраиванием в продукт проверьте, какие показатели и срезы вам реально доступны.

Ограничения, которые остаются: где всё ещё нужен человек

Доступ к верной цифре не равен верному выводу. Модели могут неверно интерпретировать нюансы, поэтому человеку всё равно нужно проверять выводы. Агент способен перепутать единицы измерения, сложить показатели с разными определениями или сделать обобщение, которое методика не поддерживает.

Пример: данные о насилии в отношении женщин требуют понимания методологии сбора и того, что именно попадает в выборку. Агент получит корректное число и может неверно его проинтерпретировать, если в промпте нет контекста. Сюда же добавляются вопросы авторизации и юридических ограничений, о которых мы писали в разборе архитектуры MCP для агентной коммерции. Платформа решает проблему доступа к цифрам, проблему их трактовки она не решает.

Контекст: какие данные уже доступны и насколько они показательны

Пример масштаба наборов, с которыми работает система, даёт доклад Gender Snapshot за 2026 год. При нынешних темпах прогресса для достижения гендерного равенства потребуется 171 год, и ни один из показателей Цели устойчивого развития № 5 не будет достигнут к 2030 году, если ничего не изменится.

  • Мужчины возглавляют шесть из семи стран мира.
  • Почти 90% министров обороны и более 80% министров финансов мужчины.
  • Женщины занимают 6% должностей генеральных директоров и возглавляют менее 20% высших судебных инстанций.
  • Почти каждая пятая девочка выходит замуж до 18 лет; около 230 млн женщин и девочек пережили женское обрезание.
  • Почти каждая третья женщина хотя бы раз в жизни сталкивалась с насилием со стороны партнёра или сексуальным насилием; за последние 12 месяцев его жертвами стали 316 млн женщин.
  • Полного юридического равенства не достигла ни одна страна, а в 51 из 131 исследованной страны сохраняются значительные пробелы в законодательстве.
  • Стоимость участия в избирательной кампании может превышать средний доход на душу населения более чем в 100 раз; в некоторых странах до 80% женщин-кандидатов сталкиваются с насилием в публичной сфере.

Такие наборы показывают, зачем нужна автоматизация доступа. Когда показатель разложен по странам, годам и подгруппам, вручную собирать из него срез долго, а через агента с MCP это один запрос с проверяемым результатом.

Что это значит для практики работы с AI-инструментами и статистикой

MCP-подход становится стандартом доступа AI к авторитетным данным. Это снижает риск выдуманных цифр, но не отменяет проверку: за агентом остаётся механика запроса и сборки, за человеком - интерпретация и ответственность за вывод. Для аналитика меняется рутина: вместо поиска по порталам появляется быстрый доступ к цифре с привязкой к источнику, но растёт цена ошибки в постановке вопроса.

Для разработчиков сигнал практический: если вы строите агента для работы с данными, подключайте структурированные источники через MCP, а не рассчитывайте на память модели. Схема «модель плюс MCP-сервер» даёт воспроизводимость ответов, которой не было в тесте UNICEF. Общий подход к оценке инструментов и моделей перед встраиванием в рабочий стек мы описывали в чек-листе по оценке новинок.

ООН планирует перенести 80% статистических наборов к 2027 году, так что покрытие будет расти. Практический шаг на сейчас: посмотрите, какие показатели доступны на платформе, проверьте их на своей предметной области и подключите MCP-сервер к тестовому агенту. Если цифры сходятся с официальными публикациями, источник можно ставить в рабочий процесс. Если нет, разберитесь в причине до того, как эти значения попадут в отчёт.

Подписаться на канал