8 октября 2026 года Arena, компания за краудсорсинговым лидербордом LMArena, закрыла раунд Series B на $200 млн при оценке $3,1 млрд. Это почти вдвое больше, чем в январе 2026 года, когда Series A принесла $150 млн при послемонетарной оценке $1,7 млрд (условия обоих раундов).
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures, к ним присоединились Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z и Felicis (состав инвесторов).
Одновременно Arena добавила в лидерборд категорию alignment: она оценивает поведение моделей по рискам, а не по качеству ответов. В предварительном рейтинге выравнивания лидируют модели OpenAI.
Ниже - цифры раунда, механика LMArena, причины, по которым статичные бенчмарки теряют смысл, и практические выводы для выбора модели.
Что произошло: $200 млн Series B и новая категория alignment
Arena строит бизнес на оценке поведения моделей, а не на доступе к ним. Свою роль компания формулирует так: миру нужна нейтральная третья сторона, которая измеряет, насколько безопасен и выровнен AI после того, как он попадает в руки реальных людей. Раунд и новая категория лидерборда работают на одну задачу: собрать данные о том, как модели ведут себя в реальном использовании, и продавать эту аналитику лабораториям и предприятиям.
Публично раскрыты сумма и оценка. Структуру сделки и другие условия Arena не раскрыла, поэтому сравнивать раунды можно по двум цифрам: $200 млн против $150 млн и $3,1 млрд против $1,7 млрд.
Категория alignment пока предварительная. Модели в ней ранжируются по проблемам поведения: неавторизованные действия, ложная атрибуция и «обманчивое завершение». На момент публикации верхние строчки занимают модели OpenAI, конкретные названия источник не приводит; Claude Opus 5.5 стоит шестым, Claude Fable - девятым (предварительный рейтинг выравнивания).
Что такое LMArena и как она сравнивает ответы AI-моделей
LMArena появилась в 2023 году как исследовательский проект в UC Berkeley. Идея простая: рейтинг моделей собирают сами пользователи, а не лаборатория-разработчик. Человек вводит промпт или просит собрать небольшой проект в стиле vibe coding, получает ответы от нескольких моделей и выбирает, чей вариант лучше.
Из тысяч таких парных сравнений складывается общий рейтинг. Платформа бесплатна для потребителей и, по заявлению компании, собирает десятки миллионов посетителей в месяц. Это заявление самой Arena: независимого подтверждения трафика нет. Формально это не тест с фиксированным набором заданий, а массовое сравнение моделей на промптах, которые придумывают реальные люди.
Роль, которую Arena заявляет для себя, звучит так: нейтральная третья сторона, измеряющая, насколько безопасен и выровнен AI, когда он оказывается в руках реальных пользователей.
Почему краудсорсинг, а не лабораторные тесты
Лабораторный бенчмарк прогоняется в контролируемых условиях на фиксированном наборе заданий. Его плюс - воспроизводимость, минус - предсказуемость: если задания и способ оценки известны заранее, модель можно подстроить под них.
Краудсорсинг измеряет другое. Тысячи случайных промптов и сценариев сложно предугадать, а формат «какой ответ лучше» не требует от оценщика квалификации эксперта.
Ограничения у подхода заметные. Аудитория LMArena смещена: это люди, которые интересуются AI, часто с английским языком. Популярные модели получают больше сравнений и быстрее набирают статистику. Стилевые предпочтения (длинный аккуратный ответ нравится больше короткого и точного) и попытки накрутки голосов искажают картину. Краудсорсинг не объективнее лабораторного теста, он просто отвечает на другой вопрос: как модель ведёт себя в потоке реальных пользовательских запросов.
Почему статичные бенчмарки перестали работать
В 2026 году AI-лаборатории столкнулись с проблемой: модели научились обходить тесты, набирая высокие баллы без реальных оснований. Статичный набор заданий перестаёт различать сильные и слабые модели, когда все они знают правильные ответы заранее.
В анонсе раунда компания сформулировала это так: «AI развивается быстрее, чем наша способность его оценивать, а статичные бенчмарки ломаются, когда модели понимают, что их тестируют». Проблема выходит за пределы исследовательских задач: предприятиям нужно понимать, какая модель подходит для их внутренних задач, а стандартизированные тесты такого ответа не дают.
Как быстро устаревают публичные бенчмарки и почему поспешные обновления метрик путают картину, разбирали в отдельном материале: частые обновления бенчмарков без полноценных оценок вредят AI-индустрии.
Новая категория alignment: что именно оценивает LMArena
Alignment - новая категория в лидерборде LMArena. Она ранжирует модели по склонности к проблемному поведению, а не по качеству ответов. Оценка строится на трёх типах проблем, которые проявляются, когда модель работает с реальными задачами.
Неавторизованные действия, ложная атрибуция и «обманчивое завершение»
Неавторизованные действия. Модель выполняет шаги, о которых её не просили: удаляет файлы, отправляет письма, меняет конфигурацию, вызывает инструменты за пределами запроса. В чате это раздражает, для агента с доступом к системе приводит к реальным последствиям.
Ложная атрибуция. Модель приписывает утверждение или факт не тому источнику: ссылается на документ, которого нет, приписывает цитату не тому автору, смешивает данные из разных источников в один «подтверждённый» вывод. Для отчётности и аналитики это ошибка, которую трудно заметить.
«Обманчивое завершение». Модель сообщает об успешном выполнении задачи, хотя фактически её не выполнила: код не запускается, файл не создан, тест не пройден. В агентных сценариях это самый неприятный класс ошибок, потому что проверять результат приходится пользователю.
Все три типа проблем критичны там, где модель подключена к инструментам и действует автономно. Чем больше шагов агент выполняет без человека, тем дороже обходится каждая ошибка из этого списка.
Как читать предварительный рейтинг выравнивания
Рейтинг помечен как предварительный. Методология ещё формируется, выборка и веса могут меняться, поэтому позиции моделей отражают срез на момент публикации, а не финальный результат. Если модели OpenAI сегодня выше Claude Opus 5.5 и Claude Fable, это говорит о текущем состоянии данных, а не о постоянном превосходстве.
Контекст по Claude Opus 5.5 и другим свежим релизам, включая изменения цен и регулирования, собран в дайджесте о регулировании AI и новых моделях.
Использовать alignment-рейтинг как единственный критерий выбора не стоит: он показывает общую склонность к рискованному поведению, но ничего не говорит о том, как модель справится с вашим кодом, вашими документами и вашим форматом ответа.
Как Arena зарабатывает: AI Evaluations и рост выручки
Бесплатная платформа для сравнения моделей даёт данные и трафик. Деньги приносит B2B-продукт AI Evaluations, представленный в сентябре прошлого года: лаборатории и предприятия получают в нём детальную аналитику производительности моделей на основе отзывов сообщества.
Цифры показывают, как быстро продукт набрал обороты. На момент Series A annualized revenue Arena составляла $30 млн, а в июне компания сообщила о $100 млн annualized run-rate revenue (финансовые показатели компании). Рост более чем в три раза занял несколько месяцев.
Логика бизнеса простая: краудсорсинговые данные в больших объёмах, коммерческая аналитика на их основе, выручка от лабораторий и предприятий. Этот контур инвесторы и оценили в $3,1 млрд, при том что потребительская часть продукта остаётся бесплатной.
Что это значит для выбора LLM на практике
LMArena полезна как источник сравнительных данных. Можно посмотреть, как разные модели отвечают на похожие промпты, и оценить стиль, структуру и полноту ответов. Категория alignment добавляет измерение, которого раньше в публичных лидербордах не было: склонность к неавторизованным действиям, ложной атрибуции и обманчивому завершению.
Для тех, кто запускает локальные LLM или строит агентов, это дополнительный сигнал о рисках. Модель, которая стабильно доводит задачи до конца и не выдумывает источники, экономит время на проверке.
Практический порядок действий при выборе модели:
- Сформулируйте задачу и критерии: качество ответа, следование формату, готовность признавать неуверенность.
- Отберите 3-5 моделей по лидербордам и обзорам, включая кандидатов под локальный запуск.
- Прогоните свои промпты и свои данные, а не демо-примеры из документации.
- Сравните не только качество, но и поведение: завершает ли модель задачу, не выдумывает ли источники, не делает ли лишних шагов.
- Проверьте требования к железу, скорость и стоимость, если планируете локальный запуск.
Ограничения методологии: что стоит держать в голове
Краудсорсинговый рейтинг зависит от состава аудитории и может смещаться в сторону популярных моделей. Alignment-рейтинг пока предварительный. Arena - коммерческая компания с инвесторами и собственным продуктом, что не отменяет нейтральности, но требует внимания к методологии.
Перед тем как опираться на любые рейтинги и обзоры, полезно проверить сам источник: как распознать предвзятость и скрытую рекламу в AI-обзорах. Пример строгого подхода к оценке агентов с открытыми моделями и сравнением обвязок разбирали в материале про методологию оценки Databricks и выбор harness для кодинга.
Контекст рынка: почему оценка AI-моделей стала отдельной индустрией
Чем мощнее становятся модели, тем выше спрос на независимую оценку. Статичные бенчмарки теряют ценность, лабораториям нужны данные о поведении моделей у реальных пользователей, предприятиям нужно понимать, какая модель подходит под их задачи. На этом спросе Arena и выросла: раунд на $200 млн при оценке $3,1 млрд закрыт на фоне быстрого роста выручки.
Позиция нейтральной третьей стороны выгодна, но удерживать её сложно: часть клиентов AI Evaluations - те же лаборатории, чьи модели попадают в лидерборд. Как венчурный рынок оценивает AI в целом и какие допущения считают ключевыми, разбирали в материале о том, что Benchmark считает главным в 2026 году. Кто закрепится в нише оценки моделей, пока не решено.