Перейти к содержанию
Публикация AiManual

Generalist: как стартап с оценкой $3 млрд приближает «момент ChatGPT» в робототехнике

Generalist привлек $200 млн и достиг оценки $3 млрд. Разбираем модель Gen 1.5, которая обучает роботов по видео за 3–12 секунд, сравниваем с Physical Intelligen

Коротко

Что будет в материале

  1. 01

    Что такое Generalist и почему инвесторы оценили его в $3 млрд

  2. 02

    Gen 1.5: как роботы учатся новым задачам за 3–12 секунд видео

  3. 03

    Generalist против Physical Intelligence и Skild AI: сравнение подходов

  4. 04

    Насколько близок «момент ChatGPT» для робототехники?

Generalist привлек около $200 млн дополнительного финансирования, увеличив оценку до $3 млрд. Раунд возглавила 8VC, общий объем Series B достиг $600 млн. Компания выпустила модель Gen 1.5, которая позволяет роботам осваивать новые задачи по видео-демонстрациям длительностью 3–12 секунд. Инвесторы видят в этом приближение «момента ChatGPT» для робототехники, хотя венчурные капиталисты предупреждают: универсальные роботы появятся через несколько лет из-за сложностей обучения на физических данных.

Разбираем, что стоит за оценкой Generalist, как работает Gen 1.5 и чем стартап отличается от конкурентов Physical Intelligence и Skild AI.

Что такое Generalist и почему инвесторы оценили его в $3 млрд

Generalist - стартап, разрабатывающий фундаментальную модель ИИ для роботов. Компания строит единую нейросеть, которая управляет разными типами роботов и позволяет им осваивать новые навыки без перепрограммирования. Оценка в $3 млрд отражает ставку инвесторов на то, что именно такой подход станет базовым слоем для следующего поколения робототехники.

Основатели с опытом Google DeepMind и Boston Dynamics

Команда Generalist вышла из двух ключевых центров экспертизы. Основатели - бывшие исследователи Google DeepMind, работавшие над фундаментальными моделями обучения с подкреплением, и инженер Boston Dynamics, отвечавший за аппаратную реализацию сложных робототехнических систем. Такое сочетание закрывает обе стороны задачи: алгоритмическую и физическую.

DeepMind-бэкграунд дал понимание, как масштабировать обучение моделей на больших данных. Опыт Boston Dynamics - знание ограничений реального железа: люфты, износ, задержки сенсоров, вариативность среды. Для робототехники это критично: модель, идеально работающая в симуляции, часто ломается на реальном роботе. Generalist строит систему с учетом этих ограничений с первого дня.

Детали раунда: $200 млн от 8VC и общая сумма $600 млн

Расширение Series B на $200 млн возглавила 8VC. Общий объем раунда достиг $600 млн, оценка компании - $3 млрд. Средства пойдут на расширение дата-инфраструктуры для сбора физических данных, найм инженеров и масштабирование тестовых парков роботов.

Для сравнения: Enigma привлекла $71 млн seed-раунда на разработку интуитивного интерфейса управления роботами. Generalist находится на более поздней стадии и решает более фундаментальную задачу - саму модель управления.

Gen 1.5: как роботы учатся новым задачам за 3–12 секунд видео

Gen 1.5 - модель, которая позволяет роботу освоить новую задачу после просмотра короткого видео. Длительность демонстрации: от 3 до 12 секунд. Робот не требует покадровой разметки, инструкций на естественном языке или длительного обучения с подкреплением. Видео - единственный входной сигнал.

Принцип обучения по видео-демонстрациям

Модель извлекает из видео последовательность действий и переносит ее в собственный моторный контекст. Ключевой момент - кросс-воплощение: робот, который видит манипуляцию, выполненную человеком или другим роботом, пересчитывает траекторию под свою кинематику. Это снимает главное ограничение классического обучения с демонстрации, когда робот копирует движения один в один и ломается при малейшем отличии геометрии.

Технически Gen 1.5 работает как мультимодальная модель: видео кодируется в скрытое представление, затем декодируется в последовательность моторных команд. Обучение идет на смешанном датасете: записи людей, записи роботов, симуляционные данные. Такой подход позволяет модели обобщать задачи, а не запоминать конкретные траектории.

Примеры задач: от манипуляций до навигации

Gen 1.5 демонстрирует рабочие навыки в нескольких категориях:

  • Манипуляции: захват объектов неправильной формы, перекладывание, сборка простых узлов
  • Сортировка: разделение предметов по категориям после одного показа
  • Навигация: перемещение между точками с обходом препятствий
  • Обслуживание: открытие дверей, нажатие кнопок, использование простых инструментов

Практическая ценность для бизнеса - скорость перенастройки. Классический промышленный робот требует часов программирования на новую задачу. Робот с Gen 1.5 - 12 секунд видео и несколько минут на адаптацию. Это меняет экономику мелкосерийных производств и логистических операций с частой сменой номенклатуры. Подробнее об экономике роботов мы разбирали в статье о битве за Physical AI.

Generalist против Physical Intelligence и Skild AI: сравнение подходов

Три стартапа борются за один рынок: фундаментальные модели для робототехники. Разница - в стратегии сбора данных и архитектурных приоритетах.

Physical Intelligence: фокус на универсальных манипуляциях

Physical Intelligence разрабатывает модель π0.5, ориентированную на тонкие манипуляции. Компания привлекла крупные инвестиции и, по данным рынка, вела переговоры с Anthropic и OpenAI о возможной продаже. Оценка достигала $11 млрд. Подробный разбор этой истории - в статье о ставках гигантов на физический интеллект.

Подход Physical Intelligence - обучение на больших датасетах реальных робототехнических операций. Фокус на качестве манипуляций, а не на скорости адаптации. Generalist делает ставку на быстрое обучение по коротким видео, что дает гибкость, но уступает в точности сложных операций.

Skild AI: ставка на адаптивные модели

Skild AI строит адаптивные модели, которые подстраиваются под конкретного робота и среду без длительного дообучения. Компания делает акцент на симуляционном обучении с последующим переносом в реальный мир. Это снижает стоимость сбора данных, но создает проблему симуляционного зазора: модель, обученная в идеальной симуляции, может ошибаться в реальных условиях.

Сравнение трех подходов:

Параметр Generalist Physical Intelligence Skild AI
Ключевой продукт Gen 1.5 π0.5 Адаптивные модели
Способ обучения Видео 3–12 секунд Большие датасеты манипуляций Симуляция + перенос
Оценка $3 млрд $11 млрд Ниже $3 млрд
Сильная сторона Скорость адаптации Точность манипуляций Стоимость данных

Насколько близок «момент ChatGPT» для робототехники?

«Момент ChatGPT» в робототехнике означает появление модели, которая после одного показа выполняет широкий спектр задач без дополнительного программирования. Инвесторы Generalist верят, что это случится в ближайшие годы. Венчурные капиталисты осторожнее: универсальные роботы могут появиться через несколько лет, а не месяцев.

Почему обучение на физических данных сложнее, чем на тексте

Языковые модели обучаются на триллионах токенов из открытого интернета. Робототехнические модели такой роскоши лишены. Физические данные нужно собирать специально: ставить робота, записывать демонстрации, размечать сенсорные потоки. Стоимость часа робототехнических данных на порядки выше стоимости гигабайта текста.

Вторая проблема - вариативность. Текст дискретен и структурирован. Физический мир непрерывен: освещение, трение, износ деталей, случайные помехи. Модель должна обобщать не только смысл, но и физику. Это требует на порядки больше данных для достижения сопоставимой надежности.

Третья проблема - безопасность. Ошибка языковой модели стоит токена. Ошибка робота с манипулятором может стоить оборудования или травмы. Это замедляет цикл экспериментов и ужесточает требования к надежности перед развертыванием.

Прогнозы экспертов: от нескольких лет до десятилетий

Диапазон оценок широкий. Оптимистичный сценарий: через 2–3 года появятся роботы, способные осваивать десятки задач по коротким демонстрациям в контролируемых средах. Пессимистичный: универсальные роботы для открытого мира - это 10+ лет.

Факторы, влияющие на скорость: стоимость сбора данных, прогресс в симуляционном обучении, доступность вычислительных мощностей, регуляторные требования. Generalist делает ставку на видео как дешевый источник данных. Если подход сработает, это сократит путь к универсальным роботам.

Инвестиционный бум в робототехнике: что это значит для индустрии

Сектор робототехники с ИИ переживает волну крупных сделок. Generalist с $600 млн Series B - заметный, но не единственный пример. Physical Intelligence привлекла финансирование при оценке $11 млрд. Enigma вышла из тени с $71 млн seed-раунда. Крупные AI-лаборатории, включая OpenAI и Anthropic, возвращаются в робототехнику через инвестиции и потенциальные поглощения.

Причина оптимизма - прогресс фундаментальных моделей. Языковые модели показали, что масштабирование данных и вычислений дает качественные скачки. Инвесторы рассчитывают на аналогичный эффект в робототехнике. Разница в том, что данные здесь дороже, а цикл обратной связи медленнее. Это создает риск переоценки: капитал может прийти раньше, чем технология созреет.

Для индустрии бум означает ускорение найма, рост зарплат специалистов по робототехнике и увеличение числа пилотных проектов. Компании, которые раньше не рассматривали роботов, начинают тестировать решения на складах и производствах. Подробнее о том, как автоматизация меняет промышленность, читайте в разборе конфликтов автоматизации.

Практические выводы: что это значит для разработчиков и бизнеса

Технологии уровня Gen 1.5 меняют картину для двух групп.

Для разработчиков и ML-инженеров растет спрос на навыки работы с мультимодальными моделями, обучением с демонстрации и симуляционными средами. Знание классической робототехники - кинематики, управления, сенсоров - остается обязательным, но теперь комбинируется с опытом обучения больших моделей. Специалисты, владеющие обоими стеками, будут дефицитными.

Для бизнеса практический вывод: пилотные проекты с роботами на базе фундаментальных моделей станут доступны в ближайшие 2–3 года. Начинать стоит с контролируемых сред - склады, производственные линии, сортировочные центры. Ключевой вопрос для оценки: как часто меняются задачи. Если номенклатура обновляется еженедельно, робот с быстрым обучением по видео окупится быстрее классического решения. Если задача стабильна годами, традиционная автоматизация останется дешевле.

Ограничения, которые нужно учитывать: надежность моделей в непредвиденных ситуациях, требования к безопасности, стоимость интеграции с существующей инфраструктурой. Gen 1.5 решает задачу скорости обучения, но не снимает вопросы надежности и сертификации. Это следующий рубеж для всей индустрии.

Подписаться на канал