Что произошло: Synthesia сделала цифровой аватар журналистки TechCrunch
Журналистка TechCrunch получила от Synthesia собственный интерактивный цифровой аватар, который отвечает голосом на вопросы об одной её статье, а именно о материале про то, почему стартапы с венчурным финансированием совершают больше мошенничества, чем компании без такого финансирования. Аватар обучен только на этом тексте и на другие темы не отвечает (TechCrunch, 26 сентября 2026).
Это первый случай, когда Synthesia собрала цифровой аватар для журналиста. До него единственным человеком за пределами компании с собственной копией был Александру Войка, руководитель корпоративных связей Synthesia: его аватар отвечает на типовые пресс-вопросы о том, чем занимается компания и как устроены её продукты.
Масштаб эксперимента виден по бизнес-показателям. Synthesia входит в число заметных стартапов в области цифровых аватаров наряду с D-ID, HeyGen и Colossyan, в этом году компания достигла оценки $4 млрд, а годом ранее заявила о преодолении планки $100 млн ARR. При этом общение с аватаром оставило у журналистки смешанные впечатления: любопытство соседствовало с ощущением «жутковатости». Главное техническое наблюдение простое: аватар держится в рамках сценария и свободный диалог не поддерживает.
Как устроен цифровой аватар Synthesia: пайплайн из четырёх моделей
Интерактивный аватар журналистки работает на связке из четырёх моделей, и каждая решает свою задачу (TechCrunch):
- voice-to-text превращает речь человека в текст;
- агентная языковая модель разбирает смысл текста и может выполнять действия на его основе;
- text-to-voice превращает сгенерированный ответ в аудио;
- видеомодель, разработанная Synthesia, анимирует аватар под этот аудиопоток.
Точность формулировок здесь важна, потому что от порядка шагов зависит поведение всей системы. Сначала распознаётся речь, потом текст уходит в языковую модель, затем ответ синтезируется в голос и только в конце появляется картинка. Если хотя бы один шаг отваливается, диалог распадается: аватар либо не понимает вопрос, либо отвечает не своим голосом, либо молчит с открытым ртом.
Роль агентной языковой модели в интерактивном аватаре
Слово «агентная» означает, что модель не ограничивается генерацией реплики: она может совершать действия на основе разобранного текста. В корпоративном продукте Roleplay Sessions этот слой отвечает и за реакцию аватара, и за оценку ответов сотрудника. Сценарий выглядит так: сотрудник отрабатывает продажи, аватар играет роль клиента, отвечает на реплики и выставляет оценку по итогам разговора.
Что именно попадает в оценку, то есть баллы, критерии и их веса, в открытых материалах не раскрыто. Логично предположить, что разбор ответа опирается на тот же агентный компонент, который обрабатывает текст диалога, но подтверждения этому в источнике нет. Гипотеза остаётся гипотезой.
Какие компоненты можно заменить: Cartesia, ElevenLabs, Google, OpenAI
В стеке есть и собственные наработки Synthesia: голосовые и видеомодели у компании свои. При этом клиентам разрешено брать альтернативы у сторонних лабораторий, среди которых Cartesia, ElevenLabs, Google и OpenAI. Для предприятий с уже согласованным списком вендоров это снимает часть закупочных и юридических вопросов.
Та же гибкость действует на уровне инфраструктуры: компании могут разместить аватары в любом облаке по своему выбору или заплатить Synthesia за хостинг. Первый вариант даёт контроль над данными и их локацией, второй требует меньше работы от внутренней команды. Выбор диктуют требования комплаенса, а не технические ограничения платформы.
Кейс TechCrunch: что показал эксперимент с аватаром журналистки
Съёмка заняла один визит. Журналистка пришла в мини-киностудию внутри офиса Synthesia, где сделали множество фотографий и записали двухминутный фрагмент её голоса. Этого хватило, чтобы собрать несколько версий аватара (TechCrunch).
Чем персональный аватар отличается от интерактивного
Synthesia сделала два типа копий, каждую в двух вариантах: в очках и без.
- Персональный аватар читает любой текст, который ему передали. Это видеоаватар для озвучки: вы даёте сценарий, он его произносит.
- Интерактивный аватар слушает вопрос и отвечает на него. Здесь работает весь пайплайн из четырёх моделей.
Разница принципиальная. Первый вариант предсказуем полностью, второй вынужден интерпретировать входящий текст и строить ответ самостоятельно, настолько, насколько ему позволяют сценарий и обучающий материал.
Почему аватар отвечает только на вопросы об одной статье
Аватар журналистки обучен на единственном тексте, её статье о венчурном мошенничестве, и за пределы этой темы не выходит. Такой подход уместно назвать детерминированным: набор тем и ответов ограничен заранее, импровизации нет.
Для журналистики это одновременно страховка и ограничение. Страховка в том, что аватар не припишет автору слова, которых тот не говорил, и не начнёт уверенно рассуждать о том, чего в статье нет. Проблема подлинности и проверки происхождения контента в целом становится отдельной темой: генеративные модели размывают границу между оригиналом и копией, и детекторы AI-контента ошибаются чаще, чем принято считать. Ограничение в другом: живой разговор не получается, а вопрос вне темы остаётся без содержательного ответа. Ограничение заложено осознанно.
Где цифровые аватары реально работают в бизнесе: Roleplay Sessions и корпоративное обучение
Synthesia позволяет предприятиям собирать интерактивные обучающие видео с ИИ-аватарами, а недавно выпустила продукт Roleplay Sessions: сотрудники отрабатывают, например, презентацию продукта или разговор с недовольным клиентом, а интерактивный аватар отвечает и оценивает их реплики. Подробнее про переход от видеоуроков к измеряемым навыкам мы разбирали в статье про Roleplay Sessions.
Как Roleplay Sessions оценивает ответы сотрудников
Платформа не только ведёт диалог, но и выставляет оценку по его итогам. Методику компания публично не раскрывает: неизвестно, сколько критериев используется, как они взвешены и что происходит с низкими баллами. В описании продукта фигурируют реакция аватара и оценка ответов обучаемого.
Судя по архитектуре, разбор реплик ложится на агентную языковую модель, которая и так превращает текст в осмысленную реакцию. Это вывод из общей логики пайплайна, а не подтверждённая деталь реализации, поэтому строить на нём ожидания от точности оценок не стоит.
Почему корпоративное обучение, естественная ниша для аватаров
Обучение устроено как повторяемый сценарий: сотруднику нужно отработать конкретную ситуацию, а не поговорить на свободную тему. Детерминированность тут работает в плюс. Тренер точно знает, какие вопросы задаст аватар, и может сравнить результаты разных людей на одном наборе задач. Аватар не устаёт, доступен круглосуточно и масштабируется на любое число сотрудников без найма дополнительных тренеров.
Отсюда и бизнес-логика Synthesia: $100 млн ARR и оценка $4 млрд описывают компанию, которая продаёт платформу предприятиям, а не отдельным авторам. Живой тренер при этом остаётся нужен: нестандартные ситуации и разбор мотивации сотрудника по-прежнему требуют человека.
Ограничения и риски: что аватары пока не умеют и почему это вызывает «жутковатость»
Главное ограничение формулируется коротко: детерминированный аватар ограничен сценарием и свободный диалог не поддерживает. Он не ответит на вопрос вне темы, не пошутит в ответ на реплику и не поддержит разговор, который не предусмотрели при настройке.
Почему свободный диалог, это отдельная техническая задача
Свободная беседа требует, чтобы языковая модель генерировала ответы на любые темы, а не только на те, что заложены в обучающий материал. Тогда сразу появляется риск галлюцинаций: модель начнёт уверенно говорить то, чего в источнике не было. Для журналистики это критично, потому что аватар говорит от лица конкретного автора. Галлюцинации и склонность модели поддакивать собеседнику, известные режимы отказа LLM, в чувствительных доменах гасят отдельным контуром проверки, и такая safety-обвязка заметно повышает стоимость инференса и задержки.
Второе следствие касается восприятия. Любопытство от того, что копия выглядит и звучит знакомо, соседствует с «жутковатостью» от чужого голоса, произносящего твои же слова. Психологический эффект здесь не менее значим, чем технический: пользователь реагирует на подмену себя, а не на качество рендеринга.
Вопросы хостинга и контроля над данными
Хостинг остаётся на выбор клиента: собственное облако или инфраструктура Synthesia. Гибкость означает и ответственность. При самостоятельном размещении компания сама отвечает за доступ, шифрование, сроки хранения записей и соответствие требованиям к локализации данных. При хостинге у вендора эти задачи уходят на его сторону, но появляется зависимость от внешнего провайдера и его политики.
Synthesia на рынке цифровых аватаров: конкуренты и позиционирование
Рынок цифровых аватаров не сводится к одной компании: рядом работают D-ID, HeyGen и Colossyan. Сравнивать игроков по функциям здесь бессмысленно, потому что подтверждённых сравнительных данных в источнике нет, а придумывать их нельзя.
Что известно точно: Synthesia строит продукт вокруг корпоративного обучения и интерактивных аватаров и допускает замену голосовых и видеомоделей на решения Cartesia, ElevenLabs, Google или OpenAI. Открытость к чужому стеку встречается реже, чем закрытая платформа «всё своё», и для enterprise-клиента это ощутимая разница. Характер ассистента и его поведение в диалоге всё чаще влияют на удержание сильнее, чем размер модели, и Synthesia в этом смысле показательный пример вместе с Devin и Grok.
Итоговые показатели, оценка $4 млрд при ARR свыше $100 млн, описывают компанию, которая уже продаёт крупным заказчикам. Эксперимент с журналисткой в такой ситуации выглядит как демонстрация возможностей, а не как поиск product-market fit.
Стоит ли использовать цифровые аватары: практические критерии
Сценарии, где аватары оправданы:
- масштабируемое обучение с повторяемыми ситуациями: отработка продаж, онбординг, комплаенс-тренинги, разбор жалоб;
- нужен единый набор вопросов для сотен сотрудников и сравнимые оценки по итогам;
- организация физически не может обеспечить живого тренера каждому сотруднику.
Сценарии, где технология пока упирается в границы:
- свободный диалог на любые темы: детерминированный аватар здесь не работает;
- журналистика и публичные высказывания от первого лица, где важна импровизация и реакция на неожиданный вопрос;
- личные цифровые клоны, если пользователь не готов слышать свой голос из чужого рта.
Перед внедрением стоит ответить на три вопроса: где хранятся записи и биометрические данные, кто отвечает за содержание ответов аватара и что произойдёт, если он ошибётся. Опыт TechCrunch показал, что аватары уже убедительно выглядят и звучат внутри узкого сценария, а всё, что за его пределами, остаётся за человеком.