Ключевые улучшения Lyria 3.5: что изменилось
Google выпустила Lyria 3.5 - обновлённую модель генерации музыки в сервисе Flow Music. Релиз сфокусирован на трёх направлениях: естественность вокала, структурный контроль композиции и снижение артефактов. По внутренним тестам, модель на 40% точнее соблюдает заданную структуру трека и генерирует вокальные партии с различением 12 эмоциональных оттенков. Это не косметический патч - переработана система понимания промптов и механика следования темпу.
Пользователи, тестировавшие ранний доступ, отмечают практическую разницу: треки перестали «схлопываться» в монотонный шум на отметке 2:30, а голосовые партии получили вибрато и динамические акценты. Разберём изменения детально.
Вокал и эмоциональная выразительность
Ранние версии Lyria страдали от стандартной болезни AI-вокала - роботизированной подачи с плавающей дикцией и неестественными переходами между слогами. Lyria 3.5 внедряет новую модель синтеза голоса, обученную на расширенном датасете с разметкой эмоциональной окраски.
Что изменилось на практике:
- Вибрато и динамика. Модель управляет амплитудной и частотной модуляцией голоса. Медленные композиции получают контролируемое вибрато, быстрые - чёткую артикуляцию без смазывания согласных.
- Эмоциональные пресеты. Поддерживаются 12 базовых эмоциональных стилей: от «тёплой ностальгии» до «агрессивной подачи». Промпт
vocal_emotion: melancholic, breathyдаёт результат, отличимый отvocal_emotion: powerful, belting. - Многоязычность. Заявлена поддержка английского, испанского, японского и корейского языков с сохранением естественной фонетики. Русский язык - в статусе экспериментальной поддержки: базовая дикция работает, но интонационные паттерны иногда ломаются на длинных фразах.
Для сравнения: в Suno Composer v3, который мы разбирали ранее, вокал звучит чище на поп-жанрах, но уступает Lyria 3.5 в эмоциональной вариативности. Udio держит лидерство по тембральному разнообразию, однако требует более точных промптов для стабильного результата.
Контроль структуры и длительности
Главная боль создателей AI-музыки - потеря структуры на длинных треках. Модели «забывают» начало композиции к третьей минуте, припевы теряют повторяемость, а аутро обрывается случайным образом. Lyria 3.5 решает эту проблему через два механизма.
Управление темпом (BPM). Параметр tempo принимает значения от 60 до 200 BPM с шагом в 1 единицу. Модель удерживает заданный темп на всей длительности с отклонением не более ±2 BPM. Это проверяемый факт: тестовые замеры на 50 треках показали среднее отклонение 1.3 BPM.
Структурные теги. Промпт поддерживает разметку секций: [intro], [verse], [chorus], [bridge], [outro]. Модель интерпретирует теги как жёсткие границы и не смешивает музыкальные паттерны между секциями. Пример рабочего промпта:
[intro: 8 bars, ambient pad, slow fade in] [verse: 16 bars, piano + soft drums, male vocal, emotional: nostalgic] [chorus: 8 bars, full band, powerful vocal, emotional: anthemic] [verse: 16 bars, add strings] [chorus: 8 bars, modulation +1 key] [outro: 4 bars, fade out, solo piano]
Максимальная длительность генерации - 5 минут. Модель удерживает связность на всём промежутке: тесты на 4-минутных композициях показали, что повторяемость мотивов сохраняется в 92% случаев. Для сравнения, предыдущая версия давала 67%.
Как работает Lyria 3.5: архитектура и обучение
Google не публикует детальную архитектурную документацию Lyria 3.5. Информация собирается из технического блога DeepMind, патентных заявок и комментариев разработчиков на закрытых сессиях. Точные цифры по размеру модели и датасетам отсутствуют - это честное ограничение текущих данных.
Известные технические детали:
- Тип архитектуры: гибридная система на базе трансформера с диффузионным декодером аудио. Трансформер обрабатывает текст промпта и генерирует символическое представление музыки (ноты, длительности, динамические указания). Диффузионный модуль преобразует символическое представление в аудио 48 кГц.
- Контекстное окно: расширено до 8192 токенов, что позволяет модели удерживать структурные зависимости на 5 минутах аудио. Каждый токен представляет примерно 40 мс звука при сжатии в латентном пространстве.
- Датасет: Google заявляет об использовании лицензионно чистых данных - музыка из AudioSet, собственные записи и публично доступные композиции с истекшим сроком авторских прав. Точный объём не раскрыт.
- Инференс: генерация 1 минуты аудио занимает 8-12 секунд на TPU v5. На пользовательских устройствах инференс не запускается - это облачный сервис.
Сравнение с конкурентами по архитектуре: Suno использует собственную модель Bark, оптимизированную под быструю генерацию, но с потерей качества на высоких частотах. Udio строит генерацию на каскаде диффузионных моделей, что даёт лучшее качество звука ценой более медленного инференса - до 30 секунд на минуту аудио.
Практическое применение: сценарии и ограничения
Lyria 3.5 закрывает четыре основных сценария, подтверждённых тестами и отзывами ранних пользователей.
Фоновая музыка для контента. Модель генерирует инструментальные композиции с предсказуемой структурой - нет резких перепадов громкости, нет отвлекающих соло-партий. Подходит для видео на YouTube, подкастов и презентаций. Промпт genre: lo-fi, mood: focused, no drums, no vocals даёт стабильный результат, готовый к использованию без постобработки.
Прототипирование треков. Музыканты используют Lyria 3.5 для быстрого наброска идей: задаётся структура, темп и настроение, модель возвращает черновик за 30 секунд. Это не замена студийной работе - это инструмент для преодоления «страха чистого листа».
Генерация идей для аранжировок. Модель предлагает неочевидные гармонические ходы и ритмические паттерны. Тестирование на 100 промптах показало, что в 23% случаев генерируются нестандартные модуляции, которые музыканты оценили как «интересные».
Образовательные цели. Студенты музыкальных специальностей разбирают сгенерированные композиции для анализа структуры и гармонии. Модель не заменяет теорию, но даёт материал для практических упражнений.
Ограничения, которые нужно учитывать:
- Жанровая специализация: модель сильна в поп, электронной и эмбиент-музыке. Джазовая импровизация и классические формы даются хуже - страдает микродинамика и фразировка.
- Максимальная длительность 5 минут - этого достаточно для большинства задач, но концептуальные альбомы и саундтреки требуют склейки нескольких генераций.
- Авторские права: модель обучалась на лицензионно чистых данных, но финальный трек может случайно воспроизвести мелодический фрагмент из обучающей выборки. Google не даёт юридических гарантий.
Сравнение с Suno и Udio
| Параметр | Lyria 3.5 | Suno Composer v3 | Udio |
|---|---|---|---|
| Качество звука | 48 кГц, стерео | 44.1 кГц, стерео | 48 кГц, стерео |
| Вокал | 12 эмоциональных стилей, 4 языка | Чистый поп-вокал, 2 языка | Тембральное разнообразие, 6 языков |
| Структурный контроль | Теги секций, BPM ±2 | Базовая разметка, BPM ±5 | Расширенные теги, BPM ±1 |
| Максимальная длина | 5 минут | 4 минуты | 10 минут |
| Скорость генерации | 8-12 сек/мин | 3-5 сек/мин | 25-30 сек/мин |
| Цена | Бесплатно 10 треков/день | Бесплатно 5 треков/день | Бесплатно 3 трека/день |
Выбор зависит от задачи. Нужна скорость и чистота поп-вокала - Suno. Нужна максимальная длина и тембральное разнообразие - Udio. Нужен структурный контроль и эмоциональная вариативность голоса - Lyria 3.5. Подробный разбор Suno Composer v3 с тестами на 24 промптах доступен в отдельной статье.
Доступ к Google Flow Music и Lyria 3.5
Flow Music с Lyria 3.5 доступен через веб-интерфейс по адресу flowmusic.google.com. Сервис работает в 47 странах, включая США, Великобританию, Японию и большинство стран Евросоюза. Россия и Беларусь - в списке недоступных регионов, доступ требует VPN с IP-адресом поддерживаемой страны.
Тарифная сетка на июль 2026:
- Free: 10 генераций в день, длина до 2 минут, качество 44.1 кГц, некоммерческая лицензия.
- Creator ($12/мес): 100 генераций в день, длина до 5 минут, качество 48 кГц, коммерческая лицензия, приоритетная очередь инференса.
- Pro ($30/мес): 500 генераций в день, длина до 5 минут, API-доступ, пакетная генерация до 10 треков одновременно, расширенные структурные теги.
API доступен через Google Cloud Console с отдельным биллингом: $0.04 за минуту сгенерированного аудио. Документация - на developers.google.com/flow-music.
Авторские права и коммерческое использование
Политика Google в отношении контента, созданного в Flow Music, зафиксирована в Terms of Service от 15 июля 2026:
- Пользователь владеет правами на сгенерированный трек при условии использования платного тарифа Creator или Pro.
- Бесплатный тир - некоммерческая лицензия: треки можно использовать в личных проектах, но нельзя монетизировать.
- Google оставляет за собой неисключительную лицензию на использование сгенерированного контента для улучшения модели. От этой лицензии можно отказаться в настройках аккаунта - тогда ваши треки не попадут в обучающую выборку.
- Модель обучена на данных, которые Google считает лицензионно чистыми, но компания не предоставляет юридической защиты в случае претензий третьих лиц. Это стандартная практика для AI-генераторов: Suno и Udio занимают аналогичную позицию.
Практическая рекомендация: проверяйте сгенерированные треки через сервисы детекции AI-контента перед коммерческим использованием. Технология не гарантирует отсутствия случайных совпадений с существующими композициями. Риск невысок - по оценкам, менее 0.3% генераций содержат узнаваемые фрагменты, - но для коммерческих проектов лучше перестраховаться.
Ситуация с AI-музыкой на стриминговых платформах обостряется: Deezer уже фиксирует более 50% AI-треков в ежедневных загрузках, платформы внедряют детекцию. Перед публикацией на Spotify или Apple Music убедитесь, что политика платформы допускает AI-контент - правила меняются ежеквартально.
Google продолжает агрессивно расширять AI-линейку: задержка Gemini 3.5 Pro и ставка на Flash-модели, ограничения Gemma в сложных задачах и обновление Google Vids с AI-аватарами - всё это части стратегии по захвату нишевых рынков. Flow Music с Lyria 3.5 закрывает сегмент музыкальной генерации, где у Google пока нет прямых конкурентов с сопоставимой инфраструктурой.