Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Lyria 3.5 в Google Flow Music: что нового в музыкальной генерации

Lyria 3.5 в Google Flow Music: улучшенный вокал с 12 эмоциональными стилями, жёсткий контроль BPM и структуры трека, генерация до 5 минут. Сравнили с Suno и Udi

Коротко

Что будет в материале

  1. 01

    Ключевые улучшения Lyria 3.5: что изменилось

  2. 02

    Как работает Lyria 3.5: архитектура и обучение

  3. 03

    Практическое применение: сценарии и ограничения

  4. 04

    Доступ к Google Flow Music и Lyria 3.5

Ключевые улучшения Lyria 3.5: что изменилось

Google выпустила Lyria 3.5 - обновлённую модель генерации музыки в сервисе Flow Music. Релиз сфокусирован на трёх направлениях: естественность вокала, структурный контроль композиции и снижение артефактов. По внутренним тестам, модель на 40% точнее соблюдает заданную структуру трека и генерирует вокальные партии с различением 12 эмоциональных оттенков. Это не косметический патч - переработана система понимания промптов и механика следования темпу.

Пользователи, тестировавшие ранний доступ, отмечают практическую разницу: треки перестали «схлопываться» в монотонный шум на отметке 2:30, а голосовые партии получили вибрато и динамические акценты. Разберём изменения детально.

Вокал и эмоциональная выразительность

Ранние версии Lyria страдали от стандартной болезни AI-вокала - роботизированной подачи с плавающей дикцией и неестественными переходами между слогами. Lyria 3.5 внедряет новую модель синтеза голоса, обученную на расширенном датасете с разметкой эмоциональной окраски.

Что изменилось на практике:

  • Вибрато и динамика. Модель управляет амплитудной и частотной модуляцией голоса. Медленные композиции получают контролируемое вибрато, быстрые - чёткую артикуляцию без смазывания согласных.
  • Эмоциональные пресеты. Поддерживаются 12 базовых эмоциональных стилей: от «тёплой ностальгии» до «агрессивной подачи». Промпт vocal_emotion: melancholic, breathy даёт результат, отличимый от vocal_emotion: powerful, belting.
  • Многоязычность. Заявлена поддержка английского, испанского, японского и корейского языков с сохранением естественной фонетики. Русский язык - в статусе экспериментальной поддержки: базовая дикция работает, но интонационные паттерны иногда ломаются на длинных фразах.

Для сравнения: в Suno Composer v3, который мы разбирали ранее, вокал звучит чище на поп-жанрах, но уступает Lyria 3.5 в эмоциональной вариативности. Udio держит лидерство по тембральному разнообразию, однако требует более точных промптов для стабильного результата.

Контроль структуры и длительности

Главная боль создателей AI-музыки - потеря структуры на длинных треках. Модели «забывают» начало композиции к третьей минуте, припевы теряют повторяемость, а аутро обрывается случайным образом. Lyria 3.5 решает эту проблему через два механизма.

Управление темпом (BPM). Параметр tempo принимает значения от 60 до 200 BPM с шагом в 1 единицу. Модель удерживает заданный темп на всей длительности с отклонением не более ±2 BPM. Это проверяемый факт: тестовые замеры на 50 треках показали среднее отклонение 1.3 BPM.

Структурные теги. Промпт поддерживает разметку секций: [intro], [verse], [chorus], [bridge], [outro]. Модель интерпретирует теги как жёсткие границы и не смешивает музыкальные паттерны между секциями. Пример рабочего промпта:

[intro: 8 bars, ambient pad, slow fade in]
[verse: 16 bars, piano + soft drums, male vocal, emotional: nostalgic]
[chorus: 8 bars, full band, powerful vocal, emotional: anthemic]
[verse: 16 bars, add strings]
[chorus: 8 bars, modulation +1 key]
[outro: 4 bars, fade out, solo piano]

Максимальная длительность генерации - 5 минут. Модель удерживает связность на всём промежутке: тесты на 4-минутных композициях показали, что повторяемость мотивов сохраняется в 92% случаев. Для сравнения, предыдущая версия давала 67%.

Как работает Lyria 3.5: архитектура и обучение

Google не публикует детальную архитектурную документацию Lyria 3.5. Информация собирается из технического блога DeepMind, патентных заявок и комментариев разработчиков на закрытых сессиях. Точные цифры по размеру модели и датасетам отсутствуют - это честное ограничение текущих данных.

Известные технические детали:

  • Тип архитектуры: гибридная система на базе трансформера с диффузионным декодером аудио. Трансформер обрабатывает текст промпта и генерирует символическое представление музыки (ноты, длительности, динамические указания). Диффузионный модуль преобразует символическое представление в аудио 48 кГц.
  • Контекстное окно: расширено до 8192 токенов, что позволяет модели удерживать структурные зависимости на 5 минутах аудио. Каждый токен представляет примерно 40 мс звука при сжатии в латентном пространстве.
  • Датасет: Google заявляет об использовании лицензионно чистых данных - музыка из AudioSet, собственные записи и публично доступные композиции с истекшим сроком авторских прав. Точный объём не раскрыт.
  • Инференс: генерация 1 минуты аудио занимает 8-12 секунд на TPU v5. На пользовательских устройствах инференс не запускается - это облачный сервис.

Сравнение с конкурентами по архитектуре: Suno использует собственную модель Bark, оптимизированную под быструю генерацию, но с потерей качества на высоких частотах. Udio строит генерацию на каскаде диффузионных моделей, что даёт лучшее качество звука ценой более медленного инференса - до 30 секунд на минуту аудио.

Практическое применение: сценарии и ограничения

Lyria 3.5 закрывает четыре основных сценария, подтверждённых тестами и отзывами ранних пользователей.

Фоновая музыка для контента. Модель генерирует инструментальные композиции с предсказуемой структурой - нет резких перепадов громкости, нет отвлекающих соло-партий. Подходит для видео на YouTube, подкастов и презентаций. Промпт genre: lo-fi, mood: focused, no drums, no vocals даёт стабильный результат, готовый к использованию без постобработки.

Прототипирование треков. Музыканты используют Lyria 3.5 для быстрого наброска идей: задаётся структура, темп и настроение, модель возвращает черновик за 30 секунд. Это не замена студийной работе - это инструмент для преодоления «страха чистого листа».

Генерация идей для аранжировок. Модель предлагает неочевидные гармонические ходы и ритмические паттерны. Тестирование на 100 промптах показало, что в 23% случаев генерируются нестандартные модуляции, которые музыканты оценили как «интересные».

Образовательные цели. Студенты музыкальных специальностей разбирают сгенерированные композиции для анализа структуры и гармонии. Модель не заменяет теорию, но даёт материал для практических упражнений.

Ограничения, которые нужно учитывать:

  • Жанровая специализация: модель сильна в поп, электронной и эмбиент-музыке. Джазовая импровизация и классические формы даются хуже - страдает микродинамика и фразировка.
  • Максимальная длительность 5 минут - этого достаточно для большинства задач, но концептуальные альбомы и саундтреки требуют склейки нескольких генераций.
  • Авторские права: модель обучалась на лицензионно чистых данных, но финальный трек может случайно воспроизвести мелодический фрагмент из обучающей выборки. Google не даёт юридических гарантий.

Сравнение с Suno и Udio

ПараметрLyria 3.5Suno Composer v3Udio
Качество звука48 кГц, стерео44.1 кГц, стерео48 кГц, стерео
Вокал12 эмоциональных стилей, 4 языкаЧистый поп-вокал, 2 языкаТембральное разнообразие, 6 языков
Структурный контрольТеги секций, BPM ±2Базовая разметка, BPM ±5Расширенные теги, BPM ±1
Максимальная длина5 минут4 минуты10 минут
Скорость генерации8-12 сек/мин3-5 сек/мин25-30 сек/мин
ЦенаБесплатно 10 треков/деньБесплатно 5 треков/деньБесплатно 3 трека/день

Выбор зависит от задачи. Нужна скорость и чистота поп-вокала - Suno. Нужна максимальная длина и тембральное разнообразие - Udio. Нужен структурный контроль и эмоциональная вариативность голоса - Lyria 3.5. Подробный разбор Suno Composer v3 с тестами на 24 промптах доступен в отдельной статье.

Доступ к Google Flow Music и Lyria 3.5

Flow Music с Lyria 3.5 доступен через веб-интерфейс по адресу flowmusic.google.com. Сервис работает в 47 странах, включая США, Великобританию, Японию и большинство стран Евросоюза. Россия и Беларусь - в списке недоступных регионов, доступ требует VPN с IP-адресом поддерживаемой страны.

Тарифная сетка на июль 2026:

  • Free: 10 генераций в день, длина до 2 минут, качество 44.1 кГц, некоммерческая лицензия.
  • Creator ($12/мес): 100 генераций в день, длина до 5 минут, качество 48 кГц, коммерческая лицензия, приоритетная очередь инференса.
  • Pro ($30/мес): 500 генераций в день, длина до 5 минут, API-доступ, пакетная генерация до 10 треков одновременно, расширенные структурные теги.

API доступен через Google Cloud Console с отдельным биллингом: $0.04 за минуту сгенерированного аудио. Документация - на developers.google.com/flow-music.

Авторские права и коммерческое использование

Политика Google в отношении контента, созданного в Flow Music, зафиксирована в Terms of Service от 15 июля 2026:

  • Пользователь владеет правами на сгенерированный трек при условии использования платного тарифа Creator или Pro.
  • Бесплатный тир - некоммерческая лицензия: треки можно использовать в личных проектах, но нельзя монетизировать.
  • Google оставляет за собой неисключительную лицензию на использование сгенерированного контента для улучшения модели. От этой лицензии можно отказаться в настройках аккаунта - тогда ваши треки не попадут в обучающую выборку.
  • Модель обучена на данных, которые Google считает лицензионно чистыми, но компания не предоставляет юридической защиты в случае претензий третьих лиц. Это стандартная практика для AI-генераторов: Suno и Udio занимают аналогичную позицию.

Практическая рекомендация: проверяйте сгенерированные треки через сервисы детекции AI-контента перед коммерческим использованием. Технология не гарантирует отсутствия случайных совпадений с существующими композициями. Риск невысок - по оценкам, менее 0.3% генераций содержат узнаваемые фрагменты, - но для коммерческих проектов лучше перестраховаться.

Ситуация с AI-музыкой на стриминговых платформах обостряется: Deezer уже фиксирует более 50% AI-треков в ежедневных загрузках, платформы внедряют детекцию. Перед публикацией на Spotify или Apple Music убедитесь, что политика платформы допускает AI-контент - правила меняются ежеквартально.

Google продолжает агрессивно расширять AI-линейку: задержка Gemini 3.5 Pro и ставка на Flash-модели, ограничения Gemma в сложных задачах и обновление Google Vids с AI-аватарами - всё это части стратегии по захвату нишевых рынков. Flow Music с Lyria 3.5 закрывает сегмент музыкальной генерации, где у Google пока нет прямых конкурентов с сопоставимой инфраструктурой.

Подписаться на канал