Обложка канала

Алексей Чернобровов

Личный канал Алексея Чернобровова - консультанта в сфере Digital: Data Science, Big Data, BDSM, Digital Transformation, Artificial intelligence – и все вот эти модные слова.:) Анонсы мероприятий, вакансий, зарисовки личной жизни)

Алексей Чернобровов

4 года назад
Открыть в
🗣AudioLM: подход языкового моделирования к генерации звука от Google AI Создание реалистичного звука требует моделирования информации, представленной в разных масштабах. Подобно тому, как музыка строит сложные музыкальные фразы из отдельных нот, речь объединяет локальные во времени структуры, такие как фонемы или слоги, в слова и предложения. Создание хорошо структурированных и связных звуковых последовательностей во всех этих масштабах является проблемой, которая была решена путем объединения аудио с транскрипцией, направляющей процесс генерации, включая текстовые расшифровки для синтеза речи или MIDI-представления для фортепиано. Однако, этот подход не работает при попытке смоделировать нетранскрибированные аспекты звука, такие как характеристики динамиков, необходимые для помощи людям с нарушениями речи, или стилистические компоненты игры на фортепиано. Поэтому исследователи Google AI предложили новую структуру для генерации аудио, которая учится генерировать реалистичную речь и фортепианную музыку, слушая только аудио. Звук, созданный AudioLM, демонстрирует долгосрочную согласованность (синтаксис речи, мелодию музыки) и высокую точность, превосходя предыдущие системы и расширяя границы генерации звука с помощью приложений для синтеза речи или компьютерной музыки. Также была разработана модель для идентификации синтетического звука, генерируемого AudioLM. При этом пришлось решить некоторые проблемы, связанные с тем, что скорость передачи данных для аудио значительно выше, что приводит к гораздо более длинным последовательностям. Если письменное предложение может быть представлено несколькими десятками символов, его аудиосигнал обычно содержит сотни тысяч значений. Во-вторых, между текстом и звуком существует отношение «один ко многим». Это означает, что одно и то же предложение может быть воспроизведено разными говорящими с разным стилем речи, эмоциональным наполнением и условиями записи. Чтобы преодолеть обе проблемы, AudioLM использует два типа аудиотокенов: семантические токены из w2v-BERT, самоконтролируемой аудиомодели, которые охватывают локальные зависимости (фонетику речи, мелодию в музыке) и глобальную долгосрочную структуру (синтаксис языка и семантическое содержание в речи, гармонию и ритм в музыке). Сам аудиосигнал сильно понижается. для моделирования длинных последовательностей. Но звук, восстановленный из этих токенов, имеет низкую точность воспроизведения. Чтобы обойти это ограничение, в дополнение к семантическим токенам используются акустические, созданные нейрокодеком SoundStream, которые захватывают детали звуковой волны (характеристики динамика или условия записи) и обеспечивают высококачественный синтез. Обучение системы генерированию как семантических, так и акустических токенов одновременно приводит к высокому качеству звука и долговременной согласованности. ai.googleblog.com/2022/10…-to.html
AudioLM: a Language Modeling Approach to Audio Generation

Posted by Zalán Borsos, Research Software Engineer, and Neil Zeghidour, Research Scientist, Google Research Generating realistic audio re...

Google AI Blog