Обложка канала

๖ۣۜХауди Хо™

десь публикуются интересные заметки, мысли, юмор, книги, эксперименты и многое другое из типичной "программистской" жизни 😏

๖ۣۜХауди Хо™

3 года назад
Открыть в
Многие предлагают реализовать синтез речи в Джарвисе, чтобы голос был как в фильме. Но, я смотрю на это с технической точки зрения (простыми словами, думаю как реализовать в коде). Синтез голоса для нас сейчас это большая проблема. Нейросети для STT развиты на порядок лучше, чем для задач TTS. Иными словами сегодня распознать речь сильно проще, чем её синтезировать. Нормальных OpenSource TTS решений очень мало, я бы сказал их всего 2 штуки. Это Coqui TTS и Silero TTS. — У первой нет поддержки русского языка (нет русской модели, правда есть Украинская). — Вторая это не чистый OpenSource, там грубо говоря выложены только модели. Всё остальное платное. Оба решения не имеют SDK. Но зато модели Coqui TTS можно перекинуть в ONNX (у Rust есть враппер для ONNX). А вот с Silero не уверен, информации об этом нет (но это не означает, что нельзя). Еще для синтеза есть такие штуки, как Larynx и тот же SAM, но будем честны - им далеко до синтеза человекоподобной речи. Так что их я пока серьезно не рассматриваю. Ну и подытоживая всё сказанное. Попытаюсь ответить на вопрос: Можно ли синтезировать речь Джарвиса как в фильме? Больше да, чем нет. Для тренировки нейросети Coqui TTS на одной из существующих моделей (Glow, Vits, Tacotron 1/2) нужно как минимум 10-20 часов записи голоса в хорошем качестве (желательно 48000Hz). Причем вместе с транскрипцией (текст). Такие пироги 🥧 p.s. О и да, не будем забывать, что голос - это собственность владельца. А значит синтез речи чьего-то голоса без разрешения его владельца - это прямое нарушение авторских прав.