десь публикуются интересные заметки, мысли, юмор, книги, эксперименты и многое другое из типичной "программистской" жизни 😏
STT развиты на порядок лучше, чем для задач TTS.
Иными словами сегодня распознать речь сильно проще, чем её синтезировать.
Нормальных OpenSource TTS решений очень мало, я бы сказал их всего 2 штуки.
Это Coqui TTS и Silero TTS.
— У первой нет поддержки русского языка (нет русской модели, правда есть Украинская).
— Вторая это не чистый OpenSource, там грубо говоря выложены только модели. Всё остальное платное.
Оба решения не имеют SDK.
Но зато модели Coqui TTS можно перекинуть в ONNX (у Rust есть враппер для ONNX).
А вот с Silero не уверен, информации об этом нет (но это не означает, что нельзя).
Еще для синтеза есть такие штуки, как Larynx и тот же SAM, но будем честны - им далеко до синтеза человекоподобной речи.
Так что их я пока серьезно не рассматриваю.
Ну и подытоживая всё сказанное.
Попытаюсь ответить на вопрос: Можно ли синтезировать речь Джарвиса как в фильме?
Больше да, чем нет.
Для тренировки нейросети Coqui TTS на одной из существующих моделей (Glow, Vits, Tacotron 1/2) нужно как минимум 10-20 часов записи голоса в хорошем качестве (желательно 48000Hz).
Причем вместе с транскрипцией (текст).
Такие пироги 🥧
p.s. О и да, не будем забывать, что голос - это собственность владельца.
А значит синтез речи чьего-то голоса без разрешения его владельца - это прямое нарушение авторских прав.AutoHotkey или .bat (.sh для Unix систем).
Позже будет встроенная поддержка скриптинга на Python или Lua.
Также Джарвис позволяет легко выполнять любые произвольные CLI команды.
Всё это уже даёт высокий уровень гибкости в плане настроек, но это только начало!