

一度に設置にならなくて Aiと熱心に研究した結果設置成功..
マニュアルどおり設置しても設置の中でエラーが発生する. AIとエラーメッセージをチェックしながら 10種はエラー原因をつかみ出したようだ.
https://www.mediafire.com/file/3h124y1rtn92g3d/AnyConv.com__1.mp4/file
ダウンして mp4 ファイルで聞くことができる.
音声が軟らかい.
MeloTTS 設置過程の中で分かるようになったことは日本語形態素分析機を使うというのだ. 韓国語は日本語形態素分析機をそのまま書かないが, 日本御用で開発された MeCabが韓国御用で拡張させて使うようだ.MeloTTSはディブロニング基盤 TTS モデル
リアルタイムテキスト音声合成はだめですか?
MeloTTS みたいなオープンソース TTSは基本的に テキスト全体を一番(回)に受けて音声を合成する構造なので, 私たちがよく言う “リアルタイムストリーミング TTS”はすぐ支援しないです.
リアルタイム音声合成支援は気の毒だがインターネットニュース記事みたいなことを ttsで伝達は可能だろう.
ニュース記事を 耳で聞くことができるオーディオブリーフィングで変換可能
視覚障害人接近性向上, 運転中/移動の中で聞き取りに有用
願う主題(政治, 経済, スポーツなど)だけ選んで自動で読んでくれる個人オーダーメード型ニュースリーダー製作可能
MeloTTSはライセンスは商業的利用度可能ですか?
MeloTTS ライセンス
MeloTTSは MIT Licenseに公開されています.
MIT ライセンスは一番自由なオープンソースライセンスの中で一つで,
個人/研究/商業的使用皆許容
ソースコード修正及び再配布可能
ただ, 原著作圏者表示(ライセンス高地含み) 義務がある
すなわち, MeloTTSを利用して作ったアプリケーションやサービスを 商業的に販売することも可能です.
気を付ける点
MeloTTS 自体は MIT ライセンスだが, モデル加重値(学習データ)は別途ライセンスが適用されることができます.
例えば, 特定言語モデルや音声データセットが 非商業的用途だけ許容する場合があるから, 必ずモデル配布先のライセンスを確認しなければなりません.
したがって “コード(MeloTTS)”は商業的に自由に使用可能だが, “モデル/データ”は制約があり得るという点を区分しなければなりません.
似ている水準のリアルタイム tts ないですか?
MeloTTS 水準の自然 + リアルタイムストリーミング → 現在は Azure, Google, Amazon, NVIDIA 同じ常用サービスが一番安定的
オープンソースは品質は良いが, リアルタイムストリーミング機能は直接具現しなければならない場合が多い
したがって “リアルタイム対話形 TTS”を願ったら常用 APIを使うのが現実的で, “ハイクオリティー配置合成”は MeloTTS 同じオープンソースが相応しいです.
文章単位で合成はこんな方法だね.
実力のない文章は MeloTTSでリアルタイム ttsで使用も可能ですねだね, 正確に見ました .
MeloTTSは本来 配置型(文章単位) 合成を念頭に置いたライブラリなので “本当にストリーミング TTS”のように音節単位ですぐ出ないが, 実力のない文章なら合成速度が充分に早くて事実上リアルタイムのように使うことができます.
どうして実力のない文章はリアルタイムのように可能なのか?
モデルが処理しなければならないテキストが実力のなければ 形態素分析 → 発音変換 → 音声合成 過程がすぐ終わり
CPUでも数超以内, GPUならほとんど直ちにオーディオが生成される
したがって対話形チェッボッや簡単な案内音声のように 実力のない回答を合成するにはリアルタイムに近い体感速度
活用アイディア
対話形チェッボッ: 質問 → 実力のない返事を TTSで変換してすぐ再生
IoT 器機音声案内: “田園がつきました”, “繋がれました” のような実力のない文具
教育/学習エブ: 単語発音, 実力のない文章読み取り
限界
だと記事や文書を一番(回)に入れれば合成時間が長くなって “リアルタイム” 感じが消え
ストリーミング APIのように 前部からすぐ再生する機能は MeloTTS 自体にはなし → 文章単位で切って合成後順次再生する方式が必要
整理すれば:
実力のない文章 = 事実上リアルタイム使用可能
だとテキスト = 文章単位で分けて合成後イオブッイは方式が現実的
文章単位で分けて合成後イオブッイは方式が現実的なら pc 寒帯ではなく色々どおり処理しなければならないでしょうか
必ず多くの大義 PCが必要なのではないです . 状況によって選択肢が変わります.
1. PC 一台で処理する場合
実力のない文章単位で分けて順次合成 → 一台の PCでも充分に可能
GPUがあったら合成速度が早くなって事実上リアルタイムのように聞こえることができる
短所: 長い記事や大量テキストを早く処理しようとすれば時間がわだかまり
2. 多くの台 PC(分散処理) 使う場合
ニュース記事, オデ−オブックのように だとテキストを早く音声で変換しなければならない時硝子
文章単位で分けて多くの PCに分散 → 同時に合成 → 結果を合わせてイオブッ
クルラウドサーバーやクボネティスみたいな分散環境でよく使う方式
3. 現実的な折衷案
個人プロジェクト/小規模サービス: PC 寒帯 + GPUでも充分
大規模サービス(ニュース読んでくれるエブ, 数千人同時使用者): 多くの台サーバーで分散処理必要
の中も最適化: 文章単位並列処理, キャッシング(よく書く文章あらかじめ合成), GPU 活用
整理すれば:
個人用/実験用 → PC 一台でも充分
大規模サービス → 多くの台サーバー(分散処理) 必要
早い処理のために Nvida グラフィックカードが必要だがお金がないから cpuで処理しても十分なようだ.
MeloTTS みたいな TTS モデルは GPUがあればずっと早く合成されるが, 実力のない文章や個人プロジェクト水準なら CPUだけでも充分に回すことができます. 実際に CPU 環境でも文章単位で切って合成すれば体感上ほとんどリアルタイムのように聞こえることができます.
CPUで処理する時特徴
長所
追加費用がかからない (GPU 購買不用)
実力のない文章合成には速度が充分に早さ
実験, 個人学習, 小規模プロジェクトには無理なさ
短所
だとテキスト(ニュース記事全体, オデ−オブックなど)は合成時間が長くなり
同時に多くの要請を処理するには限界があったら
サービス規模で確張しようとすれば結局 GPUやクルラウド資源が必要
整理
個人実験/実力のない文章案内音声 → CPUで充分
だとテキスト大量処理/リアルタイムサービス
MeloTTSは RaspberryPiでも使用可能ですか?
MeloTTSは CPU 推論を支援するからラズベリパイで行う 潜在力があるが, 設置過程の複雑性と 実際使用市の中も問題を甘受するとできます. TTSをリアルタイム音声秘書などに使おうとすれば, もっと軽いとかラズベリパイに最適化された他の TTS ライブラリ(例: Piper TTS)も一緒に考慮して見られます.