このページの内容
音色とフレーズ
読み上げの文言を設定したら、対応する音声を生成しないと再生できません。このページでは、音色の 4 つの入手方法と フレーズ集 の管理方法を説明します。
| 方法 | 準備 | 仕上がり | 向いている人 |
|---|---|---|---|
| プリセット音色 | なし | 標準的で安定 | すべての人、すぐ使える |
| クローン音色 | 5~10 秒のドライボイス 1 本 | 参照音声に近い | 特定キャラクターの声を使いたい人 |
| 微調整音色 | 10~30 分の音声 + GPU での学習 | 再現度が最も高い | 経験のある上級ユーザー |
| 音声のインポート | 既存の音声ファイル | 元の音声そのもの | 効果音、録音、TTS を使いたくない場合 |
音声を生成する前に、モデルと音声 で音声モデルをインストールしておく必要があります。音声のインポートにはモデルは不要です。
方法 1:プリセット音色
で プリセット音声(既定で選択済み)を選び、フレーズにチェックを入れて 生成開始 をクリックします。読み上げ総覧で 不足分の音声を一括生成 をクリックした場合も、既定でプリセット音色が使われます。
- プリセット音色は現在の画面言語(简体中文 / English / 日本語)に応じて自動的に選ばれ、フレーズ自体の言語とは関係ありません。
- 画面言語を切り替えてから生成すると、自動的に新しい言語のプリセット音色が使われます。
方法 2:クローン音色
参照音声が 1 本あれば使え、学習は不要です。
- 一括生成 で クローン音声 を選びます。
- 既存の音声を使用 を選ぶか、新しい音声を作成 を選んで 新しい音声名 を入力し、参照音声(WAV)を選択 をクリックします。参照音声ファイルを保持する にチェックを入れることもできます。
- 生成するフレーズにチェックを入れ(すべて選択 も可)、生成開始 をクリックします。
保存した音色は に表示され、次回からはそのまま選んで使えます。
方法 3:微調整音色(上級)高度な設定
クローンは数秒の参照音声だけに頼るため、類似度と安定性に限界があります。より高い再現度を求める場合は、対象キャラクターの音声データで専用モデルを微調整し、エクスポートしたものをアプリで参照できます。
おおまかな流れ:
- 素材の入手:Bilibili の動画は bilibilidownloadtool でダウンロードできます。
- 音声の抽出:FFmpeg でロスレスの PCM WAV に変換し、元のサンプルレートを保持します。先に MP3 に圧縮しないでください。
- ボーカル分離:Ultimate Vocal Remover で背景音を除去し、
Vocalsのドライボイスを書き出して、全体を聴いて確認します。 - データセットの作成:無音区間で分割し、24kHz にリサンプリングして、ASR で書き起こしたあと人手でテキストを校正します。
- 学習:音声の離散コードと speaker embedding を生成し、Qwen3-TTS 0.6B CustomVoice を微調整します。Docker での実行を推奨します。ビルド済みイメージは
ghcr.io/mozi1924/qwen3-tts-easyfinetuningです。 - エクスポート:GGUF のデプロイフォルダーを書き出し、 で インポート をクリックします。その後、一括生成で 微調整音声 を選びます。
データと環境の要件:
- 自分が所有している、または使用許諾を得た音声データのみを使ってください。1 つのデータセットには 1 人の話者だけを含めます。
- クリーンな有効音声を 10~30 分 用意するのが目安です。少なくても学習はできますが、類似度と安定性は下がります。
- 学習には VRAM 16GB 以上の NVIDIA GPU を推奨します。Windows では WSL2 + Docker Desktop を推奨します。
微調整の結果サンプル(日本語音色):
- ティナ CD 終了のお知らせ:ja_01_tina_cd.wav
- N20 回復のお知らせ:ja_02_n20_healbot.wav
デプロイフォルダーを移動したりファイルが変わったりすると、微調整音色に パスがありません または ファイルが変更されました と表示されます。再リンク で新しい場所を指定し、整合性を確認 で欠けがないか確認してください。参照を削除 は参照を外すだけで、外部のファイルは削除しません。
方法 4:既存の音声をインポート
TTS を使いたくない場合や、効果音を使いたい場合は、音声ファイルを直接インポートできます。
- フレーズ集 で フレーズ名 を入力し、音声をインポート をクリックします。
- wav / mp3 / flac / ogg / m4a ファイルを選びます。サイズは 50 MiB 以下、長さは 0.2~30 秒です。
- 既存のフレーズも、その行の 音声をインポート をクリックすれば、現在の音声をファイルで置き換えられます。
インポートした音声はモノラル 24kHz に統一して変換され、状態は インポート済み と表示されます。音声生成の対象にはなりません。機能ページで フレーズ集から参照 を選べば使えます。
フレーズ集の管理
フレーズ集 の各フレーズには状態があります。
| 状態 | 意味 |
|---|---|
| 生成済み | そのまま再生できる |
| 再生成が必要 | 音色またはテキストが変更され、古い音声が使えなくなった |
| 未生成 | まだ音声がない |
| インポート済み | インポートしたファイル由来 |
よく使う文を フレーズを追加 から手動で作っておき、複数の機能ページでフレーズ集から参照して使い回すこともできます。
自動生成フレーズは文言の内容で区別されます。同じ読み上げでもロードアウトごとに文言が違えばそれぞれの音声が残り、文言が同じなら 1 つの音声を共有します。文言を変更した場合、新しい文言の音声が生成されるまでは以前の音声で読み上げます。
読み上げを削除したり、対象の監視を外したり、文言を変更したりすると、古い自動生成フレーズは未参照フレーズになります。自動では削除されないため、整理する前に同じ文言の読み上げを設定し直せば、生成済みの音声がそのまま使われます。未参照フレーズを整理 をクリックするとまとめて削除でき、確認欄に削除されるフレーズが一覧表示されます。整理ではすべてのロードアウト(現在のものだけでなく)を確認し、次のフレーズは削除しません:
- いずれかのロードアウトで使われているもの(オフにしたイベントを含む)
- 機能ページで フレーズ集から参照 から選んだもの
- 新しい文言の音声が未生成の間、代わりに再生されている古いフレーズ
- インポートした音声を持つもの(一覧から 1 件ずつ手動で削除してください)
- 手動で作成したフレーズと、アプリ同梱の通知音
例
例 自分の効果音で Boss の大技を知らせるシナリオ:パーティー内で、Boss が特定の大技を使うときは TTS の音声ではなく警報音を鳴らすと決めています。手元に 2 秒の警報効果音 alarm.mp3 があり、大技の詠唱時に最優先で再生したいとします。
ステップ 1:効果音をインポートする
- を開きます。
- フレーズ名 に「大技警報」と入力します。
- 音声をインポート をクリックし、
alarm.mp3を選びます。 - リストに「大技警報」が表示され、状態が インポート済み になります。試聴 をクリックして、正しく鳴るか確認します。
音声のインポートには音声モデルのインストールは不要です。
ステップ 2:Boss DBM で参照する
- を開きます。
- 音声読み上げ でこのスキルを追加し、イベントに 発生時に読み上げ を選びます。
- 文言のソースに フレーズ集から参照 を選び、フレーズを選択 をクリックして「大技警報」を選びます。
- 優先度 を 緊急 にします。
ステップ 3:割り込みを許可する
で 高優先度は現在の再生を中断できます をオンにします。これで、ほかの内容を読み上げている最中でも、警報がすぐに鳴ります。
パーティーメンバーと共有する
ロードアウトをパーティーメンバーに エクスポート して渡すと、読み上げの設定は一緒に渡りますが、音声ファイルは含まれません。メンバーにも同じ
alarm.mp3 をフレーズ集にインポートしてもらいましょう。インポートしたフレーズの ID は音声の内容から決まるため、同じファイルなら ID も同じになり、設定が自動的に対応付けられます。