SillyTavernで自分専用のAI秘書を作ろう!キャラ設定編②(音声・データ投入・LINE風UI)

2026_No14_SillyTavern_setup2_blog_title
Susaki

皆さん、こんにちは!
QAやテスト関連の情報発信を行っている「SusakiWorks」運営者のSusakiです。

Misaki

テストエンジニアのMisakiです!
前回はSillyTavernで、AI秘書「Aya」のキャラクター設定までできましたね。

Susaki

そうだね。
LINEみたいに会話できるようになったけど、やっぱり文字だけだと少しさみしい。
今回はAyaに「声」をつけていくよ!

Misaki

Ayaさんがしゃべるんですか!
楽しみです!

目次

前回までの設定

前回は、次の内容を紹介しました。

  • 各種導入:Homebrew、Git、Node.js、SillyTavernのインストール
  • キャラクター設定:ペルソナ(ユーザー側)と、AI秘書「Aya」の作成
  • チャットUI設定:吹き出し形式でのチャット

まだの方は、先に前回の記事をご覧ください。

あわせて読みたい
SillyTavernで自分専用のAI秘書を作ろう!キャラ設定編① 皆さん、こんにちは!QAやテスト関連の情報発信を行っている「SusakiWorks」運営者のSusakiです。 テストエンジニアのMisakiです!Susakiさん、前回はご自身のPCにロー...

音声設定

SillyTavernには TTS(Text To Speech:文字読み上げ) の拡張機能が標準で入っていて、キャラクターの返信を音声で読み上げられます。
今回は、手軽な順に3段階で進めます。

パターン音声対応特徴
1System音声追加インストールなしすぐ試せるが、声の選択肢は少なめ
2VOICEVOX無料ソフトを導入日本語が自然で、キャラクターボイスが豊富
3オリジナル音声学習が必要自分だけの声を作れる

パターン① System音声設定

まずは何も追加せず、パソコンに最初から入っている音声で読み上げてみます。
System音声は、ブラウザの読み上げ機能を使います。Macの場合は、macOSの日本語音声が使えます。

STEP
拡張機能選択

画面上部の「拡張機能」(ブロックのアイコン)を開きます。

SillyTavern_Setup_2_01
STEP
「TTS」の項目を選択

TTSの項目を開きます。

STEP
音声のタイプを選択

「Select TTS Provider」で System を選びます。

STEP
TTS内の設定

「Enabled」にチェックを入れます。

STEP
音声選択

キャラクター(Aya)に使う声を選びます。(日本語の声を選びます。)

SillyTavern_Setup_2_02
STEP
自動読み上げの設定

「Auto Generation」にチェックを入れると、返信のたびに自動で読み上げます。

SillyTavern_Setup_2_03


Misaki

これだけでしゃべりました!
でも、ちょっと機械っぽい声ですね。

Susaki

そうなんだ。
まずは「音が出る」ことの確認用だね。
次は、もっと自然な日本語の声にしていくよ。

パターン② VOICEVOXの音声設定

VOICEVOXとは

VOICEVOXは、無料で使える日本語の音声合成ソフトです。
「ずんだもん」や「四国めたん」など、たくさんのキャラクターボイスが用意されていて、文字を入力すると自然な日本語で読み上げてくれます。

  • 公式サイト:https://voicevox.hiroshiba.jp/
  • Windows / Mac / Linux に対応
  • ソフトを起動している間、裏で 音声合成用のAPIサーバー(ポート50021) が動きます。
    SillyTavernからは、このAPIを呼び出して音声を作ります。
SillyTavern_Setup_2_04

注意事項

利用規約について VOICEVOXで作った音声を公開するときは、「VOICEVOX:ずんだもん」のようなクレジット表記が必要です。
キャラクターごとに利用規約が違うので、ブログやYouTubeで使う前に必ず確認しましょう。

VOICEVOXの音声を設定するには

STEP
① VOICEVOXのインストールと起動

公式サイトからダウンロードしてインストールし、起動します。

STEP
② APIが動いているか確認

ブラウザで次のURLを開きます。

http://127.0.0.1:50021/docs

「VOICEVOX Engine」のAPI一覧(Swagger UI)が表示されれば準備OKです。

STEP
③ SillyTavernにVOICEVOXを追加

SillyTavernには、VOICEVOXが標準では入っていません。
そのため、コミュニティ製のファイルを追加します。
SillyTavern本体のファイルを直接編集する方法なので、自己責任で行ってください。

1.VOICEVOX用のファイルをダウンロードします。

curl -L -o ~/SillyTavern/public/scripts/extensions/tts/voicevox_tts.js \
  https://gist.githubusercontent.com/Akaneko-works/4286b411d735de4208f7a82b8f35e269/raw/

2.同じフォルダの index.js を開き、2か所に追記します。
ファイル冒頭のimportの並びに:
import { VoiceVoxTtsProvider } from './voicevox_tts.js';

const ttsProviders = { の中に:
VOICEVOX: VoiceVoxTtsProvider,

3.SillyTavernを再起動します。
※ SillyTavernを更新すると、この追記が消えることがあります。その場合は、もう一度追記してください。
※ ダウンロードするファイルは、Akaneko-works さんが公開しているコミュニティ製のものです。

(本記事の作成にあたり、作者の赤猫さんによる以下のnote記事を参考にさせていただきました。)
https://note.com/lef_works/n/n90a277564b6b

STEP
SillyTavernのTTS設定
  1. 「拡張機能」→「TTS」を開きます。
  2. 「Select TTS Provider」で 「VOICEVOX」 を選びます。
  3. 「VOICEVOX Base URL」に「http://127.0.0.1:50021」を入力します。
  4. 「Enabled」、「Auto Generation」にチェックを入れます。
    Auto Generationをオンにすると、返事が自動で読み上げられます。
  5. 「Audio Playback Speed」は1.00のままにしておきます。
    1.00以外にすると、VOICEVOX側の速度と掛け算されて、意図しない速さになります。
  6. Ayaに使う声(話者)を選びます。
    今回は、「琴詠ニア(ノーマル)」を選択しました。
    VOICEVOX:琴詠ニア
  7. 必要に応じて、「Voice Editor」で話す速さ(Speed)や声の高さ(Pitch)を調整します。

①各設定とVoicevoxのキャラクター

SillyTavern_Setup_2_05

②Voice Editorは必要に応じて調整

SillyTavern_Setup_2_07
Aya

 Susakiさん、Misakiさん、お疲れ様です。
本日もよろしくお願いいたします。

Misaki

わぁ!Ayaさんの声、すごく自然です!

VOICEVOX連携の「つまずきポイント」

実際に設定してみて、つまずいたところをまとめます。

つまずき①:VOICEVOXが起動していない

VOICEVOXのアプリを閉じると、APIサーバーも止まります。
音が出ないときは、まず http://127.0.0.1:50021/docs が開けるか確認しましょう。

つまずき②:「Invalid CSRF token」エラーが3回出る

音声を再生しようとしたら、次のエラーが3回続けて表示されました。

ForbiddenError: Invalid CSRF token. Please refresh the page and try again.
Misaki

CSRF…?音声とは関係なさそうなエラーですね。

Susaki

そう、ここがハマりどころだったんだ。
このエラーはVOICEVOXではなく、SillyTavern自身が出しているエラーなんだよ。

  • 原因:VOICEVOXの接続先(Base URL)が間違っていて、VOICEVOXに送るはずのリクエストがSillyTavernに届いていた。
    SillyTavernは、正しい手続きを踏んでいないリクエストを「不正なリクエスト」として断るので、このエラーになる
  • 3回出る理由:VOICEVOXとの通信は、失敗すると自動で3回までやり直す作りになっている。
  • 対処:Base URLを、VOICEVOXのアドレス(http://127.0.0.1:50021)に正しく設定し直す。

つまずき③:SillyTavernを分けたら音声設定が消えた

SusakiWorks用とは別プロジェクトで、SillyTavernを2つに分けて運用しました。
分ける前は設定が共通だったため、分けた後のSusakiWorks側ではTTSがオフになっていて、接続先も空になっていました。
SillyTavernを複数動かすときは、それぞれで音声設定が必要です。

Misaki

このあたりは、つまづくと調査に時間がかかりそうですね。。。

Susaki

そうだね。
ここは技術的なところなので、エラーメッセージをWebで検索して、類似事象の事例がないか調べたり、ClaudeやGeminiなどのAIに相談してみるのがいいね。

パターン③ オリジナル音声設定(概要紹介)

「既存のキャラクターボイスではなく、自分だけの声にしたい」という場合は、オリジナル音声を作れます。
今回は概要だけ紹介し、詳しい手順は別の記事でまとめる予定です。

STEP
① オリジナル音声を用意

学習用の音声を録音します。
雑音が少なく、はっきり話している音声が向いています。

⚠️ 注意事項
他人の声や、権利のある音声(アニメ・配信など)を無断で使うのはNGです。
自分の声か、使用許可のある音声を使いましょう。

STEP
② オリジナル音声を学習(GPT-SoVITS)

学習には 「GPT-SoVITS」というオープンソースのツールを使います。
数秒〜数分ほどの音声からでも、その人らしい声を再現できるのが特徴です。

私の場合は、短い音声ファイルをつなぎ合わせ、20分弱の音声ファイルを用意しました。

SillyTavern_Setup_2_06
STEP
③ オリジナル音声を設定

GPT-SoVITSのAPIサーバーを起動して、SillyTavernとつなぎます。

conda activate GPTSoVits
cd ~/agents/gpt-sovits
python api_v2.py -a 127.0.0.1 -p 9880

SillyTavernのTTS設定で、Providerに「GPT-SoVITS-V2 (Unofficial)」を選び、接続先に http://127.0.0.1:9880 を設定します。

今回の音声設定のご紹介としては、「VoiceVox」での設定となるため、オリジナル音声の詳細な設定は、別途改めてご紹介したいと思います。
次はデータ投入に関する設定をご紹介します。

1 2
よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

・名前:Susaki
・居住地:福岡県
・年齢:40代
・趣味:筋トレ、読書、ブログ、アプリ開発、AI活用、動画作成、料理
・仕事:QAエンジニア(QA・テスト・プロセス改善・AI活用)
・本ブログについて:
QA・テストの他、過去の経験ー現在ー未来を見据えて、生産性・意識向上など多方面の実体験を踏まえて発信していきます!
ブログ×YouTube×Noteで情報を届けます。

宜しくお願いします!

コメント

コメントする

目次