Kokoro TTS:信頼できるローカルな声 軽量
Kokoro(hexgrad/Kokoro-82M、Apache 2.0ライセンス)は、StyleTTS 2とISTFTNetを基盤とする82Mパラメータのオープンな音声合成モデルです。8言語と54のボイス(フランス語を含む)に対応し、CPU上でリアルタイムより高速に動作します。また、権利フリーのオーディオのみで訓練されており、クローニングは不可能です。クローニングモジュールは公開されていません。API経由での実測コストは、100万文字あたり1ドル未満です。
高品質な音声合成の多くは、クラウド上で動作するか、高性能なハードウェアを必要とします。Kokoroは非常に小型の公開モデル(リポジトリ:hexgrad/Kokoro-82M、ライセンス:Apache 2.0)で、説得力のある音声を生成し、一般的なコンピュータでも、グラフィックスカードの有無を問わずリアルタイムより速く生成できます。技術仕様書は、学習データの出所も含め、記載内容がこの分野では珍しいほど具体的です。そのためKokoroは、個々の主張をうのみにするのではなく検証できる、数少ない音声モデルの一つとなっています。
#小型モデルが計算にどう影響するか
音声合成の品質は、もうしばらく前から問題ではなくなっています。今も問題なのは、コストと処理をどこで行うかです。オンラインの音声はとても自然ですが、システムが読み上げる文はすべてサービス提供者に送られ、利用量に応じて課金されます。大規模なローカルモデルも自然な音声を生成しますが、グラフィックカードを占有します。そのカードは、言語モデルをしゃべらせる音声よりも、言語モデル自体に使いたいはずです。
プロセッサ上で1秒で実行できるほど小さいモデルは、2つの制約を同時に解消します。長い文書を音声で読み上げることは、もはや予算上の判断ではなくなります。アシスタントは、重要な回答だけでなく、すべての回答を音声で発話できます。バッチ処理では、夜間に100個のファイルを、すでに所有しているハードウェア上でナレーションできます。サードパーティにデータを送信する必要も、クォータを待つ必要も、処理量に応じて高騰する請求書を監視する必要もありません。
#モデルに関する確認済みの数字
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
- 8200万のパラメータ
- 通常比較されるモデルに比べ、規模が若干小さい程度です
- StyleTTS 2 + ISTFTNet アーキテクチャ
- 拡散を用いない「デコーダーのみ」の設計であり、これが軽量である理由の一つです。
- 8 言語、54 種類の音声(v1.0)
- 2025年1月27日公開。数百時間の音声データに基づいてトレーニングされました。
- トレーニング全体のコスト:約1,000ドル
- A100 80 GB GPUでの計算時間は合計1,000時間。この結果を得るための予算としては、競合モデルと比べて非常に小規模です。
- ロイヤリティフリーのデータのみ
- パブリックドメインの音声、制約の少ないライセンスの音声、または商用のクローズドなサービス提供元による合成音声。無許可の音声クローンや、他のオープンモデルが生成した音声は一切使用しないことが明示されています。
この最後の点は特に強調に値します。モデルのデータシートはデータの出所を明確に示しており、これはこの分野では希少です。これは、Kokoroが、同意なく収集またはクローンされた音声で学習されたモデルを取り巻く法的な曖昧さなしに展開できる理由の一つです。フランスにおいて一般向けに提供されるプロジェクトでは、音声の肖像権が厳格に扱われるため、この点は特に重要です。Kokoroはリリース当初、コミュニティ主導のTTS Spaces Arenaランキングで1位を獲得しました。これは、はるかに大規模なモデル——XTTS v2(4億6,700万パラメータ)、MetaVoice(12億)、Fish Speech(約5億)——を、8,200万パラメータのモデルが上回ったことを意味します。このランキングは時点によるものであり、普遍的な保証ではありませんが、10ものモデルを並行して実行せずに迅速に選択しなければならない方々にとって、品質とサイズのバランスを示す強力なシグナルです。
#できること、できないこと
| キャパシティ | Kokoro |
|---|---|
| 一般的な散文を自然な抑揚で読み上げる | サイズに対してしっかりしたパフォーマンス |
| プリセット音声 | フランス語(fr-fr)を含む8言語で、計54種類の音声 |
| サンプルからの音声クローン作成 | それは本来の目的ではありません。重みとともにクローン作成用のモジュールは公開されていません。 |
| 感情表現の細かな制御 | 限定的 |
| 処理速度 | 低スペックのハードウェア上でリアルタイムよりも速い |
| オフライン動作 | はい、pip install kokoroで重みをダウンロードした後です |
率直に言えば、これは非常に優れた読み手ですが、演技者ではありません。ナレーション、通知、アシスタント、アクセシビリティ用途には十分です。明確な意図が重要な演技の仕事には、より細かく指示できるツールが必要です。料金は、APIで入力100万文字あたり約1ドルです。音声出力1分あたり約1,000文字に相当し、ローカル利用の場合でも、同等のクラウド契約を長期利用する実コストとの比較に役立ちます。
#ローカルの処理フローにおける位置づけ
- 01音声が入力される文字起こしモデルは、ユーザーの発話をテキストに変換します。Faster-Whisperは、GPUがなくてもこの処理を十分にこなせます。
- 02モデルが思考中Ollamaまたは別のエンジンを通じて提供されるローカルモデルが、回答を生成します。
- 03音声が出るKokoroはPythonのkokoroパッケージを介して応答を読み上げます。このパッケージは音素変換ライブラリのmisakiを利用し、辞書にない一部の単語にはフォールバックとしてespeak-ngを使います。
遅延は常に処理全体で考える必要があります。ユーザーが感じるのは、文字起こし、回答生成、音声合成を順に行う合計時間です。通常、音声合成は三つの工程の中で最も時間がかかりません。そのため、音声アシスタントの体感的な応答速度を主に決めるのは、最終回答を読み上げる音声ではなく、使用する言語モデルの速度です。
#フランス語での具体的な三つの使用例
Kokoroのfr-fr音声により、フランス語の利用者向けにこのモデルをそのまま使えます。発音が不自然な英語音声や、従量課金の外部サービスを使う必要はありません。このモデルを採用するプロジェクトでは、3つの用途が特によく見られます。
- 長い文書の読み上げ
- レポート、記事、情報収集のメモなど、数ページにわたる文書の読み上げにかかるのは、わずかなプロセッサ処理時間だけです。文字数に応じて課金されるAPIを契約する場合とは異なります。
- 家庭用または業務用の音声アシスタント
- 音声認識を担うWhisperと、思考を担うローカルLLMを組み合わせることで、Kokoroが一連の処理を完結させ、会話がローカルネットワークの外に出ることはありません。
- アクセシビリティと通知
- 画面の読み上げ、音声による通知、操作の確認:解釈の細やかさよりも、遅延の小ささとオフラインで利用できることが重要な用途です。
この3つのケースではいずれも、予算の考え方が根本的に変わります。呼び出しのたびに文字数に応じて課金される代わりに、支出はすでに所有しているマシンの電気代とプロセッサの処理時間になります。日々の文献・資料の情報収集から音声によるカスタマーサポートまで、大量のテキストを読み上げる用途では、ローカルの方が有利になる差がすぐに広がります。専用グラフィックカードがなくても、音声生成の速度がリアルタイムを上回るため、なおさらです。
#KokoroまたはPiper
| Kokoro | Piper | |
|---|---|---|
| 出力の品質 | より優れており、抑揚やリズムがより自然 | 良好だが、より平坦 |
| 必要容量 | 8,200万パラメータ、単一のモデル | 非常に小型、音声ごとに1つのONNXモデル(VITS) |
| CPUでの処理速度 | 高速 | 非常に高速で、リソースが極めて限られたハードウェア向けに設計されています |
| 言語対応 | 8 言語、54 種類の音声(v1.0) | 公式の音声一覧に44の言語・ロケールを掲載 |
| ライセンス | すべての音声に共通の単一ライセンス、Apache 2.0 | アクティブなリポジトリではGPL-3.0、古くから使われていたリポジトリはMITであり、現在はアーカイブされています。 |
| どの場合に選ぶか | 品質が最優先です | リソース使用量、レイテンシー、または特定のロケールに対応する音声を優先する場合 |
Piper の採用を決める前に、ライセンスを確認しておく必要があります。従来の rhasspy/piper リポジトリは MIT ライセンスでしたが、現在はアーカイブされ、読み取り専用になっています。開発は OHF-Voice/piper1-gpl に移っており、Open Home Foundation が GPL-3.0 ライセンスで保守しています。旧リポジトリの MIT ライセンスを今も挙げているチュートリアルの説明とは、商用利用の面で実質的な違いがあります。Piper の公式ドキュメントには、個々の音声にエンジンよりも制約の厳しいライセンスが適用される場合があるとも記されています。プロジェクト全体のライセンスだけでなく、音声ごとに確認する必要があります。Piper の構成は Kokoro とは異なります。各音声は ONNX にエクスポートされた個別の VITS モデルで、.onnx ファイルと設定用の .onnx.json ファイルを持ちます。一方、Kokoro は共通の単一の重みセットから54種類の音声を提供します。
- ローカル音声アシスタント:Whisper + Ollama + Piperで一連の処理を実現
- 音声を聞き取る段階:GPUがなくてもローカルで高速に文字起こしする
- Vosk:オフライン音声認識のもう一つの選択肢
- 会議の議事録作成をローカルで自動化
- 出典:Hugging FaceのKokoro-82M公式ページ
- ソース:Python パッケージ kokoro の GitHub リポジトリ
- 出典:Piperのアクティブなリポジトリ(GPL-3.0)
#ライセンスと倫理
音声合成モデルをプロジェクトで使えるかどうかは、二つの点で決まります。そのうち技術的なものは一つだけです。一つ目は、商用利用を左右する重みと音声のライセンスです。KokoroではApache 2.0が採用されており、54種類の音声すべてを一括でカバーする、制約が緩やかで解釈に曖昧さのないライセンスです。すべてのエンジンがそうとは限りません。身近な例がPiperで、最近GPL-3.0へ移行しました。二つ目は、あらかじめ用意された音声を使うモデルなら、同意の問題を完全に回避できるという点です。一方、サンプルから誰かの声をクローンするには本人の同意が必要であり、法的な影響を伴う法域も増えています。Kokoroのモデル説明には、重みとともに音声クローニング用のモジュールは一切公開されていないと明記されています。そのため、この用途は単なる利用ポリシーによってではなく、仕組みそのものによって排除されています。
フランス語のプロジェクトでは、この組み合わせによって多くのことが簡単になります。音声ライセンス契約を交渉する必要がなく、同意を得るべき実在の人物もいません。また、Apache 2.0ライセンスなので、再販売や有料製品への組み込みも問題になりません。残る唯一の注意点は、純粋に技術的なものです。大規模に展開する前に、アクセントや頭字語も含めたプロジェクトの実際のテキストを使い、選んだフランス語音声が適切に聞こえることを確認してください。
#FAQ
Kokoroは商業利用可能ですか?+
グラフィックカードは必要ですか?+
自分の声をクローンできますか?+
KokoroとPiper、どちらを選ぶべきですか?+
どの言語に対応していますか?フランス語も含まれますか?+
ココロの訓練データはどこから来ていますか?+
クラウド API と比較して、実際のコストはどのくらいですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。