初心者 10 分音声

Kokoro TTS:信頼できるローカルな声 軽量

端的な回答

Kokoro(hexgrad/Kokoro-82M、Apache 2.0ライセンス)は、StyleTTS 2とISTFTNetを基盤とする82Mパラメータのオープンな音声合成モデルです。8言語と54のボイス(フランス語を含む)に対応し、CPU上でリアルタイムより高速に動作します。また、権利フリーのオーディオのみで訓練されており、クローニングは不可能です。クローニングモジュールは公開されていません。API経由での実測コストは、100万文字あたり1ドル未満です。

高品質な音声合成の多くは、クラウド上で動作するか、高性能なハードウェアを必要とします。Kokoroは非常に小型の公開モデル(リポジトリ:hexgrad/Kokoro-82M、ライセンス:Apache 2.0)で、説得力のある音声を生成し、一般的なコンピュータでも、グラフィックスカードの有無を問わずリアルタイムより速く生成できます。技術仕様書は、学習データの出所も含め、記載内容がこの分野では珍しいほど具体的です。そのためKokoroは、個々の主張をうのみにするのではなく検証できる、数少ない音声モデルの一つとなっています。

著者 Mohamed Meguedmi·更新 2026-09-28·Windows・macOS・Linuxでテスト済み

#小型モデルが計算にどう影響するか

音声合成の品質は、もうしばらく前から問題ではなくなっています。今も問題なのは、コストと処理をどこで行うかです。オンラインの音声はとても自然ですが、システムが読み上げる文はすべてサービス提供者に送られ、利用量に応じて課金されます。大規模なローカルモデルも自然な音声を生成しますが、グラフィックカードを占有します。そのカードは、言語モデルをしゃべらせる音声よりも、言語モデル自体に使いたいはずです。

プロセッサ上で1秒で実行できるほど小さいモデルは、2つの制約を同時に解消します。長い文書を音声で読み上げることは、もはや予算上の判断ではなくなります。アシスタントは、重要な回答だけでなく、すべての回答を音声で発話できます。バッチ処理では、夜間に100個のファイルを、すでに所有しているハードウェア上でナレーションできます。サードパーティにデータを送信する必要も、クォータを待つ必要も、処理量に応じて高騰する請求書を監視する必要もありません。

#モデルに関する確認済みの数字

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応
8200万のパラメータ
通常比較されるモデルに比べ、規模が若干小さい程度です
StyleTTS 2 + ISTFTNet アーキテクチャ
拡散を用いない「デコーダーのみ」の設計であり、これが軽量である理由の一つです。
8 言語、54 種類の音声(v1.0)
2025年1月27日公開。数百時間の音声データに基づいてトレーニングされました。
トレーニング全体のコスト:約1,000ドル
A100 80 GB GPUでの計算時間は合計1,000時間。この結果を得るための予算としては、競合モデルと比べて非常に小規模です。
ロイヤリティフリーのデータのみ
パブリックドメインの音声、制約の少ないライセンスの音声、または商用のクローズドなサービス提供元による合成音声。無許可の音声クローンや、他のオープンモデルが生成した音声は一切使用しないことが明示されています。

この最後の点は特に強調に値します。モデルのデータシートはデータの出所を明確に示しており、これはこの分野では希少です。これは、Kokoroが、同意なく収集またはクローンされた音声で学習されたモデルを取り巻く法的な曖昧さなしに展開できる理由の一つです。フランスにおいて一般向けに提供されるプロジェクトでは、音声の肖像権が厳格に扱われるため、この点は特に重要です。Kokoroはリリース当初、コミュニティ主導のTTS Spaces Arenaランキングで1位を獲得しました。これは、はるかに大規模なモデル——XTTS v2(4億6,700万パラメータ)、MetaVoice(12億)、Fish Speech(約5億)——を、8,200万パラメータのモデルが上回ったことを意味します。このランキングは時点によるものであり、普遍的な保証ではありませんが、10ものモデルを並行して実行せずに迅速に選択しなければならない方々にとって、品質とサイズのバランスを示す強力なシグナルです。

#できること、できないこと

実際の能力
キャパシティKokoro
一般的な散文を自然な抑揚で読み上げるサイズに対してしっかりしたパフォーマンス
プリセット音声フランス語(fr-fr)を含む8言語で、計54種類の音声
サンプルからの音声クローン作成それは本来の目的ではありません。重みとともにクローン作成用のモジュールは公開されていません。
感情表現の細かな制御限定的
処理速度低スペックのハードウェア上でリアルタイムよりも速い
オフライン動作はい、pip install kokoroで重みをダウンロードした後です

率直に言えば、これは非常に優れた読み手ですが、演技者ではありません。ナレーション、通知、アシスタント、アクセシビリティ用途には十分です。明確な意図が重要な演技の仕事には、より細かく指示できるツールが必要です。料金は、APIで入力100万文字あたり約1ドルです。音声出力1分あたり約1,000文字に相当し、ローカル利用の場合でも、同等のクラウド契約を長期利用する実コストとの比較に役立ちます。

#ローカルの処理フローにおける位置づけ

  1. 01
    音声が入力される
    文字起こしモデルは、ユーザーの発話をテキストに変換します。Faster-Whisperは、GPUがなくてもこの処理を十分にこなせます。
  2. 02
    モデルが思考中
    Ollamaまたは別のエンジンを通じて提供されるローカルモデルが、回答を生成します。
  3. 03
    音声が出る
    KokoroはPythonのkokoroパッケージを介して応答を読み上げます。このパッケージは音素変換ライブラリのmisakiを利用し、辞書にない一部の単語にはフォールバックとしてespeak-ngを使います。

遅延は常に処理全体で考える必要があります。ユーザーが感じるのは、文字起こし、回答生成、音声合成を順に行う合計時間です。通常、音声合成は三つの工程の中で最も時間がかかりません。そのため、音声アシスタントの体感的な応答速度を主に決めるのは、最終回答を読み上げる音声ではなく、使用する言語モデルの速度です。

→
テキストが届くたびに音声を再生しましょう
回答がすべて生成されるまで待ってから読み上げを始めると、モデルが回答の生成に費やした数秒を無駄にしてしまいます。テキストが届くたびに一文ずつ音声合成すれば、処理速度自体を上げなくても、システムの応答が格段にきびきびと感じられます。

#フランス語での具体的な三つの使用例

Kokoroのfr-fr音声により、フランス語の利用者向けにこのモデルをそのまま使えます。発音が不自然な英語音声や、従量課金の外部サービスを使う必要はありません。このモデルを採用するプロジェクトでは、3つの用途が特によく見られます。

長い文書の読み上げ
レポート、記事、情報収集のメモなど、数ページにわたる文書の読み上げにかかるのは、わずかなプロセッサ処理時間だけです。文字数に応じて課金されるAPIを契約する場合とは異なります。
家庭用または業務用の音声アシスタント
音声認識を担うWhisperと、思考を担うローカルLLMを組み合わせることで、Kokoroが一連の処理を完結させ、会話がローカルネットワークの外に出ることはありません。
アクセシビリティと通知
画面の読み上げ、音声による通知、操作の確認:解釈の細やかさよりも、遅延の小ささとオフラインで利用できることが重要な用途です。

この3つのケースではいずれも、予算の考え方が根本的に変わります。呼び出しのたびに文字数に応じて課金される代わりに、支出はすでに所有しているマシンの電気代とプロセッサの処理時間になります。日々の文献・資料の情報収集から音声によるカスタマーサポートまで、大量のテキストを読み上げる用途では、ローカルの方が有利になる差がすぐに広がります。専用グラフィックカードがなくても、音声生成の速度がリアルタイムを上回るため、なおさらです。

#KokoroまたはPiper

異なる二つの優先事項
KokoroPiper
出力の品質より優れており、抑揚やリズムがより自然良好だが、より平坦
必要容量8,200万パラメータ、単一のモデル非常に小型、音声ごとに1つのONNXモデル(VITS)
CPUでの処理速度高速非常に高速で、リソースが極めて限られたハードウェア向けに設計されています
言語対応8 言語、54 種類の音声(v1.0)公式の音声一覧に44の言語・ロケールを掲載
ライセンスすべての音声に共通の単一ライセンス、Apache 2.0アクティブなリポジトリではGPL-3.0、古くから使われていたリポジトリはMITであり、現在はアーカイブされています。
どの場合に選ぶか品質が最優先ですリソース使用量、レイテンシー、または特定のロケールに対応する音声を優先する場合

Piper の採用を決める前に、ライセンスを確認しておく必要があります。従来の rhasspy/piper リポジトリは MIT ライセンスでしたが、現在はアーカイブされ、読み取り専用になっています。開発は OHF-Voice/piper1-gpl に移っており、Open Home Foundation が GPL-3.0 ライセンスで保守しています。旧リポジトリの MIT ライセンスを今も挙げているチュートリアルの説明とは、商用利用の面で実質的な違いがあります。Piper の公式ドキュメントには、個々の音声にエンジンよりも制約の厳しいライセンスが適用される場合があるとも記されています。プロジェクト全体のライセンスだけでなく、音声ごとに確認する必要があります。Piper の構成は Kokoro とは異なります。各音声は ONNX にエクスポートされた個別の VITS モデルで、.onnx ファイルと設定用の .onnx.json ファイルを持ちます。一方、Kokoro は共通の単一の重みセットから54種類の音声を提供します。

#ライセンスと倫理

音声合成モデルをプロジェクトで使えるかどうかは、二つの点で決まります。そのうち技術的なものは一つだけです。一つ目は、商用利用を左右する重みと音声のライセンスです。KokoroではApache 2.0が採用されており、54種類の音声すべてを一括でカバーする、制約が緩やかで解釈に曖昧さのないライセンスです。すべてのエンジンがそうとは限りません。身近な例がPiperで、最近GPL-3.0へ移行しました。二つ目は、あらかじめ用意された音声を使うモデルなら、同意の問題を完全に回避できるという点です。一方、サンプルから誰かの声をクローンするには本人の同意が必要であり、法的な影響を伴う法域も増えています。Kokoroのモデル説明には、重みとともに音声クローニング用のモジュールは一切公開されていないと明記されています。そのため、この用途は単なる利用ポリシーによってではなく、仕組みそのものによって排除されています。

フランス語のプロジェクトでは、この組み合わせによって多くのことが簡単になります。音声ライセンス契約を交渉する必要がなく、同意を得るべき実在の人物もいません。また、Apache 2.0ライセンスなので、再販売や有料製品への組み込みも問題になりません。残る唯一の注意点は、純粋に技術的なものです。大規模に展開する前に、アクセントや頭字語も含めたプロジェクトの実際のテキストを使い、選んだフランス語音声が適切に聞こえることを確認してください。

#FAQ

Kokoroは商業利用可能ですか?+
はい。Kokoro-82Mは、最も制約の少ないオープンライセンスの一つであるApache 2.0ライセンスで公開されています。モデルの紹介ページには、「本番環境から個人プロジェクトまで、どこにでもデプロイできる」と記載されています。Apacheの標準的な条件を超えるライセンス料やクレジット表記は求められず、54種類の音声すべてに一括して適用されます。
グラフィックカードは必要ですか?+
いいえ。パラメータ数が8200万なので、CPUでの生成も実用的で、一般的なハードウェアでも通常はリアルタイムより速く生成できます。大量のデータをバッチ処理する場合にはGPUが役立ちますが、音声アシスタントでの対話的な利用には必要ありません。
自分の声をクローンできますか?+
いいえ。これは意図的な設計上の選択です。モデルカードでは、重みとともに音声クローニング用のモジュールは一切公開されていないことが確認できます。代わりに、8言語で54種類のプリセット音声が用意されています。音声クローニングは別の種類のモデルの領域であり、同意に関する問題を伴いますが、プリセット音声ではそうした問題を完全に避けられます。
KokoroとPiper、どちらを選ぶべきですか?+
より自然な音声を求めるなら、8200万パラメータのKokoroが適しています。使用リソースの少なさと遅延の低さを最優先するなら、Piperが適しています。典型的な用途は組み込み機器です。どちらも完全にオフラインで動作しますが、ライセンスは確認してください。KokoroはApache 2.0ですが、現在も活発にメンテナンスされているPiperはGPL-3.0に移行しています。
どの言語に対応していますか?フランス語も含まれますか?+
はい。バージョン1.0は8言語と54種類の音声に対応しており、アメリカ英語とイギリス英語、スペイン語、フランス語、ヒンディー語、イタリア語、日本語、ブラジルポルトガル語、標準中国語(マンダリン)が含まれます。特定の音声に決める前に、モデルのVOICES.mdファイルで、各言語で利用できる音声を正確に確認してください。
ココロの訓練データはどこから来ていますか?+
数百時間分の音声です。モデルカードに掲載されたデータの出所に関する声明によると、使用されたのは、パブリックドメインの音声、寛容なライセンスの下で提供された音声、またはクローズドな商用プロバイダーが生成した合成音声に限られます。他のオープンモデルや、許可を得ていない音声クローンに由来する音声は一切使用していないと明記されています。
クラウド API と比較して、実際のコストはどのくらいですか?+
ローカル環境では、唯一の継続的なコストは電気代です。8,200万パラメータのモデルは、CPU上で数秒で動作します。参考までに、API経由で提供されるKokoroの市場価格は100万文字あたり約1ドルです。セルフホスティングとサードパーティサービスの選択前に、この数値が比較の基準となります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。