AI音声の自然さを同じ文章で比較|ブラインド聴取で実測

広告について

この記事にはアフィリエイト広告が含まれます。評価・順位は広告報酬ではなく、当サイトの検証基準と公式情報に基づいて決定します。

AI音声の比較では、サービス名を見た状態で「自然そう」と判断するとブランド先入観が入りやすくなります。動画AIベンチでは、ElevenLabs、TTSMaker、Fish Audioへ同じ157文字の日本語原稿を入力し、Primary音声をA/B/Cへ匿名化して1名のブラインド聴取を行いました。

結果はA → B → C。回答後に対応表を開封すると、A=ElevenLabs、B=TTSMaker、C=Fish Audioでした。数値評価は回答されていないため、順位を勝手に点数へ変換していません。

公式情報の最終確認日: 2026-09-10 / 次回確認目安: 2026-12-09 / 確認期限内


正式共通原稿

正式比較では次の文章を3サービスで共通使用しました。

AI動画制作の音声を比較します。対象はElevenLabs、Adobe Premiere、DaVinci Resolve、YouTube Studioです。動画は1,920×1,080ピクセル、29.97fps、音声は48kHz。料金は2026年9月10日に確認しました。固有名詞と数字を自然に読めるか確認します。

文字数は157コードポイントです。旧原稿はFish AudioのFree画面で500文字表示上限を超えたため、Fish Audioだけを短縮するのではなく、ElevenLabs・Fish Audio・TTSMakerの3社を正式短縮版で統一しました。

正式比較に使った3音声

ラベル サービス Voice / Model Primary方針
A ElevenLabs ナオ / Eleven Multilingual v2 Formal Take 1を聴取前固定
B TTSMaker ID 407 Japanese Male 初回正式出力を固定
C Fish Audio さとる(ナレーション) / S2.1 Pro Formal Take 1を聴取前固定

ElevenLabsとFish Audioでは比較用以外のTakeも保存していますが、ブラインド結果を聞いてから差し替えていません。

ブラインド聴取の回答

評価者にはA/B/Cの音声だけを提示しました。回答は以下です。

  • 順位: A → B → C
  • コメント: 「Aが全体的によく聴こえます。」
  • 評価者数: 1名
  • 1〜5点の数値評価: 未回答

回答後に内部キーを開封し、サービス名へ戻しました。

順位 サービス 今回の主観結果
1 ElevenLabs 最も好まれた
2 TTSMaker 2番目
3 Fish Audio 3番目

なぜPrimary Takeを先に固定したのか

生成AIは同じ指示でも出力が微妙に変わります。複数生成した後に一番良い音声だけを採用すると、サービスごとの試行回数が違う比較になりやすくなります。

そこで正式比較では、聴取前にPrimaryを固定しました。ElevenLabsのTake 2やFish Audioの別パターンは生成ブレ確認用として保存し、主順位には混ぜていません。

この手順は「結果が出てから勝ちやすいTakeを選ぶ」ことを防ぐためです。

数値スコアを作らない理由

当初の評価設計には自然さ・リズム・YouTube適性の1〜5評価もありましたが、今回ユーザーが回答したのは順位と定性コメントのみです。

したがって、以下のような数値は公開しません。

  • ElevenLabs 95点
  • TTSMaker 90点
  • Fish Audio 80点
  • 自然さ4.8/5

これらは実際に回答された数字ではないからです。取得したデータが順位なら、順位として使います。

生成速度も順位化しない

3社の生成時間は同じ方法で記録できていません。生成開始のタイミングや「再生可能になった瞬間」を統一できなければ、数秒差を比較しても意味が薄くなります。

そのため今回は速度をN/Aとし、「最速」「最も時短」とは書きません。

固有名詞・数字の客観評価は別軸

原稿には4つの名称と、解像度、fps、kHz、日付を含めています。これらは本来、主観的な自然さとは別に正誤判定できます。

ただし現時点では、その8ターゲットの最終客観スコアを確定していません。したがって、この記事では自然さ順位だけを代表実測として正式利用し、未確定項目を100%などの数字に変換しません。

この結果から言えること

言えるのは、今回の固定条件では1名の評価者がElevenLabsを最も好んだことです。TTSMakerが2位、Fish Audioが3位でした。

一方、次のことまでは言えません。

  • ElevenLabsがすべてのAI音声で絶対1位
  • Fish Audioが常に不自然
  • ElevenLabsが最速
  • ElevenLabsが最も安い
  • すべての日本人が同じ順位にする

比較サイトでは「実測した範囲」と「まだ測っていない範囲」を分けます。

収益案件と順位を分離する

ElevenLabsは動画AIベンチの収益候補ですが、TTSMakerは今回アフィリエイト報酬を確認していない中立比較枠です。それでもTTSMakerを同じ条件で比較し、2位という結果をそのまま残しています。

報酬があるサービスだけを上位にするのではなく、非収益サービスも基準に入れることで比較の信頼性を保ちます。

AI音声おすすめ比較へ戻る
ElevenLabsの実測レビューを見る
ElevenLabsの日本語自然さを見る

追加実測をむやみに増やさない

今回の代表実測だけでも、AI音声クラスターの比較記事・レビュー・日本語検証へ再利用できる一次データが取れました。

そのため、現時点ではRunwayのように別ジャンルの新サービスを含め、登録先を増やすことを目的に追加実測しません。AI音声でも新サービス登録はせず、まず現在の3社データを記事へ展開します。

客観発音スコアや複数評価者が、公開品質・検索流入・収益性を明確に改善すると判断できた場合のみ、追加作業を検討します。

まとめ

同一157文字、Primary事前固定、サービス名非表示という条件で1名が聞き比べた結果、ElevenLabs > TTSMaker > Fish Audioの順でした。

数値点・速度・客観発音スコアは未確定のため、存在しない数字は作りません。この限定条件を明記したうえで、動画AIベンチのAI音声記事に再利用します。

各サービスを確認する

ブラインド聴取は今回の1名・1原稿での結果です。料金・商用条件・現在の無料枠は各公式ページで確認してください。

ElevenLabs公式サイトを確認する
TTSMaker公式サイトを確認する
Fish Audio公式サイトを確認する

公式情報

  • ElevenLabs Pricing: https://elevenlabs.io/ja/pricing
  • ElevenLabs Text to Speech: https://elevenlabs.io/ja/text-to-speech
  • Fish Audio Pricing: https://fish.audio/ja/plan/
  • Fish Audio TTS: https://fish.audio/ja/tts/
  • TTSMaker Japanese: https://ttsmaker.com/ja
  • 公式情報確認日: 2026-09-10