同じ音声を使ってずんだもんのキャラ動画を作るなら、ずんだもん動画の作り方と無料ツールの組み合わせ方が全体の地図になります。
結論:雑学ショート動画の声はAI音声で完結できる。設定値まで詰めれば維持率も落ちない
先に答えです。雑学ショート動画の声は、自分の声を一切使わずAI音声(合成音声)だけで実装できます。2026年時点の現実的な組み合わせは「台本→VOICEVOXまたはAivisSpeechで音声化→CapCutで字幕を自動同期→書き出し」の一本道で、費用は0円、PC1台(またはスマホ1台)で完結します。YouTubeのポリシー上もAI音声ナレーション自体は収益化の禁止事項ではありません(後述の条件あり)。
「機械音声だと伸びないのでは」という不安には、筆者の実測を先に置いておきます。筆者が運営する雑学系チャンネル(チャンネル名は伏せます)は、ナレーションを全編AI音声(合成音声)で制作して60本を投稿し、登録者1,120人・総再生282.6万回に到達しました。人の声のナレーションは1本も使っていません。AI音声は雑学ジャンルにおいてハンデではなく、条件を整えれば普通に伸びます。
ただし「テキストを貼って読み上げボタンを押すだけ」では伸びません。ここが本記事の主題です。雑学ショートは60秒に情報を詰め込むナレーション密度の高いフォーマットで、視聴維持率を決めるのはBGMやエフェクトではなく「声の明瞭度と話速・間の設計」です。これは筆者の運用で一貫して観察している傾向で、同じ台本でも話速と間の設定を変えるだけで平均視聴維持率が体感で1割前後変わります。逆に言えば、声質選びに悩む時間より、話速・抑揚・間という「設定値」を詰める時間のほうが再生数に直結します。
本記事は「雑学ショートに特化したAI音声の実装ガイド」です。扱う範囲は次の3つに絞ります。
- 雑学ナレーションに合う声の作り込み(話速・抑揚・間の具体的な設定値)
- 台本→音声→動画に載せるまでの一気通貫手順(PC・スマホ・自動化の3ルート)
- ツール別の雑学適性比較と、視聴維持率を落とす失敗パターン
なお「そもそもどの声質・キャラを選ぶか」という判断軸は本記事では深掘りしません。声のタイプ選定から迷っている人は、先に雑学ショート動画 声 選び方を読んでから戻ってくると、本記事の設定値がそのまま活かせます。
雑学ショート向けAI音声ツール6種の適性比較【2026年版】
まず主要ツールを「雑学ショートに使う」観点だけで比較します。汎用的な音質比較ではなく、①聞き取りやすさ(雑学の情報密度に耐えるか)②商用利用の条件③クレジット表記の要否④無料枠⑤スマホ対応、の5軸です。
| ツール | 料金 | 商用利用(収益化動画) | クレジット表記 | 雑学適性 | スマホ対応 |
|---|---|---|---|---|---|
| VOICEVOX | 完全無料 | 可(キャラ別規約あり) | 必要(例: VOICEVOX:ずんだもん) | ◎ 明瞭・話速調整が細かい | ×(PCソフト) |
| AivisSpeech | 完全無料 | 可(音声モデルごとに要確認) | モデルによる | ◎ 自然な抑揚・感情表現 | ×(PCソフト) |
| 音読さん | 無料枠 月5,000文字 | 可 | 無料版は必要 | ○ ブラウザ完結で手軽 | ◎ ブラウザで動く |
| CoeFont | 無料枠あり(少量) | 有料プランで可 | 有料プランは不要 | ○ 声の種類が非常に多い | ◎ ブラウザで動く |
| ElevenLabs | 無料 月10,000クレジット | 有料プランのみ可 | 無料版は帰属表記必要 | ○ 品質最高クラス・日本語対応 | ◎ ブラウザで動く |
| CapCut読み上げ | 無料機能あり | 「商用利用可」表示の音声のみ | 表示条件に従う | ○ 編集アプリ内で完結 | ◎ アプリ完結 |
※商用利用条件・無料枠は2026年8月時点の各公式規約・案内に基づきます。規約は変更されることがあるため、収益化前に必ず最新の公式規約を確認してください。
各ツールの雑学ショート適性コメント
- VOICEVOX:雑学ショートの第一候補。完全無料で商用利用可(動画概要欄に「VOICEVOX:キャラクター名」のクレジット表記が必要)、かつ話速・音高・抑揚・音素単位の長さまで調整できるため、本記事で解説する「設定値の作り込み」が最もやりやすいツールです。キャラクターごとに利用規約が異なる点だけ注意。詳細な規約の落とし穴はVOICEVOX 商用利用 youtube 注意点にまとめています。
- AivisSpeech:無料ローカル動作のAI音声合成ソフトで、VOICEVOXより抑揚が自然に出やすいのが強み。感情スタイル(ノーマル・通常・喜び等)を切り替えられ、雑学の「へえ、そうなんだ」感を演出しやすい。ただし音声モデル(話者)ごとにライセンスが異なるため、使うモデルの利用条件を必ず確認します。
- 音読さん:ブラウザ完結でスマホでも使え、無料会員で月5,000文字まで。クレジット表記(「音声:音読さん」等)をすれば無料枠でも商用利用可という、無料×商用OKの貴重な組み合わせ。雑学ショート1本の台本は350〜400字程度なので、無料枠で月12〜14本分です。
- CoeFont:1万種類以上の声から選べるのが特長。ただし収益化動画で使うなら実質有料プラン前提(有料プランはクレジット表記不要)。無料枠は試聴・検証用と割り切るのが安全です。
- ElevenLabs:音質は最高クラスで日本語も自然ですが、商用利用は有料プラン(Starter以上)が必須。無料プランで作った音声を収益化動画に使うと規約違反になります。無料枠はあくまで品質検証用です。
- CapCut読み上げ:編集アプリ内でテキスト読み上げが完結する手軽さが魅力。ただし商用利用できるのは「商用利用可(Commercial use)」表示のある音声のみで、規約更新も頻繁なため、収益化チャンネルの主力に据えるなら定期的な規約確認が必要です。
より広い無料ツールの一覧比較(雑学に限らない汎用比較)はAI音声 読み上げ 無料 おすすめ 比較に譲り、以降は「選んだ声を雑学向けに作り込む」工程に進みます。
雑学ナレーション向けの声の作り込み:話速・抑揚・間の設定値
ここが本記事の核心です。デフォルト設定のまま書き出したAI音声は、雑学ショートには遅すぎ、間が均一すぎます。以下は筆者が60本の投稿を通じて収束させた設定値です。ツールのバージョンや声質によって最適値は前後するため、「初期値として使い、自分のチャンネルの維持率で微調整する」前提で使ってください。
基準となる考え方:1秒あたり6.5文字
雑学ショートのナレーション密度は「1秒あたり6〜7文字」が目安です。これより遅いと視聴者は先回りして飽き、速いと聞き取れずに離脱します。60秒動画なら台本は360〜400字、45秒なら280〜300字。台本を書いた時点で文字数÷6.5秒で尺を見積もり、収まらないなら話速を上げるのではなく台本を削るのが原則です。
VOICEVOXの推奨設定値
| パラメータ | 推奨値 | 理由 |
|---|---|---|
| 話速 | 1.10〜1.20 | 等倍(1.00)は雑学には遅い。1.15前後が聞き流しに最適 |
| 音高 | 0.00(変更なし) | 上げると軽薄に、下げるとこもって聞こえやすい |
| 抑揚 | 0.90〜1.00 | 上げすぎると芝居がかって雑学の淡々とした信頼感が消える |
| 音量 | 1.00 | 音量調整は編集ソフト側で行う(後述) |
| 開始無音 | 0.1秒 | 冒頭の無音は離脱要因。ほぼゼロに詰める |
| 終了無音 | 0.3秒 | 文と文のつなぎ目の「間」の基本単位になる |
「間」の設計:3種類だけ覚える
AI音声が不自然に聞こえる最大の原因は声質ではなく「間が均一」なことです。人間のナレーターは内容に応じて間を変えます。雑学ショートでは次の3種類だけ使い分ければ十分です。
- 文中の間(0.15〜0.2秒):読点の位置。詰め気味にしてテンポを維持する
- 文末の間(0.3秒前後):句点の位置。デフォルトの間より少し短めが今のショートのテンポ感
- 「引き」の間(0.5〜0.7秒):答えを言う直前だけ。「実はこの習慣、逆効果なんです。(0.6秒)理由は──」のように、雑学のオチ直前に1箇所だけ長い間を置くと維持率の谷が浅くなる
この「引きの間」は1本の動画で1〜2箇所に絞ります。多用すると全体が間延びし、逆効果です。VOICEVOXなら文末の無音長を音素単位で編集でき、CapCut等の編集ソフト側でクリップを分割して間を挿入する方法でも同じ効果が得られます。
誤読対策:読み仮名の事前置換
雑学は固有名詞・数字・単位が多く、誤読が頻発します。「1,200年」「7割」「D N A」など、書き出し前に必ず全文を試聴し、誤読箇所は台本側をカタカナ・ひらがなに置換します(例:「重複」→「ちょうふく」、「10km」→「じゅっキロメートル」)。VOICEVOXやAivisSpeechには単語辞書機能があるので、チャンネルで繰り返し使う固有名詞は辞書登録しておくと2本目以降の修正時間がほぼゼロになります。誤読が1箇所でも残った動画はコメント欄で指摘され、信頼を落とします。ここは省略できない工程です。
台本を「耳で聞く日本語」に直す
設定値と同じくらい効くのが、台本そのものの音声向けリライトです。目で読む文章と耳で聞く文章は別物で、AI音声の「不自然さ」の何割かは、実は文章側が読み上げに向いていないことが原因です。書き出し前に次の4点を機械的に直します。
- 一文を40字以内に切る:長い複文はAI音声だと切れ目が掴めず、聞き手の処理が追いつかない。「〜ですが、〜で、〜なので」は2〜3文に分割する
- 同音異義語を言い換える:「私立/市立」「科学/化学」のような耳で区別できない語は、「わたくしりつ」「ばけがく」または別の語に置換する
- 漢語を和語に開く:「摂取する」→「とる」、「使用する」→「使う」。読み上げの明瞭度が上がり、字幕の文字数も減る
- 指示語を減らす:「これ」「それ」は映像がないと迷子になる。ショートでは名詞を繰り返すほうが聞きやすい
このリライトを挟むだけで、同じ声・同じ設定値でも「聞き取れる率」が明確に変わります。台本を書き終えたら一度自分で音読してみて、舌が回らない箇所・息が続かない箇所がAI音声でも崩れるポイントです。
AivisSpeechの場合
AivisSpeechは感情スタイルの選択と強度調整が特徴です。雑学ナレーションでは「ノーマル(通常)」を基本に、話速はVOICEVOXと同じく1.1〜1.2倍相当へ。感情強度を上げすぎると抑揚が波打って情報が頭に入りにくくなるため、控えめが正解です。スタイルの使い分けは「導入の1文だけ少し明るいスタイル、本文はノーマル」程度に留めます。
ここまでの手順、1本ぶんまるごと自動でやりますShorty はテーマを入力するだけで、台本・AI音声・字幕・BGMを揃えた雑学ショート動画を生成します。無料プランは30日5本まで。無料で作ってみる台本→音声→動画まで:雑学ショートの一気通貫手順(PC編)
ここからは実装手順です。PCでVOICEVOX(またはAivisSpeech)+CapCut(PC版)を使う、費用0円の標準ルートを10ステップで示します。1本あたりの作業時間は、慣れれば台本込みで40〜60分です。
- 台本を書く(360〜400字/60秒):構成は「結論フック(1文)→理由・詳細(3〜4文)→意外な補足(1〜2文)→締め(1文)」。冒頭は「実は〜」「〜って知ってた?」のように1文目で雑学の核心に触れる
- 文字数から尺を見積もる:文字数÷6.5=想定秒数。60秒を超えるなら削る。挨拶・チャンネル紹介は書かない
- 誤読リスク箇所を置換する:数字・単位・難読漢字をカタカナ/ひらがなへ。辞書登録済みの語はそのまま
- VOICEVOXに貼り付け、話速1.15・抑揚0.95に設定:前章の設定値を適用。文ごとにテキスト行を分けておくと後の調整が楽
- 全文を試聴し、誤読とイントネーションを修正:アクセント区切りの修正はこの段階で。「引きの間」をオチ直前に1箇所設定
- WAVで書き出す:MP3よりWAV推奨。ショートは尺が短いのでファイルサイズは問題にならず、音質劣化を避けられる
- CapCutに音声を読み込み、動画素材を音声に合わせて配置する:先に音声、後から映像の順。雑学ショートは「音声が主・映像が従」で組むと編集が速い
- 字幕を自動生成(自動キャプション)し、誤変換を修正する:AI音声は発音が安定しているため自動字幕の精度が高い。フルテロップは雑学ショートの標準装備
- BGMを声より約20dB小さく敷く:目安はナレーション-6dB前後に対しBGM-26dB前後。「BGMが聞こえるか聞こえないか」程度で正解(理由は後述の失敗パターン参照)
- 1080×1920・30fps以上で書き出し、スマホで試聴確認:スマホのスピーカーで声がこもらないか最終確認してから投稿
CapCut以外の編集ソフトを使う場合も、「音声を先に置き、映像を音声に合わせる」という順序さえ守れば同じ流れで再現できます。
スマホ完結・自動化:残り2つの制作ルート
PCを持っていない、または工程を短縮したい人向けに、残り2ルートを示します。
ルートB:スマホ完結(音読さん+CapCutアプリ)
- スマホのブラウザで音読さんを開き、台本を貼り付けて音声を生成・ダウンロード(無料枠は月5,000文字、商用利用はクレジット表記が条件)
- CapCutアプリで新規プロジェクトを作成し、音声を読み込む
- 画像・動画素材を音声に合わせて配置し、自動キャプションで字幕化
- 概要欄用のクレジット表記(例:「音声:音読さん」)をメモしておき、投稿時に貼る
CapCutアプリ内蔵の読み上げ機能だけで完結させる方法もありますが、収益化を見据えるなら「商用利用可」表示の音声に限定する制約が付きます。声の作り込み(話速・間の調整幅)はPCルートより粗くなるため、「まずスマホで10本出して感触を掴み、続けられそうならPCルートに移行」という段階設計が現実的です。
ルートC:生成の自動化(時短重視)
台本さえ書けば音声合成と動画化をまとめて自動処理するツールを使う選択肢です。当サイトが開発・運営しているShortyは、台本を入力するとAI音声のナレーション付きショート動画を自動生成するツールで、上記ステップ4〜9(音声化・字幕・配置)を丸ごと省略できます。無料プランは1本30秒まで・30日で5本まで・生成した動画の保存は7日間・ショート形式のみという制約があるため、「週1〜2本を試しに出したい」段階の検証用途に向きます。毎日投稿など本数を出す運用に入ったら、有料化するかPCルートで内製するかをコストで比較してください。自動化ツール全般に言えることですが、声の細かい作り込み(間の位置、抑揚の微調整)は手動ルートに劣るため、「量の検証は自動化、当たり企画の作り込みは手動」という併用が筆者のおすすめです。
視聴維持率を落とすAI音声の失敗パターン7つ
筆者が60本の投稿と他チャンネルの観察から特定した、雑学ショートで維持率を下げるAI音声の典型的な失敗です。逆に言えば、ここを潰すだけで「AI音声だから伸びない」状態はほぼ解消します。
- 誤読の放置:最も致命的。1箇所の誤読で「機械が適当に作った動画」という印象に変わり、以降の内容が信頼されない。全文試聴は必須工程
- デフォルト話速のまま:等倍速は雑学ショートには遅い。視聴者が字幕を読み終えてから音声が追いつく状態になると、確実に離脱される
- 間がゼロ、または均一:文間を詰めすぎた「息継ぎのない音声」は圧迫感で離脱を招き、逆にデフォルトの均一な間は単調さで離脱を招く。前述の3種類の間の使い分けで解決
- BGMが声を食っている:雑学ショートはナレーション密度が高いため、BGMの音量ミスが他ジャンルより致命的。声とBGMの音量差は20dB前後を確保する。「BGMをしっかり聞かせたい」は雑学ショートでは誤り
- 抑揚の上げすぎ:感情豊かにしようと抑揚を強くすると、かえって聞き取りにくくなる。雑学は「淡々と意外な事実を告げる」トーンのほうが信頼感が出る
- 冒頭の挨拶・自己紹介:AI音声の問題というより台本の問題だが、最初の2秒で本題に入らないショートは維持率グラフの冒頭で崖ができる。挨拶は書かない
- 書き出し設定による音質劣化:低ビットレートのMP3で書き出す、音量の正規化を二重にかける等で音がこもると、声質以前の問題で聞き取りにくくなる。WAV書き出し+編集ソフト側で一度だけ音量調整、が安全
注意点として、これらを全て潰しても伸びない場合は、原因は音声ではなく企画(雑学の題材選び)かサムネイル的要素(冒頭1秒の画)にあります。AI音声の設定改善は「マイナスをゼロにする」施策であり、再生数を伸ばす主因は題材です。音声の作り込みだけで伸び悩みが解決するとは考えないでください。
AI音声のYouTube収益化と開示ルール【2026年時点】
「AI音声だと収益化できないのでは」という不安に、2026年8月時点の状況を整理します。
AI音声そのものは収益化の禁止事項ではない
YouTubeのポリシー上、合成音声・AI音声のナレーションを使うこと自体は収益化を妨げません。実際、ずんだもん(VOICEVOX)やゆっくり音声を使った収益化チャンネルは多数存在します。筆者のチャンネルも全編AI音声で収益化審査に通過しています。
ただし2026年に入って、AI生成コンテンツの「量産・重複」判定による収益化停止事例が増えています。ポイントは「AI音声を使ったか」ではなく「動画に独自性があるか」です。台本が自分で書いたオリジナルであること、編集・構成に固有の価値があることが実質的な条件で、他人のコンテンツの読み上げや、テンプレートに素材を流し込んだだけの大量生産は、AI音声でなくても停止対象になり得ます。雑学ショートで言えば「Wikipediaの丸読み」「他チャンネルの雑学の言い換え量産」は高リスクです。
開示(ディスクロージャー)設定
YouTubeには「改変または合成されたコンテンツ」の開示設定があります。現状、ナレーションがAI音声であること自体は「実在の人物が実際には言っていないことを言っているように見せる」ような場合と異なり、必ずしも開示必須の類型ではありませんが、視聴者の誤解を防ぐ観点から、AI音声使用は概要欄で明示しておくのが安全です。クレジット表記が必要なツール(VOICEVOX・音読さん等)なら、その表記自体が開示を兼ねます。
公開前チェックリスト
投稿前に毎回確認する項目をチェックリスト化しました。
- [ ] 使用ツール・キャラクターの利用規約で商用利用可を確認した(規約の版・日付も控えた)
- [ ] 必要なクレジット表記を概要欄に入れた(例:VOICEVOX:ずんだもん)
- [ ] 台本は自分で書いたオリジナルである(引用元がある場合は自分の言葉で再構成した)
- [ ] 全文を試聴し、誤読ゼロを確認した
- [ ] 声とBGMの音量差が20dB前後ある
- [ ] スマホ実機で聞き取りやすさを確認した
- [ ] YouTubeの合成コンテンツ開示設定の要否を確認した
- [ ] 有料プラン必須ツール(ElevenLabs等)を無料プランのまま収益化動画に使っていない
規約は各社とも年に何度も更新されます。この記事の情報も2026年8月時点のものであり、収益化に関わる判断の前には必ず一次情報(各ツールの公式利用規約・YouTubeヘルプ)を確認してください。
よくある質問
雑学ショート動画の声は無料のAI音声だけで本当に作れますか?
作れます。VOICEVOX・AivisSpeechは完全無料で商用利用でき、編集もCapCut無料版で完結します。実際に筆者は全編AI音声・費用0円構成の雑学チャンネルで総再生282.6万回に到達しました。ただし無料ツールにはクレジット表記などの条件があるため、各規約の確認は必要です。
AI音声の雑学ショートはどれくらい伸びますか?
筆者の実測では、AI音声60本の投稿で登録者1,120人・総再生282.6万回でした。AI音声であること自体は伸びの妨げになりません。伸びを決めるのは題材選びと冒頭2秒の設計で、音声の作り込みは「離脱要因を消す」役割です。人の声との差より、誤読や話速設定のミスによる差のほうがはるかに大きいのが実感です。
話速はどれくらいに設定すればいいですか?
VOICEVOX基準で1.10〜1.20倍、ナレーション密度で言えば1秒あたり6〜7文字が雑学ショートの目安です。等倍速は遅すぎて離脱を招きます。まず1.15で書き出し、自分のチャンネルの視聴維持率グラフを見ながら0.05刻みで調整するのが実践的です。
VOICEVOXとAivisSpeechはどちらが雑学向きですか?
細かい設定値を詰めたいならVOICEVOX、自然な抑揚を手早く得たいならAivisSpeechです。VOICEVOXは音素単位で間と長さを編集でき、本記事の設定値をそのまま適用できます。AivisSpeechは調整項目が少ない代わりにデフォルトの抑揚が自然です。両方無料なので、同じ台本を両方で書き出して聞き比べるのが確実です。
クレジット表記はどこに書けばいいですか?
動画の概要欄に1行入れるのが標準です(例:「VOICEVOX:ずんだもん」「音声:音読さん」)。動画内テロップでの表記を求めるツールは少数ですが、キャラクター・音声モデルごとに規約が違うため、使用する声の規約原文を必ず確認してください。表記漏れは規約違反であり、収益化以前の問題になります。
AI音声のショート動画でも収益化できますか?
できます。AI音声の使用自体はYouTubeの収益化禁止事項ではなく、筆者のAI音声チャンネルも審査に通過しています。ただし2026年時点では量産型・重複コンテンツ判定による収益化停止事例が増えており、台本のオリジナリティと動画ごとの差別化が実質条件です。丸読み・テンプレ量産は高リスクです。
スマホだけで雑学ショートのAI音声は作れますか?
作れます。ブラウザで動く音読さん(無料枠月5,000文字)で音声を生成し、CapCutアプリで字幕・編集する構成がスマホ完結の現実解です。ただし話速や間の細かい作り込みはPCソフトに劣るため、本数を出す段階になったらPC+VOICEVOX構成への移行を推奨します。
ElevenLabsの無料プランで作った音声を収益化動画に使えますか?
使えません。ElevenLabsの商用利用は有料プラン(Starter以上)の契約が必須で、無料プランで生成した音声を収益化動画に使うと規約違反になります。無料枠は品質検証用と割り切り、収益化前提なら有料契約するか、無料で商用利用できるVOICEVOX等を選んでください。
機械音声より自分の声で録ったほうが伸びるのでは?
雑学ジャンルに限れば、必ずしもそうではありません。雑学ショートの視聴者は「情報の聞き流し」目的が強く、明瞭で一定品質のAI音声のほうが素人の生声(滑舌・録音環境のばらつき)より維持率が安定するケースを筆者は実測しています。生声が勝つのはパーソナリティ自体がコンテンツになるジャンルで、雑学はその限りではありません。
あわせてVOICEVOXの使い方と動画への組み込み手順を読んでおくと、次の工程でつまずく箇所を先回りして潰せます。
まとめ:声質選びより「設定値」が雑学ショートの勝敗を分ける
雑学ショート動画のAI音声実装について、要点を整理します。
- AI音声だけで雑学ショートは成立する。筆者実測でAI音声60本・登録者1,120人・総再生282.6万回。人の声は必須ではない
- 標準ルートは「VOICEVOX/AivisSpeech+CapCut」の0円構成。スマホ完結なら音読さん+CapCutアプリ、時短なら自動生成ツールの併用
- 設定値の起点は「話速1.15・抑揚0.95・1秒6.5文字」。間は文中0.2秒・文末0.3秒・オチ直前だけ0.5〜0.7秒の3種類を使い分ける
- 失敗パターンの筆頭は誤読の放置とBGMの音量過多。全文試聴と声-BGM間20dBの音量差は毎回の必須工程
- 収益化はAI音声自体ではなく独自性で判断される。オリジナル台本・クレジット表記・規約確認の3点を守る
音声の実装は本記事の手順で今日から再現できます。一方で、どの声質を選ぶかの判断軸、無料ツールのより広い比較はそれぞれ本文中で紹介した別記事に体系化しているので、併読して自分のチャンネルの「声の標準仕様」を1度決めてしまうことをおすすめします。仕様を固定すれば、2本目以降の制作は台本を書くだけの作業になります。