Shorty(ショーティー)

雑学ショート自動生成のやり方|台本・TTS・編集ツール徹底比較

公開: 2026-07-24 約19分 雑学ショート自動生成TTS動画編集ツール
雑学ショート自動生成のやり方|台本・TTS・編集ツール徹底比較のアイキャッチ画像

雑学ショート動画を自動生成する具体的なやり方を解説。台本生成AI・TTS・動画編集ツールを比較し、ネタ収集から投稿までの自動化フローと収益化審査でのリスクを、60本運用の実録データを交えて紹介します。

目次

「雑学 ショート 自動生成 やり方」で検索する人が知りたいのは、ツールの機能一覧ではなく「実際にどの作業を、どのツールで、どこまで自動化して、毎日何本回せるのか」という運用の解像度のはずだ。結論から言うと、ネタ収集・台本生成・音声合成・字幕焼き付けまでは高い精度で自動化できるが、「完全ノータッチの全自動」を目指すと収益化審査で足元をすくわれる。この記事では、当サイトが雑学チャンネルを実際に60本以上投稿して得たRPMや継続率のデータを踏まえながら、2026年7月時点で実在するツールの料金・機能を比較し、どこまで自動化してどこは手を入れるべきかを具体的な手順で解説する。汎用のAI動画生成ツール比較記事では拾いきれない「毎日量産するための運用設計」に絞って解説していく。

雑学ショート動画の自動生成は「どこまで」できるのか

先に検索結果を見て回ると、上位に出てくる記事は大きく2種類に分かれる。ひとつはCyberLinkやITmediaのような大手メディアが書く「AI動画生成ツール総合比較」で、Sora・Veo・Klingといった汎用動画生成AIの機能や料金を横並びにするタイプ。もうひとつは個人ブログやnoteが書く「雑学動画メイカー」「Gemini自動生成パイプライン」のようなツール紹介で、単発の使い方は載っているが「毎日量産するための運用フロー」までは踏み込んでいないものが大半だった。

この2種類の記事に共通して欠けているのが、次の3点だ。

当サイトには既に「雑学チャンネル60本投稿した結果」「雑学チャンネル収益化の現実」「雑学ジャンルRPM低い対策」「雑学ch RPM実際の数字公開」という実録記事があり、雑学ジャンルの数字自体はそちらに譲る。この記事では、その数字を出すまでの「制作パイプラインの組み方」そのものを深掘りする。

全体ワークフロー:ネタ収集→台本→音声→編集→投稿の5工程

雑学ショート動画の量産は、次の5工程に分解すると自動化しやすい場所と手動を残すべき場所がはっきりする。

  1. ネタ収集:ジャンル(心理・科学・歴史・食・生き物など)を決め、切り口になる事実を集める
  2. 台本生成:40〜60秒で話せる分量(300〜450字程度)にAIで台本化する
  3. 音声合成:TTSでナレーション音声を生成する
  4. 動画編集:字幕焼き付け・BGM・背景素材を合わせて書き出す
  5. 投稿:タイトル・サムネ・タグを付けてアップロード、スケジュール管理する

ここで重要なのは、5工程すべてを「ノーコードで完全自動」にしようとすると、後述する著作権・オリジナリティのリスクが一気に高まるという点だ。当サイトの結論としては、①②はAIにほぼ任せてよいが、③④はAIの出力を必ず人間がチェックする「半自動」に留め、⑤の投稿判断(タイトル・サムネ選定)は必ず人間が最終決定する、という役割分担が事故を防ぐ。

①ネタ収集の工程だけは、AIに完全に丸投げしないほうがいい。 AIに直接「雑学を10個出して」と指示すると、学習データに頻出する定番ネタ(「実は〇〇は△△だった」系)ばかりが返ってきやすく、既に無数の雑学チャンネルで扱われた既視感の強いものになりがちだ。実務では、次のような一次情報源をAIに「調査対象」として渡し、その中から意外性のある事実を抽出させる使い方のほうが精度が高い。

Gemini系のようにWeb検索と連携できるAIであれば、こうした情報源を指定した上でネタを調査させる運用がしやすい。ChatGPTやClaudeを使う場合は、自分で見つけた一次情報のURLやテキストを貼り付けて「この情報から雑学ショート向けのネタを3つ抽出して」と指示する形になる。この「情報源を人間が絞り込み、抽出と要約をAIに任せる」という役割分担が、既視感のあるネタの量産を防ぐ最大のポイントだ。

以下、②以降の工程を実在するツールベースで具体的に見ていく。

台本生成AI比較:ChatGPT・Claude・Geminiで雑学ネタを量産する

台本生成は、汎用の対話型AIをそのまま使うのが最もコストパフォーマンスが良い。専用の「雑学台本生成GPT」のようなカスタムGPTも存在するが、中身はChatGPTのAPIに雑学向けプロンプトを固定しているだけのものが多いため、プロンプトさえ用意すれば自分で無料枠でも再現できる。

ツール 料金目安 強み 雑学台本での弱点
ChatGPT (GPT-5系) 無料枠あり/Plus 月20ドル前後 プロンプト対応力が高く、フォーマット指定(尺・文字数)への追従が良い 同じジャンルを連投すると言い回しが似てくる
Claude (Sonnet/Opus) 無料枠あり/Pro 月20ドル前後 事実確認的な言い回しが自然で、日本語の口語ナレーションが破綻しにくい 出典の正確さは別途ファクトチェックが必要
Gemini (Gemini Pro/Flash) 無料枠あり/有料プランあり Google検索と連携した情報収集がしやすく、最新ネタに強い 台本のトーンがやや説明的になりやすい
雑学ショート台本生成GPT等の専用カスタムGPT ChatGPT Plus内で無料利用 プロンプト設計済みで初心者でも即使える テンプレ感が出やすく、他チャンネルと似た構成になりがち

実務でのやり方はシンプルだ。「①ジャンルを指定→②AIに雑学ネタを3〜5個出させる→③その中から意外性の強いものを人間が選ぶ→④選んだネタで40〜60秒の台本を書かせる」という順番を崩さないことが重要になる。ネタ出しから台本生成まで一発でAIに丸投げすると、既視感のある雑学(「実は〇〇は△△だった」系の定番パターン)ばかりが出力され、視聴維持率が落ちる。

台本の型としては、以下のプロンプト構成が扱いやすい。

あなたは雑学系ショート動画の構成作家です。
テーマ:「{ジャンル}」で、視聴者が最初の3秒で続きが気になる雑学を1つ選び、
以下の構成で40〜60秒(300〜420字)のナレーション原稿を書いてください。
①フック(結論の一部を先出しして疑問を作る、1文)
②意外な事実の提示(具体的な数字・固有名詞を入れる)
③理由・背景の簡潔な説明
④次の動画へつながる一言、または視聴者への問いかけ

このプロンプトに、実際に自分のチャンネルで反応が良かった過去動画の台本を2〜3本「参考例」として貼り付けると、口調や尺の再現性が上がる。これはAI丸投げとの決定的な違いで、自分の過去実績データをフィードバックに使うことで「自分のチャンネルらしさ」を保ったまま量産できる。

TTS音声合成ツール比較:VOICEVOX・CoeFont・VOICEPEAKの実際の使い分け

台本ができたら音声化する。日本語TTSは無料〜買い切り〜サブスクまで選択肢が多く、雑学ジャンルでは「聞き取りやすさ」と「感情の抑揚」のバランスが重要になる。

ツール 料金 商用利用 特徴
VOICEVOX 完全無料 キャラクターにより条件付き可(クレジット表記必須の話者あり) 話者数約20種、抑揚の自然さはキャラ次第でばらつく
CoeFont 無料プランあり/有料は月1,000円台〜 有料プランは商用利用可 話者数が非常に多く(数千種)、声質のバリエーションが豊富
VOICEPEAK 買い切り15,840円〜(ナレーターごと追加購入) 商用利用可 感情パラメータを細かく調整でき、ナレーション向けの自然さが高評価

雑学ショートでは「聞き疲れしにくい速さ」と「棒読み感の少なさ」が離脱率に直結する。無料で始めるならVOICEVOXで十分だが、複数チャンネルを並行運用したり、キャラクター性を出して差別化したい場合はCoeFontかVOICEPEAKへの投資回収が早い。当サイトの実録記事でも触れている通り、雑学ジャンルはRPMが低く出やすいカテゴリのため、初期投資は「無料ツールで検証→伸びた型が見えてから有料TTSに切り替える」の順番が無難だ。

音声合成の工程で自動化に組み込むべきなのは「台本テキストをTTSに流し込み、音声ファイルを書き出す」までで、生成された音声は必ず人間が一度通しで聞く。TTSは固有名詞やカタカナ語のイントネーションを誤ることが依然として多く、ここを聞き飛ばすと再生数が伸びても離脱率が高いままの動画を量産してしまう。

動画自動編集ツール比較:Vrew・CapCut・専用サービスの選び方

音声ができたら、字幕焼き付け・BGM・背景素材を合わせて動画に仕上げる工程だ。ここは近年もっとも自動化が進んでいる領域で、音声を読み込ませるだけで字幕とカット編集まで自動生成してくれるツールが実用レベルに達している。

ツール 料金目安 得意なこと 雑学ショートでの使い方
Vrew 無料プランあり/Light月900円・Standard月1,700円 音声認識による字幕自動生成、無音区間の自動カット ナレーション音声を読み込ませて字幕を自動生成、誤字だけ手動修正
CapCut 基本無料/Pro月1,000円前後 豊富なテンプレート・エフェクト、スマホ完結の編集 テンプレートに音声・字幕・背景素材を流し込んで統一感のあるフォーマットを量産
雑学動画メイカー等の専用Webサービス サービスにより異なる(無料枠+従量課金型が多い) 雑学テキストと画像を入れるだけでナレーション・字幕・BGM入り動画を自動生成 ネタと画像さえ用意すれば一気通貫で書き出せるが、テンプレ感が強く出やすい

実務フローとしては「Vrewで字幕付き動画のベースを作り、CapCutでテンプレート適用とサムネ用カットを整える」という二段構えが、量産スピードと個性のバランスが良い。専用の雑学動画自動生成サービスは1本あたりの制作時間を最も短縮できる反面、同じテンプレートを使う他チャンネルとの見た目の差別化が難しくなる点は事前に理解しておく必要がある。

投稿の自動化とスケジュール運用

動画が書き出せたら、タイトル・サムネ・タグを付けて投稿する。ここを完全自動化するツール(APIでのスケジュールアップロード等)も存在するが、当サイトでは投稿の最終判断だけは人間が行うことを推奨している。理由は次の2つだ。

自動化してよいのは「動画ファイル・台本・タグ候補をあらかじめ生成してストックしておき、投稿スケジュールに沿って人間がワンクリックでアップロードする」というところまでだ。完全無人でのアップロードまで自動化するのは、後述するポリシーリスクの観点からも避けたい。

投稿前チェックとして、量産運用でも最低限これだけは人間が確認するというチェックリストをまとめておく。

  1. タイトルに既存動画と同じ言い回しを連発していないか(3〜5本ごとに見直す)
  2. サムネのテキスト量が多すぎて縮小表示で読めなくならないか
  3. TTS音声を通しで再生し、誤読・不自然な間がないか
  4. 台本の内容が既存の他チャンネル・記事の表現とほぼ同一になっていないか
  5. 投稿間隔が不自然に均一(秒単位まで同一)になっていないか

このチェックリストを毎回すべての工程に適用するのではなく、量産のボトルネックにならない範囲で「音声チェックとタイトル重複確認は毎回」「表現の被りチェックは週1回まとめて」のように頻度を分けて運用すると、自動化のスピードを落とさずにリスクを抑えられる。

完全自動化の落とし穴:著作権・収益化審査・音声の質

ここが検索意図の核心にもかかわらず、競合記事がほとんど触れていない部分だ。雑学ショート動画を自動生成する際に見落とされがちなリスクを3つ挙げる。

1つ目は著作権だ。 雑学ネタの「事実」自体には著作権はないが、AIが生成した文章表現や、参照した特定サイトの言い回しをそのまま使うと問題になりうる。台本生成AIに複数のネタ候補を出させたら、必ず既存の類似動画・記事と表現が被っていないか人間が確認する工程を挟むべきだ。

2つ目は収益化審査でのオリジナリティ判定だ。 YouTubeは2025年7月に「繰り返しの多いコンテンツ」ポリシーの名称を「量産型のコンテンツ」に変更した。Google日本法人は「生成AIコンテンツ自体を狙い撃ちしたものではなく、反復的で低品質な量産コンテンツかどうかを見ている」と説明しているが、これは裏を返せば「テンプレート化された台本・同じBGM・同じ構成のオープニングを機械的に繰り返す」運用は、AIを使っていなくても審査で不利になり得るということだ。台本・音声・編集のすべてをテンプレートに固定して完全自動化すると、この「量産型」の判定基準に近づいてしまうリスクがある。一般に語られる「AIを使うと収益化できない」という単純な話ではなく、テンプレートの反復度合いそのものが見られている点を誤解しないでほしい。

3つ目は音声の質だ。 TTSは年々自然になっているとはいえ、長時間の視聴では機械音声特有の平坦さが視聴維持率を下げる要因になりうる。特に雑学ジャンルは情報量で勝負するため、音声のテンポや間の取り方が悪いと視聴者は離脱しやすい。無料TTSで量産スピードを優先するチャンネルほど、この点のチェックを怠りやすい。

60本運用した実録データから見えた「自動化すべき工程」の境界線

当サイトが雑学チャンネルを60本以上投稿して検証した結果、自動化の効果が高かった工程と、手を抜くと数字に直結して悪化した工程がはっきり分かれた。詳細な収益データは実録記事に譲るが、傾向として言えるのは次の3点だ。

つまり「AIにネタ探しと台本作りを任せて時間を作り、その分をサムネ・タイトル・音声チェックという“人間が介在すべき工程”に再投資する」のが、実際に数字を伸ばした運用だったということだ。完全自動化は制作本数を増やせても、そのぶん1本あたりの視聴維持率やクリック率が下がりやすく、トータルの収益では必ずしも有利にならない。

これは一般に語られる「制作本数を増やせば増やすほどチャンネルは伸びる」という考え方への反論でもある。実際には本数を倍にしても、1本あたりの視聴維持率が下がれば総再生時間はさほど伸びず、むしろアルゴリズムからの評価が伸び悩む期間が生じることもあった。本数のスケールと質のチェックは、常にセットで管理すべき指標だという点は、他の雑学系ノウハウ記事があまり触れていない実務上の落とし穴だと感じている。

雑学ジャンルはRPM自体が低い傾向にあることは既存記事でも指摘している通りで、本数を増やすだけの完全自動化戦略よりも、自動化で浮いた時間を高RPMが期待できる切り口の企画や、サムネ改善のA/Bテストに回すほうが、収益化の観点では効率が良い。

無料構成と有料構成、初期費用はどれくらい違うか

自動化のツール選びで最後に迷うのが「どこまで課金するか」だ。実際に運用する際の月額コスト感を、無料構成と有料フル構成で比較すると次のようになる。

構成 台本生成 音声合成 動画編集 月額目安
無料フル構成 ChatGPT/Claude無料枠 VOICEVOX CapCut無料版 0円
一部有料構成 ChatGPT Plus(20ドル前後) CoeFont有料(1,000円台〜) Vrew Light(900円) 月4,000〜5,000円程度
有料フル構成 ChatGPT Plus+Claude Pro VOICEPEAK買い切り(初月のみ高額) Vrew Standard(1,700円)+CapCut Pro(1,000円前後) 初月2万円前後、翌月以降月5,000〜6,000円程度

無料構成でも量産自体は成立するため、まずは無料フル構成でチャンネルを立ち上げ、投稿本数が増えて「声質やテンプレートの差別化が必要」と感じた段階で部分的に有料ツールへ切り替えるのが投資対効果として合理的だ。雑学ジャンルはRPMが他ジャンルより低めに出やすいため、初期段階から有料フル構成に投資しても回収までに時間がかかりやすい点は既存の実録記事とも整合する結論になっている。

よくある質問

雑学ショート動画は何を使えば完全無料で自動生成できますか?

台本はChatGPTかClaudeの無料枠、音声はVOICEVOX、編集はCapCutの無料版を組み合わせれば費用ゼロで一通り作れる。ただし品質チェックの手動工程は必ず残す必要がある。

無料枠だけでも「ネタ出し→台本→音声→字幕→編集」の5工程は一通り再現できる。実際に多くの個人運営チャンネルがこの組み合わせでスタートしている。ただし無料TTSは声質のバリエーションが限られるため、他チャンネルとの差別化が課題になりやすい。伸びてきたタイミングでCoeFontやVOICEPEAKなどの有料TTSへ切り替える運用が現実的だ。

台本生成から動画完成まで1本あたりどれくらい時間がかかりますか?

ツール習熟後は1本あたり15〜30分程度が目安。ネタ選定と音声・字幕チェックに人手をかけるほど時間は伸びるが、その分品質は安定する。

内訳の目安は、ネタ出しと台本生成で5分、TTS音声化で5分、Vrew・CapCutでの編集とチェックで10〜15分程度。完全自動化ツールを使えばこれより短縮できるが、前述の通りテンプレ感が強くなりやすいため、時間短縮と差別化のトレードオフを理解した上で選ぶ必要がある。

雑学系ショート動画は著作権的に問題になりませんか?

事実そのものに著作権はないが、参照元の表現をそのまま使うと問題になりうる。AIが生成した台本も、既存動画・記事との表現の被りを人間が確認する工程が必須だ。

特に「〇〇雑学まとめ」系の既存チャンネルで使われている定番の言い回しは無意識に似てしまいやすい。台本生成AIに「他の雑学チャンネルとは違う切り口・言い回しで」という指示を加えるだけでも重複リスクはある程度下げられる。

完全自動化するとYouTubeの収益化審査に通りにくくなりますか?

AIを使うこと自体は問題視されていないが、台本・音声・構成をすべてテンプレート化して機械的に反復すると「量産型のコンテンツ」ポリシーに抵触するリスクが上がる。

2025年7月のポリシー名称変更(「繰り返しの多いコンテンツ」→「量産型のコンテンツ」)以降、反復性・低品質性がより明確な審査軸になっている。台本の切り口やオープニングの言い回しに定期的なバリエーションを持たせることがリスク低減につながる。

雑学ネタが尽きたらどうやってAIに探させればいいですか?

ジャンルを固定せず「意外性のある統計」「日常の勘違い」「歴史のあまり知られていない事実」のように切り口を変えて複数候補を出させ、その中から選ぶ運用にするとネタ切れしにくい。

台本生成AIに一度で1本分のネタを出させるのではなく、毎回3〜5個の候補を出させて選別する工程を挟むことで、AI側の出力の偏り(同じパターンの雑学ばかり出す)を防げる。過去に使ったネタの一覧をプロンプトに含めて「重複を避ける」よう指示するのも有効だ。

TTSの音声はどれくらい自然になっていますか?聞いてすぐAIとわかりますか?

短い相槌や強調表現は依然として不自然になりやすいが、通常のナレーション部分はVOICEPEAKやCoeFontの上位話者であれば多くの視聴者が違和感なく聞ける水準にある。

ただし固有名詞・カタカナ語・数字の読み上げは誤読が起きやすく、聞き流すと不自然な箇所を見逃す。生成した音声は必ず一度通しで聞き、違和感があれば言い回しを変えて再生成する工程を省略しないことが重要だ。読点の位置を調整したり漢字をあえてかな書きに変えたりするだけで誤読が解消するケースも多く、台本側を微調整する引き出しを持っておくと再生成の手戻りを減らせる。

動画自動編集ツールだけで最後まで完結できますか?

雑学動画メイカーのような専用サービスなら台本テキストと画像を入れるだけで一気通貫の書き出しは可能だが、テンプレートが固定されるためチャンネルごとの個性は出しにくい。

制作スピードを最優先するならこうした専用サービスは有力な選択肢だが、前述の「量産型コンテンツ」リスクや他チャンネルとの見た目の類似を避けたい場合は、VrewとCapCutを組み合わせて自分なりのフォーマットを作るほうが長期運用には向いている。

顔出し・声出しなしでも雑学チャンネルは成立しますか?

成立する。TTSナレーション+字幕+素材映像の組み合わせは雑学ジャンルの標準フォーマットであり、顔出しなし・声なしで動画を作る方法で解説している手法と親和性が高い。

雑学ジャンルはもともと「情報の意外性」が主役のコンテンツであり、話者の顔や声の個性よりも台本の切り口とテンポが視聴維持率を左右する。そのため顔出し・声出しなしでも十分に成立しやすいジャンルだと言える。

まとめ

雑学ショート動画の自動生成は、ネタ収集・台本生成・音声合成・字幕編集までは実在するツールの組み合わせで高い精度の自動化が可能だ。ChatGPT・Claude・GeminiによるAI台本、VOICEVOX・CoeFont・VOICEPEAKによる音声合成、Vrew・CapCutによる自動編集を①ネタ収集→②台本生成→③音声合成→④動画編集→⑤投稿の5工程に当てはめれば、1本あたり15〜30分程度での量産体制は現実的に作れる。

ただし「完全ノータッチの全自動」を目指すと、テンプレート化した反復コンテンツとして収益化審査で不利になるリスクや、TTSの誤読・不自然な発話をチェックしないまま公開してしまうリスクが高まる。当サイトが60本以上の運用で得た実感としても、自動化で浮いた時間をサムネ・タイトルの人力最適化や音声チェックに再投資したチャンネルのほうが、視聴維持率とクリック率の両面で安定した。まずは無料ツールだけで①〜④の工程を一通り自動化し、伸びた型が見えてから有料TTSや専用編集ツールへの投資判断をする、という順番で始めるのが遠回りに見えて実は最短ルートだ。

雑学ジャンルは参入障壁が低い分、テンプレート化した完全自動生成の動画も増えている。だからこそ「どこを自動化し、どこに人間の判断を残すか」の設計そのものが、他チャンネルとの差になる。ツールの機能を覚えることよりも、この記事で挙げた工程分解と役割分担を自分のチャンネル運用に当てはめて検証していくことが、長期的に安定したチャンネルづくりにつながっていくはずだ。

顔出しなしのショート動画、自分でも作ってみませんか?

この記事で紹介した faceless 動画は、Shorty ならテーマを入力するだけで台本・音声・字幕・BGM 込みで自動生成できます。無料プランあり。

無料で動画を作ってみる