Shorty(ショーティー)

動画ナレーションAI作り方|台本から貼り付けまで完全ガイド

公開: 2026-08-23 更新: 2026-09-21 約20分 AIナレーション音声合成動画編集顔出しなし
動画ナレーションAI作り方|台本から貼り付けまで完全ガイドのアイキャッチ画像

動画にAIナレーションを入れる実務手順を解説。台本の書き方から音声ツール選び、CapCutでの貼り付け・字幕同期・BGM調整まで、顔出しなしで今日から始められる方法を無料〜有料ツール比較つきで紹介する。

雑学ショート動画を、テーマ入力だけで1本作る 台本・AI音声・字幕・BGMまで自動生成。顔出しなしで副業を始める人向け。無料プランは30日5本まで(1本30秒)。 無料で作ってみる
目次

動画にAIナレーションを入れるだけなら、①台本を書く→②AI音声ツールで読み上げを生成する→③動画編集ソフトに音声を貼り、字幕と同期させる、という3ステップで完結する。編集スキルも機材もいらず、無料ツールだけで今日から着手できる。

ただし、多くの解説記事は「ツール一覧」を並べたところで終わっている。実際に挫折するのは、ツールを選んだ後だ。書き出した音声を動画に貼っただけでは、間延びして聞こえる、字幕とタイミングがずれる、棒読みで最後まで見てもらえない——という壁にぶつかる。この記事では、ツール比較よりも先に「貼った後にどう整えるか」という実務のコツを中心に、台本作成から公開直前のチェックまでを手順として通しで解説する。既存のAIナレーションでYouTube収益化はできる?2026年の条件が「収益化ポリシー」を扱っているのに対し、本記事は純粋に「どう作るか」の実務に絞る。

同じ音声を使ってずんだもんのキャラ動画を作るなら、台本から投稿までを通しで解説したずんだもん動画の作り方が全体の地図になります。

AIナレーション動画の作り方|全体の流れは3ステップ

結論として、AIナレーション動画の制作は「台本→音声生成→動画への貼り付けと同期」の3工程に集約される。それぞれにかかる時間の目安は、30秒のショート1本であれば台本10〜15分、音声生成2〜5分、動画への貼り付けと調整15〜20分程度で、慣れれば1本30〜40分ほどで完成する。

工程を分解すると次のようになる。

  1. 台本を書く:伝えたい事実・結論を1つに絞り、尺に合った文字数で書く(後述する「1秒5〜6文字」が目安)。
  2. AI音声ツールで読み上げを生成する:台本をテキストで貼り付け、声質・速度・抑揚を設定して音声ファイル(WAVやMP3)として書き出す。
  3. 動画編集ソフトに音声を貼り、字幕・BGMと同期させる:CapCutやDaVinci Resolveなどのタイムラインに音声を配置し、字幕を音声に合わせて割り、BGMの音量を声より下げて馴染ませる。

多くの人がつまずくのは3番目の「同期」の工程だ。音声を貼るだけなら誰でもできるが、句読点でカットを切り替える、事実の直前だけ間を作るといった調整をしないと、AI音声特有の「間延び」や「棒読み感」がそのまま視聴者に伝わってしまう。この記事では特に3番目を厚めに扱う。

なお、台本→音声→動画編集という3工程を個別のツールで行う代わりに、1つのツールで台本入力から動画書き出しまでを一気通貫にする方法もある。当サイトが開発・運営しているShortyはその一例で、テキストを入力すると音声付きのショート動画を生成できる。無料プランには1本30秒まで・30日で5本まで・保存7日間・ショート形式のみという制約があるため、本数を作り込みたい場合や30秒を超える尺では、後述する個別ツールの組み合わせのほうが向いている。工程を減らしたい人向けの選択肢の1つとして押さえておいてほしい。

台本(原稿)の書き方:AIに何を任せ、どこを自分で直すか

結論から言うと、台本はAIに叩き台を作らせ、音声合成が誤読しやすい表現だけ自分で直す、という分業が最も効率的だ。ゼロから自分で書く必要も、AIの出力をそのまま使う必要もない。

尺から逆算して文字数を決める

日本語のアナウンサーの読み上げ速度はおおむね1秒あたり5〜6文字が目安とされる。この数字から、動画の尺に対する適正文字数が逆算できる。

動画の尺 標準速(5〜6字/秒)の目安文字数 備考
15秒 75〜90字 結論1つで限界。前置きは入らない
30秒 150〜180字 ショート動画の標準的な尺
45秒 225〜270字 結論+補足1つが入る
60秒 300〜360字 手順の説明や複数の要点向け

ここで出した文字数は上限に近い。実務では算出値の8〜9割に抑え、余った時間を「結論を言い終えた直後の間」に使うと、聞き取りやすさが大きく変わる。台本を先に書いてから尺に合わせようとすると、再生速度を無理に上げるしかなくなり、結果的に聞き取りにくい動画になる。順序は必ず「尺→文字数→台本」で進める。

台本作成の3ステップ

  1. ChatGPTやClaudeに叩き台を作らせる:「〇〇について、30秒のショート動画用ナレーション原稿を150字程度で。結論を最初の1文に置いて」のように、尺と文字数、結論を先に言う構成を指定してプロンプトに入れる。
  2. 音声合成が誤読しやすい表現を自分の言葉に直す:数字の桁区切り、英略語、専門用語の読みは机上でチェックしておく(詳しくは後述)。
  3. 句読点と改行で「間」を設計する:読点(、)は0.2〜0.3秒、句点(。)は0.5秒前後の間を生む。結論の直前・直後に句点や改行を入れておくと、AI音声ツール側で自動的に間が空く。

誤読を防ぐための実務チェック

AI音声ツールは、人間なら文脈で読み分けられる表現を誤読することがある。台本を音声化する前に、次の点を確認しておくと書き出し後の修正が減る。

一般的には「AI音声は読み上げるだけだから、台本さえ書けば完成」と思われがちだが、実際には誤読チェックと間の設計にかける時間のほうが、台本の文章そのものを練る時間より効いてくる。ここが台本作成の見落とされがちな条件だ。

また、AIに叩き台を作らせる際は「結論を最初の1文に置く」という指定を必ず入れたほうがいい。ChatGPTやClaudeは、指定しないと導入・背景・結論の順で書きがちで、ショート動画の尺ではその構成だと結論にたどり着く前に離脱されてしまう。プロンプトの段階で構成を固定しておくと、生成後の直しが最小限で済む。

AI音声ツールの選び方と比較|無料〜有料まで

結論として、まず無料ツールで1本作ってみて「声が自分のチャンネルに合うか」を確認してから、本数や品質の要求に応じて有料ツールへ移行するのが遠回りに見えて一番早い。いきなり有料の高品質ツールを契約しても、声が合わなければ作り直しになる。

主要なAI音声ツールの比較表

ツール名 費用感 日本語の自然さ 商用利用(要公式確認) 向いている用途
VOICEVOX 完全無料 ずんだもん等キャラ声で個性は出るが機械的 キャラごとに規約が異なり、クレジット表記が必要な場合が多い 顔出しなし副業の入門・量産の初期段階
VOICEPEAK 買い切り1万円台〜 高い、自然な抑揚を細かく調整できる 買い切りかつ商用利用可とされる製品が多い(声ごとに条件差あり) ランニングコストを抑えたい継続運用
TTSMaker 無料(ブラウザ完結) 標準的、多言語対応 要公式確認、無料枠の商用条件を必ず確認する すぐに試したい・多言語ナレーション
CoeFont 無料枠あり/有料プラン 自然、感情表現の幅がある 無料枠は商用利用に制約がある場合が多い 有料化を見据えた中期運用
ElevenLabs 無料枠あり/有料プラン月額 非常に自然(英語が主戦場、日本語も対応) 無料枠には商用ライセンスが付かないケースが多い 多言語展開・高品質を求める場合
Shorty(当サイト運営) 無料プランあり 標準的 台本入力から動画生成まで一括、無料は1本30秒・30日5本・保存7日・ショート限定 台本〜動画化の工程を減らしたい人

表の商用利用欄はいずれも変動が大きい領域であり、必ず各サービスの公式規約を自分の目で確認してから量産に乗せてほしい。特に「無料プランなら何でも商用OK」という理解は危険で、実際にはキャラクターや声ごとに条件が枝分かれしていることが多い。

無料のTTS横断比較を先に見たい場合は無料TTS比較2026にまとめているので、そちらも参照してほしい。

ツール選びで確認すべき5つの軸

  1. 商用利用条件が公式ドキュメントに明記されているか(曖昧なものは量産に使わない)
  2. 速度を上げても子音が潰れないか(ショート動画は標準よりやや速い速度で使うことが多い)
  3. 数字・固有名詞の読み間違いが少ない、または辞書登録で修正できるか
  4. 同じ声・同じ設定を何十本にもわたって再現できるか(チャンネルの声の一貫性)
  5. 書き出したファイルを自分の手元に保存できるか(サービス終了時のリスク回避)

このうち1番を満たさないツールは、どれだけ音質が良くても外したほうがいい。数百本を公開してから条件の違いに気づくと、修正コストが跳ね上がる。

ここまでの手順、1本ぶんまるごと自動でやりますShorty はテーマを入力するだけで、台本・AI音声・字幕・BGMを揃えた雑学ショート動画を生成します。無料プランは30日5本まで。無料で作ってみる

実践:音声を書き出して動画に貼り付ける手順(CapCut基準)

ここからは、生成した音声ファイルを実際に動画へ組み込む手順を、スマホでもPCでも使える無料アプリのCapCutを例に説明する。他のソフト(DaVinci Resolve、Premiere Pro、Canva)でも工程自体は同じなので、置き換えて読んでほしい。

CapCutでの貼り付け手順

  1. CapCutで新規プロジェクトを作成し、背景動画・画像素材を先にタイムラインへ追加する。
  2. [オーディオ]→[音声を追加]から、AI音声ツールで書き出した音声ファイル(WAV/MP3)をインポートする。
  3. 音声クリップをタイムラインの先頭に配置し、背景素材の長さを音声の尺に合わせて調整する。(音声より先に背景を作り込むと、後から尺のズレを直すのに時間がかかる)
  4. [テキスト]→[自動字幕]を使い、音声から字幕を自動生成する。(自動生成の誤字は必ず目視で確認し、手動で修正する)
  5. 句読点の位置でカットを分割する。 読点の0.2秒後、句点の0.5秒後を目安に次のクリップへ切り替えると、視線移動とナレーションのリズムが合いやすい。
  6. BGMトラックを追加し、音声トラックより明確に音量を下げる(目安は音声比マイナス15〜20dB程度)。
  7. 書き出し前に、実機(スマホの内蔵スピーカー・小音量)で通し再生して確認する。 PCのモニタースピーカーやヘッドホンで確認すると、速すぎる・小さすぎるという判断を誤りやすい。

DaVinci Resolve / Premiere Pro / Canvaでの違い

CapCut以外を使う場合も、手順の骨格(音声を先に置く→背景を尺に合わせる→字幕を割る→BGMを重ねる)は同じだが、ツールごとに得意・不得意がある。

ソフト 得意なこと 注意点
CapCut スマホ完結、自動字幕の精度が高い、無料で機能制限が少ない 高度な色調整やマルチカム編集には不向き
DaVinci Resolve 音声のノイズ除去・音量正規化などプロ向け処理が無料版でも可能 学習コストが高く、ショート1本作るには機能過多
Premiere Pro Adobe他製品との連携、テキストベース編集が強力 サブスク費用がかかる、動作が重め
Canva テンプレートが豊富で初心者に優しい 音声とタイムラインの細かい調整には制約がある

副業として本数をこなすなら、無料かつスマホで完結できるCapCutが最も始めやすい。慣れて音質にこだわりたくなった段階でDaVinci Resolveへ移行する、という順序で問題ない。編集スキルに自信がない場合ほど、最初から高機能なソフトを選ばず、機能が絞られたアプリで工程数自体を減らすほうが挫折しにくい。

字幕とナレーションを自然に同期させる3つのコツ

結論として、AIナレーションが「聞きやすい」か「間延びして見える」かの差は、音声そのものの質よりも、句読点でのカット割り・字幕の文字数・再生速度の3点で決まる。

1. 句読点でカットを切り替える

ナレーションの読点(、)の0.2秒後、句点(。)の0.5秒後を目安に次のカットへ切り替えると、人間の視線移動とナレーションのリズムが同期し、映像が「音声に追いついていない」違和感が消える。逆に、カットの切り替えとナレーションの区切りがずれていると、内容は同じでも視聴者は「なんとなく見づらい」と感じて離脱しやすくなる。

2. 字幕は1行13〜15字・最大2行までに収める

ショート動画は画面が縦長で表示領域が狭いため、1行あたりの字幕は13〜15字程度、最大でも2行までに収めるのが目安だ。自動生成された字幕をそのまま使うと1行が長すぎることが多いので、意味の切れ目で改行を入れ直す作業が必要になる。字幕の表示時間は、音声のその部分の再生時間に合わせるのが基本で、早く消えすぎると読み切れず、遅すぎると次のセリフとかぶって見える。

3. 再生速度は1.0〜1.2倍を基準に調整する

AI音声はツールのデフォルト設定のままだと、間延びして聞こえることが多い。1.0〜1.2倍速の範囲で微調整すると、テンポが引き締まり最後まで見てもらいやすくなる。ただし、上げすぎると子音が潰れて聞き取りにくくなるため、1.3倍を超えたあたりから急に聞き取りづらくなるツールが多い。速度を上げる前に台本を削るほうが、聞き取りやすさを保ったまま尺を詰められる。

多くの解説記事は「ツールの選び方」で終わっているが、実際に視聴維持率を左右しているのは、この同期の調整にどれだけ時間をかけたかである。 同じ音声ツール・同じ台本でも、句読点でのカット割りと字幕の分割を丁寧にやった動画とやっていない動画とでは、最後まで見られる比率に明確な差が出る。これがこの記事で最も伝えたい独自視点だ。

BGM・効果音でナレーションを聞きやすくする

結論として、BGMはナレーションを邪魔しない音量とジャンルを選び、声より明確に控えめにするのが基本だ。BGMが大きすぎる、あるいはナレーションと同じ帯域(中音域)の楽器が目立つ曲を選ぶと、AI音声の聞き取りにくさがさらに悪化する。

具体的な調整の目安は次のとおり。

BGMやSEの具体的な探し方・使い方はYouTubeオーディオライブラリの使い方で詳しく解説しているので、無料で著作権フリーの音源を探したい場合はそちらを参照してほしい。BGM選びとナレーションのバランス調整は切り離せない作業なので、音声の同期を整えた後にBGMを重ねる、という順序で作業すると手戻りが少ない。

AIナレーションでよくある失敗と対処法

結論として、AIナレーション動画の失敗パターンは限られており、原因さえ分かれば対処は難しくない。

症状 よくある原因 対処法
棒読みで最後まで見てもらえない 抑揚がフラットな設定のまま生成している 結論の直前だけ速度を落とす、または声質プリセットの「感情強め」設定を部分的に使う
音声と映像がズレて見える カット割りが句読点と無関係に決められている 句読点の位置でカットを切り直す(本記事の同期セクション参照)
数字や固有名詞を読み間違える ツールの標準読み辞書に存在しない単語 辞書登録機能を使う、または平仮名や言い換えに台本を直す
BGMで声が聞き取りにくい BGM音量が声と同等かそれ以上になっている 声比マイナス15〜20dB、またはダッキング処理を入れる
字幕が読み切れない・かぶる 自動生成字幕をそのまま使っている 1行13〜15字・最大2行に手動で調整し、表示時間を音声に合わせる
動画全体が間延びして見える デフォルト速度のまま書き出している 1.0〜1.2倍速に調整、または台本を削って情報密度を上げる
毎回声が変わってブランドが定まらない 動画ごとに声質・速度をその都度選び直している 声と速度の設定値をテキストで記録し、チャンネル内で固定する

このうち「毎回声が変わる」は見落とされがちだが、実務上の影響が大きい。視聴者はショートのフィードで、チャンネル名を認識する前に声を聞いている。同じ声が続けば「またこのチャンネルか」という認識が育つが、動画ごとに声が変わるとその認識が育たない。一般的には「声は好みで選べばいい」と語られがちだが、実際には声はチャンネルの識別子として機能しており、一度決めたら数十本〜数百本にわたって変えないほうがいい。 ここが、単なるツール紹介記事と実務ノウハウの差になる。

よくある質問

AIナレーションに著作権上の問題はある?

台本を自分で書き、正規のAI音声ツールを利用規約の範囲内で使う限り、著作権上の大きな問題は生じにくい。

ただし、他人が書いた文章をそのまま読み上げる場合は原文の著作権に注意が必要で、実在の有名人の声に似せた音声を無断で使う「なりすまし」は肖像権・パブリシティ権の観点で別のリスクがある。使用するAI音声ツールの利用規約・商用利用条件は、動画を公開する前に必ず自分の目で確認してほしい。

AI音声を使うと収益化に不利になる?

AI音声を使ったこと自体を理由に収益化ができなくなる、という事実は確認できない。問題視されるのは内容の独自性のなさのほうだ。

YouTubeは2025年7月15日から、「反復的コンテンツ」ポリシーを「量産型・非独自コンテンツ」の基準として明確化し、誰が作っても同じになる大量生産型のコンテンツを収益化対象から外す方針を明示している。固定の背景にAI音声を載せただけの動画は該当しやすいが、題材の切り口や構成、字幕・BGMの作り込みに自分の判断が入っていれば、AI音声を使うこと自体は障害にならない。収益化の詳しい条件はAIナレーションでYouTube収益化はできる?2026年の条件で解説している。

商用利用は無料ツールでも大丈夫?

無料ツールでも商用利用を認めているケースは多いが、クレジット表記など条件が付くことが多く、キャラクター・声ごとに条件が異なる場合がある。

「無料だから何をしても自由」ではなく、各サービスの利用規約に商用利用の可否・クレジット表記の要否が明記されているかを必ず確認したほうがいい。条件が読み取れないツールは、量産の前提から外すのが安全だ。

スマホだけで完結できる?

台本作成・音声生成・動画編集のすべてをスマホアプリだけで完結させることは可能で、実際にそうしている運用者も多い。

CapCutはスマホ版でも音声読み上げ機能や自動字幕機能を備えており、AI音声ツールもブラウザ経由で使えるものが多い。パソコンでの作業に慣れていない場合は、まずスマホだけで1本作り切ってみると、工程の全体像がつかみやすい。

音声が棒読みにならないようにするには?

台本の句読点と改行で「間」を明示的に設計し、結論の直前だけ速度をわずかに落とすと、機械的な読み上げでも棒読み感が和らぐ。

音声合成ツールはデフォルト設定のままだと抑揚が一定になりやすい。多くのツールには速度・音程・抑揚の強さを個別に調整できる設定があるので、結論部分だけ設定を変える、あるいは疑問形の語尾だけ手動でピッチを上げるといった局所的な調整が効く。全体を均一に強調しようとすると逆に不自然になるため、メリハリは一部分に絞るのがコツだ。

英語ナレーションも同じ手順で作れる?

基本的な工程(台本→音声生成→貼り付けと同期)は同じだが、多言語対応をうたうツールを選ぶ必要がある。

ElevenLabsのように英語を主戦場とするツールは、英語ナレーションの自然さで強みがある一方、日本語の精度はツールごとに差が大きい。複数言語のチャンネルを運用する場合は、言語ごとに最適なツールが異なる前提で、テスト読みをしてから選定したほうがいい。

声はチャンネルで統一したほうがいい?

統一したほうがいい。声はチャンネルの識別子として機能しており、動画ごとに声を変えると視聴者の認識が育ちにくくなる。

例外として、対話形式の演出で2声を使い分ける場合や、明確なジャンル切り替えを行う場合は声を変える合理性がある。それ以外の「なんとなく飽きたから変える」という理由での変更は避けたほうがいい。声質・速度・音程の設定値はテキストで記録しておくと、後から同じ音を再現しやすくなる。

音声生成にかかる時間とコストの目安は?

30秒程度の台本であれば、無料ツールでも生成自体は数十秒〜数分で完了する。コストは無料ツールなら0円、有料の高品質ツールでも月30本程度の運用であれば月額数百円〜数千円に収まることが多い。

コストの目安として、月額固定制の高品質AI音声ツールを月30本のペースで使う場合、1本あたりの単価は数十円〜100円台に収まる計算になる。収益化前の段階でこの固定費が負担に感じる場合は、まず無料ツールで型を作り、伸びが見えてから有料ツールへの移行を検討する順序が無難だ。

あわせてVOICEVOXの使い方2026(スマホでの手順つき)を読んでおくと、次の工程でつまずく箇所を先回りして潰せます。

まとめ

AIナレーション動画の作り方は、台本→音声生成→動画への貼り付けと同期、という3工程に集約される。ツール選びそのものより、貼り付けた後の同期作業(句読点でのカット割り・字幕の文字数調整・再生速度の微調整)に時間をかけたほうが、視聴維持率への影響が大きい。

要点を整理する。

公開前の最終チェックリストとして活用してほしい。

最後にリスクも書いておく。AIナレーションはあくまで「聞き取りにくさ」というマイナスを消す手段であり、それ単体で再生数を伸ばすプラスの要因にはならない。題材選びや冒頭の引きが弱ければ、どれだけ音声を丁寧に作り込んでも視聴維持率は上がらない。また、無料ツールの商用利用条件は改定が入りやすい領域のため、本記事の内容も定期的に公式規約と照らし合わせて確認してほしい。BGMの探し方はYouTubeオーディオライブラリの使い方、収益化の条件はAIナレーションでYouTube収益化はできる?2026年の条件にそれぞれ譲るので、あわせて読んでほしい。

この記事の手順、1本ぶんまるごと自動化できます

台本づくり・音声合成・字幕入れ・BGM 選びを工程ごとに手作業でやると、慣れても1本30分は消えます。Shorty はテーマを入力するだけで、この記事で解説した工程をまとめて1本のショート動画にします。無料プランは30日で5本まで(1本30秒・保存7日)。

無料で1本作ってみる