ナレーションとBGMの音量バランスに「絶対の正解」はありませんが、目安となる数値は存在します。結論から言うと、ナレーションを基準(0dB相当)としたとき、BGMはナレーションがある区間で-20dB前後、つまり体感で「聞こえるけど言葉の邪魔をしない」レベルまで下げるのが業界的な出発点です。ただし多くの解説記事はこの数値を出して終わっており、「なぜスマホで聞くと同じ設定でも声が埋もれるのか」「効果音まで入れた3つ巴のバランスはどう組むのか」「AIナレーションと生声で基準は同じでいいのか」といった、雑学ショート動画を量産する副業層が実際に詰まるポイントには踏み込んでいません。この記事では数値目安に加えて、そこを埋めます。
なお本記事は2026年8月時点の情報を基に、shorty編集部がCapCut・Premiere Pro・ゆっくりムービーメーカー4(YMM4)の実機検証を交えて構成・更新しています。
なお、ここで作った音声を実際の動画1本に組み上げるところまで知りたい場合は、ずんだもん動画の作り方と無料ツールの組み合わせ方に工程の順番をまとめています。
ナレーションとBGMの音量バランス、結論の目安数値
結論として、ナレーションの音量を基準に置き、BGMはシーンによって2段階で下げるのが実用的です。ナレーションが流れている間はBGMをしっかり下げ(ダッキング)、ナレーションが途切れるオープニング・アウトロ・間(ま)ではBGMを少し戻す、という「固定値ではなく可変」の考え方が核心です。
具体的な目安は次の通りです。
| 音声要素 | 場面 | dBの目安(編集ソフトのフェーダー基準) | ひとことメモ |
|---|---|---|---|
| ナレーション | 常時 | -16〜-14dB前後(波形のピークが軽くつく程度) | ここを動画全体の音量基準にする |
| BGM | ナレーションが流れている区間 | -28〜-30dB前後(ナレーションより20dB前後下げる) | いわゆる「-20dBルール」に近い考え方 |
| BGM | ナレーションが無いオープニング・間・アウトロ | -20〜-24dB前後 | ここでBGMを主役に戻すとメリハリが出る |
| 効果音(SE) | 強調したい瞬間のみ | -20〜-18dB前後 | 出しすぎるとナレーションと喧嘩する |
この数値はあくまで「多くのショート動画・解説動画で機能しやすい目安」であり、絶対値として鵜呑みにしないでください。編集ソフトによって音量メーターの計測方式(ピーク値かRMS値か、LUFSかdBFSか)が異なるため、同じ「-20dB」という表示でも聞こえ方は変わります。数値は出発点にして、必ず耳で最終確認する前提で使ってください。
なぜ音量バランスが視聴維持率を左右するのか
結論として、雑学ショート動画では「冒頭2〜3秒でナレーションが聞き取れるか」が離脱率に直結します。BGMがナレーションより目立っていると、視聴者は無意識に「聞き取りにくい」と判断して指を動かし、次の動画へスワイプします。これは音質の良し悪し以前の、情報の受け取りやすさの問題です。
YouTubeやTikTokなどのプラットフォームは配信時にラウドネスノーマライゼーション(音量の自動平準化)をかけており、YouTubeはおおむね-14LUFS相当を基準に、これを超える音量の動画は自動的に下げて配信する仕組みを持っています。つまり「BGMを大きくして迫力を出す」という工夫は、プラットフォーム側の処理で相殺されてしまうことがあります。一方で、ナレーションとBGMの相対的なバランス(どちらが前に出ているか)はこの自動処理の影響を受けにくいため、絶対音量よりも「ナレーションとBGMの比率」を作り込むほうが投資対効果が高いという結論になります。
さらに、雑学ショート動画は「情報密度が高いのに尺が短い」という特性を持っています。1本30秒前後の中に1〜3個の豆知識を詰め込む構成が多いため、ナレーションの1語1語が視聴者の理解に直結します。長尺の解説動画であれば多少聞き取りにくい瞬間があっても前後の文脈で補えますが、30秒のショートでは聞き逃した1文がそのまま「話についていけない」という離脱理由になりやすいのです。音量バランスの調整は装飾ではなく、情報伝達の成功率そのものを左右する工程だと捉えるべきです。加えて、無音区間やナレーションの息継ぎのタイミングでBGMの音量差が急に大きくなると、視聴者は無意識に「音が変」と感じてしまい、それだけで違和感による離脱につながることもあります。音量バランスの目的は「BGMを目立たせないこと」だけでなく「音量変化そのものを自然に感じさせること」にもある点を押さえておいてください。
dB目安の詳細版:ジャンル別・要素別の一覧
結論として、雑学ショート動画のようにテンポよく情報を詰め込むジャンルでは、BGMをやや控えめにする方向で調整するのが安全です。逆に感動系・エモ系のジャンルではBGMを一時的に前に出すシーンがあっても許容されます。
| ジャンル・シーン | ナレーション | BGM(ナレーション区間) | 補足 |
|---|---|---|---|
| 雑学・豆知識ショート | -16〜-14dB | -30〜-28dB | 情報量が多いので聞き取りやすさ最優先 |
| 都市伝説・ホラー系 | -16〜-14dB | -26〜-24dB | 緊張感を出すため少しBGMを前に |
| 感動・実話系 | -16〜-14dB | -24〜-20dB(サビ・山場のみ一時的に) | 山場だけ一時的にBGMを戻す演出あり |
| ランキング・比較系 | -16〜-14dB | -28dB前後 | テンポ重視、BGMは終始控えめ |
数値の差はわずか数dBですが、人間の聴覚は対数的に音の大きさを感じるため、2〜4dBの差でも体感の印象はかなり変わります。最初から「ジャンルごとの正解値」を暗記しようとせず、まずはナレーション基準の一覧表の数値で作ってみて、自分のチャンネルの視聴維持率グラフを見ながら微調整するのが現実的です。
また、同じジャンルの動画であっても、ナレーションの話者(AI音声の種類や話速)によって聞き取りやすさは変わります。早口で情報量の多い台本を採用しているチャンネルほど、BGMは表の目安よりさらに2〜3dB下げたほうが安全です。逆にゆっくり丁寧に話す構成であれば、表の目安どおりでも十分聞き取れることが多く、むしろBGMを気持ち上げたほうが間延び感を防げます。台本の話速とBGM音量はセットで考える、という視点を持っておくと調整の精度が上がります。
固定音量とダッキング、どちらを使うべきか
結論として、ナレーションが入るショート動画では固定音量よりもダッキング(ナレーションに合わせてBGM音量を自動で下げる処理)を使ったほうが、作業時間とクオリティの両面で有利です。
固定音量の場合、動画全体でBGMの音量を一律に下げる必要があります。この方法はシンプルですが、ナレーションが途切れる間(ま)でもBGMが控えめなままになり、メリハリが失われがちです。特に雑学ショートのようにテンポの緩急で飽きさせない構成を狙う場合、間のセクションでBGMが小さいままだと単調に感じられます。
ダッキングを使うと、ナレーションの有無を編集ソフトが(あるいは手動のキーフレームで)検知し、ナレーションがある部分だけBGMを自動的に下げ、無音部分では元の音量に戻します。これにより「聞き取りやすさ」と「BGMの存在感」を両立できます。ただしダッキングの効きを強くしすぎると、ナレーションのたびにBGMが不自然に上下して耳につくため、下げ幅は先述の-20dB前後を目安に、変化の速度(アタック・リリース)もなだらかに設定するのがコツです。
ダッキングでよくある失敗パターンは次の3つです。
- 下げ幅が大きすぎる: ナレーションが始まるたびにBGMがほぼ無音になり、曲が途切れているように聞こえる。下げ幅を-20dB前後までにとどめる。
- 変化が速すぎる: アタック(下がり始める速さ)を最速に設定すると、BGMがカクカクと上下して耳につく。0.2〜0.5秒程度のフェードを持たせる。
- 短い息継ぎにまで反応する: 感度を上げすぎると、ナレーションの一瞬の間(句読点)でもBGMが上下し、落ち着きのない音になる。感度をやや下げ、短い無音は無視する設定にする。
ツール別・音量バランスの具体的な設定手順
ここでは代表的な編集環境ごとに、実際の操作手順を紹介します。結論として、どのツールでも「①ナレーションの音量を先に固定する→②BGMをその基準に合わせて下げる→③ダッキング(自動 or 手動)で仕上げる」という順番は共通です。
CapCut(スマホ・PC)の場合
- ナレーション(録音またはAI音声)のクリップを選択し、「音量」を80〜100の範囲で調整して基準にする。
- BGMクリップを選択し、「音量」を20〜40程度まで下げる。目安のdB早見表に沿うなら、ナレーション区間はさらに下げる想定で20台前半から試す。
- BGMクリップの開始・終了にフェードイン/フェードアウトを0.5〜1秒ほど設定し、急に始まる・切れる違和感を消す。
- CapCutには専用の自動ダッキング機能は無いため、ナレーションが集中する箇所だけBGMクリップを分割し、その区間だけ音量を個別に下げる「手動ダッキング」で代用する。
Premiere Proの場合
- 「ウィンドウ」メニューから「エッセンシャルサウンド」パネルを開く。
- ナレーションのクリップをすべて選択し、パネル内の「会話」タグを適用する。
- BGMクリップを選択し、「ミュージック」タグを適用したうえで「ダッキング」にチェックを入れる。
- 「感度」「ダッキング量」「フェード時間」を調整し(ダッキング量の目安はナレーション基準から-20dB前後)、「キーフレームを生成」を押すと、ナレーションの有無に合わせてBGMの音量が自動でキーフレーム化される。
- 生成後の波形を確認し、下がり方が急すぎる場合はフェード時間を伸ばして自然にする。
ゆっくりムービーメーカー4(YMM4)の場合
- タイムライン上部の音符アイコンからBGMファイルを追加する。
- 追加したBGMアイテムを選択し、右側の設定パネルで「音量」を調整する。初期値の50%は大きすぎることが多く、全体の5〜20%程度まで下げるのが目安。
- ナレーション(VOICEVOXなどの読み上げ音声)のアイテムと重なる区間だけ、BGMアイテムを分割してさらに音量を下げる、もしくは「フェードイン・フェードアウト」を細かく刻んでゆるやかな抑揚をつける。
- 書き出し前に「プレビュー」でスマートフォンのスピーカー相当の再生環境(PCの内蔵スピーカーなど、小口径・モノラルに近い環境)でも確認する。
VOICEVOX+動画編集ソフトの構成の場合
VOICEVOXなどの音声合成ソフトは、話者やイントネーションの設定によって書き出し音量にばらつきが出やすいという特徴があります。書き出したナレーション音声をそのまま編集ソフトに読み込むと、話者が変わるたびに音量差が生じ、BGMとのバランスも毎回崩れます。対策として、VOICEVOX側で書き出した音声を編集ソフトに取り込んだ後、まずナレーショントラック全体に軽くコンプレッサー(音量の均し処理)をかけて音量のムラを抑えてから、BGMとのバランス調整に進むと手戻りが減ります。
具体的な手順は以下の通りです。
- VOICEVOXで台本を読み上げ、WAVまたはmp3で書き出す。
- 編集ソフトにナレーション音声を取り込み、波形を表示してセリフごとの音量のばらつきを目視で確認する。
- 音量差が大きいセリフがあれば、そのクリップだけ個別に音量を上げ下げして揃える(コンプレッサー機能がある編集ソフトでは、それを軽くかけてもよい)。
- 音量が揃ったナレーショントラックを基準に、前述のdB目安でBGMを配置する。
- 話者を途中で変える演出(掛け合い形式など)を使う場合は、話者ごとに書き出し音量の癖が異なることがあるため、切り替わりのたびに音量を聞き比べて微調整する。
この手順を挟むかどうかで、BGM調整のやり直し回数がかなり変わります。ナレーション側の音量が安定していないまま先にBGMを合わせてしまうと、セリフが変わるたびにBGMとのバランスも作り直すことになり、結果的に工数が増えてしまいます。
ここまでの手順、1本ぶんまるごと自動でやりますShorty はテーマを入力するだけで、台本・AI音声・字幕・BGMを揃えた雑学ショート動画を生成します。無料プランは30日5本まで。無料で作ってみるツール選びと制作フローの比較(Shortyを含む)
結論として、ナレーションとBGMの音量調整に時間をかけたくない場合、細かい波形編集をするか、あらかじめバランスが整った状態で書き出せるツールに任せるかの二択になります。
| ツール・構成 | 音量調整の自由度 | 手間 | 向いている人 |
|---|---|---|---|
| CapCut(手動ダッキング) | 中(クリップ分割で調整) | 中〜多 | 細部までこだわりたい人 |
| Premiere Pro(自動ダッキング) | 高(キーフレーム自動生成) | 中(覚えるまでがやや大変) | 本数を継続的に量産したい人 |
| YMM4+VOICEVOX | 中(手動での音量刻みが中心) | 多 | ゆっくり系フォーマットに慣れている人 |
| Shorty(当サイトが開発・運営しているツール) | 台本とBGM構成をテンプレート化し、音量バランスを作り込む工程自体を省ける | 少 | 音量調整より台本・投稿本数を優先したい副業初心者 |
Shortyは当サイト(shorty.mazenture.com)が開発・運営しているショート動画生成ツールで、細かい波形編集をせずに雑学ショート動画の構成を組み立てられます。無料プランには「1本30秒まで」「30日で5本まで」「保存7日」「ショート形式のみ」という制約があるため、尺の長い解説動画や有料級の細かいダッキング調整をしたい場合はCapCutやPremiere Proと使い分けるのが現実的です。他のツールを否定するものではなく、あくまで「音量調整に時間をかけたくない場面での選択肢の一つ」として捉えてください。
どのツールを選ぶにしても共通するのは、「音量調整に何分かけられるか」を先に決めておくことです。副業として雑学ショート動画を継続する場合、1本あたりの制作時間が積み重なるほど継続のハードルが上がります。CapCutやYMM4で毎回手動ダッキングを組む時間が取れるならそれでよく、逆に本数を優先したい時期には、あらかじめ音量バランスが調整された構成で書き出せるツールに一部の工程を任せる、という使い分けが現実的な落としどころです。
スマホ視聴・環境依存という見落とされがちな落とし穴
結論として、PCのモニタースピーカーやイヤホンで作り込んだ「ちょうど良いバランス」は、スマホの内蔵スピーカーで再生すると印象がかなり変わります。ここは多くの解説記事が触れていない、実制作上の重要な落とし穴です。
スマホの内蔵スピーカーは口径が小さくモノラルに近い出力のため、低域と高域の一部が削れて聞こえます。BGMに低音の効いた曲を使っている場合、PC上では「BGMは控えめで聞き取りやすい」と感じても、スマホでは高域寄りのナレーション音声だけが相対的に浮いて聞こえたり、逆に曲によっては中域が潰れてナレーションが埋もれて聞こえたりすることがあります。つまり「-20dBルールを守れば安全」という一般論は、視聴環境まで含めて考えると必ずしも正しくありません。ショート動画の主戦場はスマホ視聴である以上、書き出し前に必ずスマホの内蔵スピーカー(イヤホンではなく)で最終確認する工程を、チェックリストの中に組み込む必要があります。
もう一点、独自の視点として付け加えると、同じ「BGM音量20%」という設定値でも、使用する曲のジャンルによって体感の音量はまったく異なります。ローファイ系やピアノのみのBGMは音の密度が低く多少音量を上げても邪魔になりにくい一方、EDM系や打ち込み主体のBGMは中域から高域まで音が詰まっているため、同じdB設定でもナレーションと喧嘩しやすくなります。数値目安はあくまで出発点であり、曲を変えるたびに耳で微調整し直す前提を持っておくべきです。
環境依存の観点でもう一つ見落とされがちなのが、視聴時のイヤホン・骨伝導イヤホン・スピーカーの違いです。骨伝導イヤホンは低域の再現が弱く、有線のカナル型イヤホンは逆に低域が強調されやすい傾向があります。同じ動画でも視聴デバイスによって「BGMが大きく感じる」「小さく感じる」の印象が変わるため、すべての環境で完璧なバランスを作ることは原理的にできません。だからこそ、最も視聴者数の多い環境(スマホの内蔵スピーカー、次点でワイヤレスイヤホン)を基準に確認し、それ以外の環境での多少のズレは許容する、という割り切りが必要です。「環境依存で最適値は変わる」という前提を持たずに一つの再生環境だけで完成としてしまうと、別の環境で聞いた視聴者から「音がおかしい」という評価を受けるリスクが残ります。
投稿前セルフチェックリスト
結論として、投稿前に以下の項目を一つずつ確認するだけで、音量バランスに起因する離脱リスクの大部分は防げます。
- [ ] ナレーションの音量を先に固定し、それを基準にBGMを調整したか
- [ ] ナレーションが流れている区間で、BGMは体感「聞こえるけど言葉の邪魔をしない」レベルまで下がっているか
- [ ] ナレーションが途切れる間(オープニング・アウトロ・間)で、BGMが単調に小さいままになっていないか
- [ ] 効果音を入れている場合、ナレーション・BGM・SEの3者が同時に鳴る瞬間に音が飽和していないか
- [ ] スマホの内蔵スピーカーで最終確認したか(イヤホンだけで判断していないか)
- [ ] 複数のBGMを切り替える構成の場合、曲ごとの音量差を統一したか
- [ ] 書き出し後の動画をプラットフォームの標準音量(100%)で再生し、極端に大きい・小さいと感じないか
- [ ] VOICEVOXなど合成音声を使っている場合、話者やセリフごとの音量ムラを均したか
- [ ] BGMのジャンルを変えた場合、以前の動画と同じ音量設定のまま使い回していないか(曲ごとに再確認したか)
- [ ] ダッキングの下げ幅・変化速度が急すぎて、BGMが不自然に上下していないか
よくある質問
Q1. ナレーションとBGMの音量、結局何dB下げればいいですか? A. 目安はナレーションを基準にして、BGMをナレーション区間で20dB前後下げることです。編集ソフトの音量メーターの種類によって表示が変わるため、まずはこの数値で仮組みし、実際に聞いて微調整してください。
Q2. dBメーターがなく音量スライダー(0〜100やパーセント)しかない編集ソフトでも目安に合わせられますか? A. 合わせられます。スライダー式のソフトでは、ナレーションを80〜100、BGMを20〜40の範囲に置き、ナレーションが流れる区間だけBGMをさらに10〜20下げる、という相対比率で考えると近い結果になります。数値そのものより「ナレーションとBGMの比率」を意識してください。
Q3. 編集画面では聞きやすいのに、スマホで再生すると声が埋もれます。なぜですか? A. スマホの内蔵スピーカーは小口径・モノラルに近く、低域や高域が削れて聞こえるためです。PCのスピーカーやイヤホンだけで判断せず、書き出し後に必ずスマホの内蔵スピーカーで確認してください。
Q4. 効果音(SE)も入れる場合、ナレーション・BGM・SEの3つのバランスはどう組めばいいですか? A. ナレーションを最優先、次にSE、最後にBGMという優先順位で音量を下げていくのが基本です。目安はナレーション-16〜-14dB、SE-20〜-18dB、BGM-30〜-28dB(ナレーション区間)です。SEを目立たせすぎるとナレーションと喧嘩するため、強調したい一瞬だけ使うのがコツです。
Q5. ダッキングを使わず、固定音量だけでバランスを取ることは可能ですか? A. 可能ですが、間(ま)のセクションでBGMが単調なままになりやすく、メリハリが失われがちです。本数を量産する場合は、手動でもよいのでナレーション区間だけBGMを下げる簡易ダッキングを取り入れると、視聴維持率の改善につながりやすくなります。
Q6. 同じ音量設定なのに、BGMの曲によって聞こえ方がまったく違います。なぜですか? A. 曲によって音の周波数帯域が異なるためです。ピアノやローファイ系は音の密度が低く邪魔になりにくい一方、EDMや打ち込み系は中高域が詰まっており、同じ音量設定でもナレーションと帯域が被って聞き取りにくくなります。曲を変えたら必ず耳で再確認してください。
Q7. VOICEVOXなどの合成音声は、生声のナレーションと同じ音量基準で扱っていいですか? A. 基本の目安(-16〜-14dB前後)は同じで問題ありませんが、合成音声は話者やイントネーション設定によって書き出し音量にムラが出やすい特徴があります。BGMと合わせる前に、ナレーショントラック全体の音量ムラを軽く均してから調整すると失敗が減ります。
Q8. 字幕をつけているので、音量バランスは多少雑でも視聴には影響しませんか? A. 影響します。字幕は無音状態や外出先でのながら視聴を補う手段であって、音声を聞いている大多数の視聴者にとって聞き取りにくい音量バランスはそのまま離脱要因になります。字幕の有無にかかわらず音量調整は省略しないでください。
Q9. 動画内で複数のBGMを切り替える場合、音量はどう統一すればいいですか? A. 曲ごとに元の収録音量が異なるため、切り替え箇所ごとに耳で聞き比べて音量を揃える必要があります。ナレーション基準からの下げ幅(-20dB前後)を各BGMで統一する意識を持つと、曲が変わっても違和感が出にくくなります。
Q10. YouTubeなどのラウドネスノーマライズで、自分が調整した音量バランスが崩れることはありますか? A. プラットフォームが調整するのは動画全体の音量(ラウドネス値)であり、ナレーションとBGMの相対的なバランスまでは変更されません。したがって「全体音量を上げてBGMを目立たせる」という工夫は自動処理で相殺されやすい一方、ナレーションとBGMの比率を作り込む工夫は効果が残りやすいと言えます。
Q11. BGMの音量を毎回イチから調整するのが面倒です。テンプレート化はできますか? A. できます。編集ソフトによっては音量設定をプリセットやトラックテンプレートとして保存できるため、一度自分のチャンネルに合ったナレーション・BGM・SEの音量比率を決めたら、そのままテンプレート化して使い回すと調整時間を大幅に削減できます。ただし曲のジャンルが大きく変わった場合は、テンプレートのまま使わずに聞き比べる工程を挟んでください。
関連して、VOICEVOXの使い方2026(スマホでの手順つき)も同じ制作ラインの話なので、まとめて押さえておくと手戻りが減ります。
まとめ
ナレーションとBGMの音量バランスは、ナレーションを-16〜-14dB前後に固定し、BGMをナレーション区間で20dB前後下げる、という目安から始めるのが実用的です。ただしこれはあくまで出発点であり、編集ソフトのメーター方式・BGMのジャンル・視聴環境(特にスマホの内蔵スピーカー)によって最適値は変わります。固定音量よりもダッキングを取り入れたほうがメリハリが出やすく、CapCut・Premiere Pro・YMM4のいずれでも手動または自動でダッキングに相当する処理は可能です。台本作成の段階から音量設計を意識したい場合は雑学ショートのプロンプト例を参考に間(ま)の位置を先に決めておくと、後工程のダッキング調整がしやすくなります。BGMの調達元に迷ったらYouTubeオーディオライブラリの使い方、音量調整以外の制作フロー全体を見直したい場合は雑学動画の作り方もあわせて確認してください。最後は必ずスマホの内蔵スピーカーで聞き直す一手間が、視聴維持率を左右する最後の分かれ目になります。数値目安を暗記することよりも、「ナレーション基準で考える」「環境依存を前提に確認工程を挟む」という2つの考え方を持ち帰っていただければ、次に使う曲やナレーションが変わっても応用が効くはずです。