AviUtlで字幕を入れる方法は、①テキストオブジェクトで1枚ずつ手入力する → ②エイリアスやPSDToolKitで「型」と「配置」を半自動化する → ③Whisperなどの文字起こしでsrtを作って一括で取り込む、の3段階に分かれます。どれか1つが正解というより、動画の作り方によって最適な段階が変わります。
先に独自視点をひとつ書いておくと、ずんだもん・ゆっくり・VOICEVOXのように「台本が先にある動画」なら、音声認識による自動文字起こしはそもそも不要です。台本テキストをそのまま字幕に流し込むほうが速く、誤字もゼロにできます。自動文字起こしが本当に効くのは、地声の実況や収録済みのトーク素材のように「台本が存在しない音声」だけです。この記事では、この線引きを軸に、基本の入れ方から自動化までを順番に解説し、最後に自動文字起こしの精度が落ちる条件も正直に書きます。
※本記事は2026年9月23日時点の情報です。AviUtl 1.10+拡張編集0.92(以下「旧AviUtl」)を基本に、AviUtl2(AviUtl ExEdit2)での違いも補足します。
結論:AviUtlの字幕は「手打ち→テンプレ化→自動化」の3段階で選ぶ
結論として、10本未満の練習段階なら手打ち、毎週投稿するならエイリアス+PSDToolKit、台本のない実況・トーク動画ならWhisperでsrtを作って取り込む、が現実的な使い分けです。 いきなり自動化から入ると、プラグイン導入やsrt変換でつまずいたときに原因を切り分けられないため、手打ちで1本作ってから段階を上げるのが遠回りに見えて一番早い道です。
| 段階 | 方法 | 向いている動画 | 手間 | 誤字リスク | 導入難度 |
|---|---|---|---|---|---|
| ①基本 | テキストオブジェクトに手入力 | 短いショート、練習用 | 大(1行ずつ入力・配置) | 入力ミスのみ | 低(標準機能) |
| ②効率化 | エイリアス保存+PSDToolKitで自動配置 | ずんだもん・ゆっくり・VOICEVOX系 | 中(台本txtと音声を用意) | 台本の誤字のみ | 中(プラグイン導入) |
| ③自動化 | Whisper等で文字起こし→srt→AviUtlに取り込み | 地声実況、対談、収録済み素材 | 小〜中(修正作業が残る) | 認識誤り・幻聴テキスト | 中〜高(外部ツール連携) |
表の「誤字リスク」の列が重要です。①と②は人間が書いた文字がそのまま出るので、誤りは台本の誤字だけです。③は音声認識の誤りに加え、後述するように音声に存在しない文章が出力される「ハルシネーション」という固有のリスクがあります。自動化は「手間がゼロになる」のではなく、「入力の手間が確認・修正の手間に置き換わる」と考えてください。
動画全体の制作工程を先に押さえたい方は、ずんだもん動画の作り方で台本から投稿までの流れを確認してから戻ってくると、字幕工程の位置づけがつかみやすくなります。
基本:テキストオブジェクトで字幕を入れる手順
結論:旧AviUtlでは、タイムラインを右クリック→「メディアオブジェクトの追加」→「テキスト」で字幕の箱を作り、設定ダイアログ下部の入力欄に文字を打つのが基本です。 どの自動化手段も、最終的にはこの「テキストオブジェクト」を大量に並べているだけなので、仕組みを一度手で理解しておく価値があります。
旧AviUtl(1.10+拡張編集0.92)での手順
- 動画・音声をタイムラインに配置し、字幕を出したい位置に再生ヘッド(赤い縦線)を合わせる
- 映像や音声が入っていない空きレイヤーを右クリック→「メディアオブジェクトの追加」→「テキスト」を選ぶ
- 設定ダイアログ下部の入力欄に字幕の文字を入力する(改行もそのまま反映される)
- フォント・サイズ・文字色・装飾(縁取り文字や影付き文字)を設定する
- X・Y座標で表示位置を決める(ショートなら画面の中央〜やや下が目安)
- タイムライン上のオブジェクトの右端をドラッグして、セリフの長さに合わせて表示時間を調整する
- 次のセリフ用に、オブジェクトをCtrl+C/Ctrl+Vで複製し、文字だけ書き換える
手順7の「複製して文字だけ書き換える」が、手打ちの段階で最も効く時短です。毎回新規にテキストを追加すると、フォントや縁取りの設定を毎回やり直すことになり、途中で設定がズレて字幕の見た目がバラつきます。
知っておくと便利なテキストの設定項目
テキストオブジェクトの設定ダイアログには、字幕作りに直結する項目がいくつかあります。
- 表示速度:0以外にすると1文字ずつタイプライター風に表示される。0なら一括表示
- 文字毎に個別オブジェクト:1文字ずつに分解してアニメーションをかけられる(登場演出向け)
- 自動スクロール:チェックすると1行なら横、複数行なら縦に文字が流れる。エンドロール風の演出に使える
- 配置:左寄せ・中央揃えなど。字幕は「中央揃え[中]」にしておくと、文字数が変わっても中心がブレない
- 字間・行間:2行字幕の詰まりを調整する
また、テキスト入力欄では制御文字を使って一部だけ色やサイズを変えられます。たとえば <#ff0000> 以降を赤色にする、<s60> 以降のサイズを変える、といった指定です。強調したい単語だけ色を変えたいときに、オブジェクトを分割せずに済みます。
AviUtl2(AviUtl ExEdit2)での違い
AviUtl2は、旧AviUtlと拡張編集を1本に統合した64bit版の後継ソフトです。公開情報(Wikipediaの「AviUtl ExEdit2」項目)では、2025年7月7日にβ版として公開され、2026年7月7日のバージョン2.0.54でβ表記が外れて正式版扱いになり、2026年9月19日時点の最新はバージョン2.1.10とされています。テキストを「オブジェクトとして置き、文字を入力して、見た目を整える」という基本の考え方は同じですが、メニューの位置や設定画面のレイアウトは異なります。
注意点は、旧AviUtl向けのプラグインやスクリプトはAviUtl2でそのまま動くとは限らないことです。後半で紹介するPSDToolKitや自動文字起こしプラグインも、旧AviUtl版とAviUtl2版が別物として配布されています。解説記事を読むときは、どちらのAviUtlを前提にしているかを必ず確認してください。
見やすい字幕の最低限の設定(背景・縁取り・アニメーション)
結論:字幕の見やすさは「縁取り」「背景帯」「表示位置」の3点でほぼ決まり、凝ったアニメーションは後回しで構いません。 サジェストには「おしゃれ」「アニメーション」も並びますが、視聴者が最初に不満を持つのは「背景に溶けて読めない字幕」です。
縁取りと二重縁取り
テキストの「装飾」を「縁取り文字」にすると、文字の外側に縁色の線が付きます。さらに「フィルタ効果の追加」から「縁取り」を重ねると、外側にもう一段の縁が付き、いわゆる二重縁取りになります。背景が明るい場面と暗い場面が混在する動画では、白文字+黒縁の一段より、二重縁取りのほうが場面を選ばず読みやすくなります。
縁取りが太くならない、表示されない、文字が潰れるといったトラブルは原因が複数あるため、この記事では深追いしません。症状別の対処はAviUtlで縁取りができないときの原因と対処にまとめています。
背景帯(座布団)を敷く
縁取りでも読みにくい映像(細かい模様や白っぽい画面)では、字幕の下に半透明の帯を敷くのが確実です。
- 字幕レイヤーより小さい番号のレイヤーに「図形」オブジェクトを追加する
- 図形の種類を「四角形」にし、縦横比やサイズで横長の帯にする
- 色を黒、透明度を40〜60程度にする
- 字幕のテキストと同じ長さにタイムラインで揃える
拡張編集はレイヤー番号が大きいほど手前に描画されるため、背景帯は字幕より小さい番号のレイヤーに置きます。逆にすると帯が文字を覆い隠します。帯と字幕を毎回セットで置くのが面倒な場合は、後述する「オブジェクトファイル」で2つまとめて保存しておくと再利用できます。
アニメーションは「登場」だけに絞る
テキストには「アニメーション効果」フィルタで、画面外から登場・弾んで登場・拡大縮小して登場などの動きを付けられます。ただし、セリフ字幕すべてに動きを付けると、文字が止まるまで読めない時間が生まれ、かえって可読性が落ちます。動きを付けるのは、タイトルや強調テロップなど「1本の動画で数回だけ出るもの」に限定するのがおすすめです。
フォント選びや配色、テロップの「おしゃれ」なデザインの考え方はツールに依存しない話なので、ショート動画のテロップデザインとフォントの選び方で別途解説しています。この記事ではAviUtl上の操作に集中します。
効率化①:エイリアスとオブジェクトファイルで字幕の設定を使い回す
結論:一度作った字幕の見た目は「エイリアス(.exa)」として保存しておけば、次からはメニューから呼び出すだけで同じ設定の字幕が置けます。 字幕の作業時間の多くは「フォント・サイズ・縁取り・位置を毎回合わせる」ことに消えているため、ここを型にするだけで体感の手間は大きく減ります。
設定を保存する3つの方法
旧AviUtlには、オブジェクトの設定を保存する仕組みが3種類あります。
| 方法 | 保存される範囲 | 拡張子 | 字幕での使いどころ |
|---|---|---|---|
| 初期値 | そのオブジェクト種類のデフォルト設定 | なし(内部設定) | 新規テキストを常に同じフォントで始めたい |
| エイリアス | 1つのオブジェクトの設定一式(フィルタ含む) | .exa | 話者ごとの字幕スタイル(色違い)を用意する |
| オブジェクトファイル | 複数オブジェクトの配置・長さ込み | .exo | 字幕+背景帯のセット、定型のオープニング |
エイリアスの作り方と呼び出し方
- 見た目を完成させた字幕テキストを1つ用意する(フォント・縁取り・位置・フィルタまで)
- そのオブジェクトの設定ダイアログで右クリック→「設定の保存」→「現在の設定でエイリアスを作成する」
- 名前と格納フォルダ名を付けて保存する(例:フォルダ「字幕」、名前「ずんだもん_緑縁」)
- 次からはタイムラインを右クリック→「メディアオブジェクトの追加」から、保存したフォルダ内のエイリアスを選ぶ
ずんだもんと四国めたん、霊夢と魔理沙のように話者が2人いる動画なら、話者ごとに縁取り色だけ変えたエイリアスを2つ作っておくと、字幕の色で話者を区別でき、視聴者が誰のセリフかを一瞬で判断できます。
オブジェクトファイル(.exo)で字幕+背景帯をまとめる
複数のオブジェクトを選択した状態でタイムラインを右クリック→「ファイル」→「オブジェクトファイルのエクスポート」を選ぶと、配置と長さを含めて.exoとして保存できます。使うときは.exoをタイムラインにドラッグ&ドロップするだけです。
.exoはテキスト形式のファイルなので、後述する「srtから.exoを作る」自動化とも相性が良い形式です。ただし、.exoは作成時の環境(解像度やフレームレート、ファイルのパス)に依存する部分があり、別プロジェクトで読み込もうとしてエラーになることがあります。その場合はAviUtlでexoが読み込めないときの原因と対処を参照してください。
効率化②:PSDToolKitで音声とテキストから字幕を自動配置する
結論:PSDToolKitを入れると、音声ファイル(.wav)と同名のテキストファイル(.txt)をShiftキーを押しながらドラッグ&ドロップするだけで、音声の長さに合った字幕が自動で配置されます。 台本がある合成音声動画では、これが実質的な「字幕の自動化」です。
仕組み
PSDToolKitは、PSDファイルの立ち絵を扱うためのAviUtl用プラグインですが、口パクと字幕を自動で準備する機能も持っています。公式チュートリアルによると、流れは次のとおりです。
- AviUtlのメニュー「編集」→「PSDToolKit」→「環境設定」を開き、「口パク準備を生成」「字幕準備を生成」にチェックを入れる
- 音声ファイル(例:
001_ずんだもん.wav)と、同じ名前のテキストファイル(001_ずんだもん.txt)を用意する - Shiftキーを押しながら.wavをタイムラインにドラッグ&ドロップする
- 音声と一緒に「字幕準備」オブジェクトが音声と同じ長さで生成され、.txtの中身が自動で書き込まれる
- 「字幕表示@PSDToolKit」を置くと、字幕準備の内容が通常のテキストオブジェクトと同じように表示される
字幕表示は基本的に通常のテキストオブジェクトなので、前の章で作ったエイリアスの見た目(縁取り・位置)をそのまま適用できます。つまり「見た目はエイリアス、中身と長さはPSDToolKit」という分業にすると、1セリフあたりの作業がドラッグ1回で済みます。
台本→音声→txtの用意を楽にする
VOICEVOXなどの音声合成ソフトは、音声の書き出し時に同名のテキストファイルも一緒に書き出す設定を持っているものがあります。これを有効にしておけば、台本を打ち込んだ時点で字幕の中身も確定するため、字幕を別途入力する工程がなくなります。VOICEVOX側の基本操作はVOICEVOXの使い方で解説しています。
さらにPSDToolKitには「かんしくん」という補助ツールがあり、指定したフォルダを監視して、新しく書き出された.wavと.txtを自動で拡張編集のタイムラインに投入できます。音声を書き出すたびに手でドラッグする手間も省けます。
独自視点:台本がある動画で「音声認識」を使うのは遠回り
ここがこの記事で一番伝えたいポイントです。ネット上の「AviUtl 字幕 自動」の解説では、音声認識による自動文字起こしが自動化の代表として紹介されがちです。しかし、合成音声の動画は「文字(台本)→音声」の順に作っているため、字幕に必要な正解テキストは最初から手元にあります。それを一度音声にしてから、また音声認識で文字に戻すのは、正解を持っているのに推測させている状態です。
音声認識を経由すると、固有名詞の誤変換や句読点の位置ズレといった修正作業が新たに発生します。一方、PSDToolKit方式なら字幕の中身は台本と完全に一致し、タイミングも音声ファイルの長さで決まるため、ズレる余地がほとんどありません。「自動文字起こし=最先端の自動化」ではなく、「台本が存在しない音声のための手段」と位置づけるのが正確です。
ゆっくり音声(AquesTalk系)で同じ流れを組む場合の音声の入れ方は、AviUtlでゆっくり音声を入れる方法で手順を分けて解説しています。
PSDToolKitの注意点
- 旧AviUtl版(oov氏のPSDToolKit)とAviUtl2版(PSDToolKit for AviUtl ExEdit2)は別配布。導入先のAviUtlに合う版を選ぶ
- .wavと.txtのファイル名が1文字でも違うと、テキストが字幕準備に書き込まれない
- .txtの文字コードが想定と異なると文字化けすることがある。文字化けした場合は、音声合成ソフトの書き出し設定やPSDToolKitの環境設定で文字コードを確認する
- 長いセリフは字幕が画面からはみ出す。台本の段階で1セリフを短く区切るのが根本対策
自動化:Whisper等で文字起こし→srt→AviUtlに取り込む
結論:台本のない音声に字幕を付けるなら、①AviUtl内でWhisperを動かすプラグインを使う、②外部ツールでsrtを作り、変換ツールで.exoにしてAviUtlに読み込む、の2ルートがあります。 どちらも最後に「目で見て直す」工程は省けません。
ルートA:AviUtlの中で文字起こしするプラグイン
- 旧AviUtl:Subtitler 拡張編集0.92を前提に、プロジェクト上の音声からWhisperで直接文字起こしできるプラグインです。ニコニコ動画・ニコニ・コモンズで作者による紹介と配布が行われています。
- AviUtl2:WhisperAutoSub(Whisper Subtitle) GitHubで公開されているAviUtl2向けプラグインで、「表示」メニューからウィンドウを開き、「生成」タブで使用するBackendとModelを選んで「字幕生成」を押す流れです。
AviUtlの中で完結するため、srtの変換や読み込みの手間がないのが利点です。一方で、Whisperのモデルを動かす処理は重く、PCのスペック(特にGPUの有無)によっては長い時間がかかったり、AviUtl自体の動作が不安定になったりします。編集中のプロジェクトで試す前に、短い音声で動作確認するのが安全です。AviUtlが重くなったときの切り分けはAviUtlが重いときの対処法を参照してください。
ルートB:外部でsrtを作ってAviUtlに取り込む
AviUtlの外で文字起こしを済ませ、字幕ファイル(.srt)経由で取り込む方法です。AviUtl本体の負荷と切り離せるため、プラグインが動かない環境でも使えます。
- 文字起こし用の音声を用意する(BGMを入れる前の声だけの録音ファイルが理想)
- Whisper(ローカルで動かすもの)や、Vrewなどの文字起こし機能のあるソフトで音声を文字起こしし、.srt形式で書き出す
- .srtをテキストエディタで開き、明らかな誤変換・固有名詞・不要な繰り返しを先に直す
- SRT2EXO .NETやsrt2exo(exo2srt_srt2exo)などの変換ツールで、.srtを拡張編集用の.exoに変換する
- 生成された.exoをAviUtlのタイムラインにドラッグ&ドロップする
- 並んだテキストオブジェクトの見た目(フォント・縁取り・位置)を整える
.srtは「番号」「開始時刻 --> 終了時刻」「字幕テキスト」を1ブロックとして並べただけのテキストファイルなので、手順3の修正はメモ帳でも可能です。AviUtlに取り込んでから1つずつ直すより、srtの段階でまとめて直すほうが圧倒的に速いので、修正は必ず取り込み前に済ませてください。
取り込み後に見た目を揃えるコツ
変換ツールで取り込んだ字幕は、装飾のないシンプルなテキストオブジェクトとして並びます。数十〜数百個を1つずつ装飾し直すのは現実的ではないため、次のどれかで対処します。
- 変換ツール側の設定で、出力する.exoのサイズや位置を指定する(srt2exoは設定を変更して字幕のサイズや位置を変えられることが利用者の解説で紹介されている)
- 字幕の装飾を「字幕レイヤー全体」にかける:字幕を並べたレイヤーより上(小さい番号)に「グループ制御」を置き、その対象レイヤー範囲のオブジェクトにまとめてフィルタ(縁取りなど)を適用する
- .exoをテキストエディタで一括置換する:フォント名や文字サイズの行を置換してから読み込む。作業前に必ず元ファイルを複製しておく
独自視点:Whisperには「用語のヒント」を渡してから回す
ローカル版のWhisperには、文字起こしの前に文脈となるテキスト(initial prompt)を渡せる仕組みがあります。チャンネル名、よく出る固有名詞、ゲームのキャラクター名などを並べて渡すと、その表記に寄せて出力されやすくなります。誤変換の多くは固有名詞に集中するため、毎回同じ単語を直しているなら、直す前にヒントとして渡すほうが修正時間の削減になります。ただし、効果の大きさは音声や単語によって変わり、必ず正しく出力される保証はありません。
自動文字起こしの精度が落ちる条件(正直に書きます)
結論:自動文字起こしは「クリアな1人の声・静かな環境・一般的な単語」では実用的ですが、BGMとの重なり、長い無音、固有名詞、複数人の同時発話といった条件で精度が落ち、音声にない文章が出力されることもあります。 公開情報で、YouTube動画のような条件を揃えた「日本語の正答率○%」という数値は確認できないため、ここでは数値ではなく条件で説明します。
出典のある事実
- Whisperは、OpenAIの論文「Robust Speech Recognition via Large-Scale Weak Supervision」(2022年)で、約68万時間の多言語・弱教師ありデータで学習したと説明されています。雑音や話し方の違いに比較的強いとされる背景には、この学習データの規模があります。
- 一方、米コーネル大学のAllison Koenecke氏らの論文「Careless Whisper: Speech-to-Text Hallucination Harms」(ACM FAccT 2024)は、WhisperのAPIで文字起こしした音声の約1%に、元の音声に存在しない語句や文章が丸ごと含まれていたと報告しています。同じ音声でも実行ごとに異なる架空の文が出る(非決定的)ことも指摘されています。なお、この研究は英語音声(失語症の話者を含むデータ)を対象としたもので、日本語のYouTube動画にそのまま当てはまる数値ではありません。
「1%なら少ない」と感じるかもしれませんが、字幕を何百行も起こす長尺動画なら、どこかに架空の文が紛れ込む可能性を想定しておくべき、ということです。しかもハルシネーションは文法的に自然な文として出てくるため、流し読みでは気づきにくいのが厄介な点です。
精度が落ちやすい条件チェックリスト
自動文字起こしにかける前に、次の項目に当てはまるかを確認してください。当てはまる数が多いほど、修正作業が増えると考えるのが安全です。
- [ ] BGMや効果音が声と重なっている:BGM入りの完成動画から文字起こしすると、声以外の音が認識を妨げる。可能ならBGMを入れる前の声だけの音声で文字起こしする
- [ ] 長い無音区間がある:無音部分で、存在しない文や同じフレーズの繰り返しが出力される現象が報告されている。無音をカットしてから、または音声区間検出(VAD)を併用するツールで処理する
- [ ] 固有名詞・新しい用語・専門用語が多い:ゲームのキャラ名、新製品名、ネットスラングは誤変換されやすい
- [ ] 同音異義語が多い話題:日本語は単語の区切りがなく同音異義語も多いため、「かいとう(回答/解答/解凍)」のような語は文脈次第で外れる
- [ ] 複数人が同時に話す・被せ気味の会話:実況の掛け合いや対談では、誰の発言かの区別もできず、文が混ざる
- [ ] 早口・語尾が崩れる話し方・言い淀みが多い:「えー」「あの」などのフィラーを拾いすぎたり、逆に必要な語まで落としたりする
- [ ] マイクが遠い・反響が大きい・音量が小さい:収録品質の低さは、どのモデルでも補いきれない
- [ ] 小さいモデルを使っている:Whisperは複数サイズのモデルがあり、軽いモデルほど速い代わりに誤りが増える傾向がある
うまくいかないときの現実的な判断
条件の多くに当てはまる素材では、自動文字起こしで作った字幕を直すより、最初から手で打つほうが速いこともあります。特に、1分未満のショートでセリフが10行程度なら、手打ち+エイリアスで十分間に合います。自動化の損益分岐は「字幕の行数」と「修正率」で決まるので、1本目は必ず所要時間を計って比較してください。
また、自動文字起こしの結果をそのまま公開するのはおすすめしません。誤字の多い字幕は、動画の内容以前に「雑に作られた動画」という印象を与えます。最低限、固有名詞と数字だけは音声を聞き直して確認する、というルールを決めておくと、修正にかける時間を抑えつつ致命的な誤りは防げます。
なお、スマホ編集アプリの自動字幕の精度についてはCapCut自動字幕の精度と直し方でも整理しています。音声認識の弱点はツールが違っても共通する部分が多いので、併せて読むと判断材料が増えます。
動画タイプ別:どの方法で字幕を入れるべきか
結論:台本がある動画はPSDToolKit、台本がない動画はWhisper+srt、本数が少ないうちは手打ち+エイリアス、が基本の選び方です。 動画のジャンルごとに整理すると次のようになります。
| 動画タイプ | 台本の有無 | おすすめの字幕方法 | 理由 |
|---|---|---|---|
| ずんだもん・VOICEVOX解説 | あり | PSDToolKit(wav+txt) | 台本=字幕の正解。誤字ゼロで配置も自動 |
| ゆっくり解説 | あり | PSDToolKit、またはYMM4など専用ソフト | 同上。専用ソフトなら字幕が標準で連動 |
| 雑学ショート | あり | 手打ち+エイリアス、またはPSDToolKit | 行数が少なく、強調テロップの比重が大きい |
| 地声のゲーム実況 | なし | Whisper→srt→.exo | 入力の手間が大きく、自動化の効果が最大 |
| 対談・インタビュー | なし | Whisper→srt(修正前提) | 被り発話が多く修正は多めに見積もる |
雑学系のショートは、セリフ字幕よりも「強調テロップ」の出来が見やすさを左右しやすいジャンルです。台本づくりから構成までは雑学動画の作り方で解説しているので、字幕の方式を決める前に動画全体の型を確認しておくと手戻りが減ります。
AviUtl以外の選択肢も比較しておく
「字幕を自動化したい」という目的だけなら、AviUtl以外の選択肢もあります。どれが最良というより、制作スタイルとの相性で選ぶものです。
- AviUtl(本記事の方法):無料で細かく作り込める。プラグイン導入と設定の手間がかかる
- YMM4(ゆっくりMovieMaker4):ゆっくり・VOICEVOX系のセリフと字幕が標準で連動し、PSDToolKit相当の作業が最初から組み込まれている
- CapCutなどの編集アプリ:自動字幕機能が内蔵され、スマホでも完結する。細かい制御はAviUtlより限定的
- Shorty(当サイトが開発・運営している自社ツール):台本からショート動画の生成までをまとめて行うWebツール。字幕を1行ずつ配置する作業を省きたい場合の選択肢の1つです。無料プランには、1本30秒まで・30日で5本まで・生成した動画の保存は7日間・ショート形式のみ、という制約があります。細かなデザイン調整や長尺動画はAviUtlのほうが向いています。気になる方はShortyから試せます
ショート動画として書き出す場合は、字幕の位置が画面のUI(チャンネル名や説明文)に重ならないよう、縦長の解像度と出力設定を先に固めておく必要があります。設定手順はAviUtlでショート動画のサイズと出力設定をする方法を参照してください。
よくある質問
AviUtlで字幕を自動で入れることはできますか?
できます。台本がある動画はPSDToolKitでwavとtxtから自動配置、台本がない動画はWhisper等で文字起こししてsrt経由で取り込む方法が使えます。
どちらの場合も、字幕の見た目(フォントや縁取り)はエイリアスなどで事前に型を作っておくと、自動で並んだ字幕を後から整える手間が減ります。完全に手を離せるわけではなく、最終確認の工程は残ります。
AviUtlでsrtファイルを直接読み込めますか?
旧AviUtlの拡張編集には、srtを字幕として直接読み込む標準機能はありません。SRT2EXO .NETなどでsrtを.exoに変換してから読み込むのが一般的です。
変換した.exoはタイムラインにドラッグ&ドロップするだけで、字幕ごとのテキストオブジェクトとして並びます。装飾のない状態で並ぶため、見た目は取り込み後に整えます。
字幕のフォントや縁取りを毎回設定せずに済む方法はありますか?
完成した字幕の設定ダイアログで右クリック→「設定の保存」→「現在の設定でエイリアスを作成する」で保存すれば、次から呼び出すだけで同じ見た目になります。
話者ごとに色違いのエイリアスを用意したり、背景帯とセットでオブジェクトファイル(.exo)にしたりすると、さらに作業が短くなります。
PSDToolKitで字幕準備は出るのに文字が表示されないのはなぜですか?
多くの場合、.wavと.txtのファイル名が一致していないか、「字幕表示」オブジェクトが置かれていないことが原因です。まず両ファイル名を確認してください。
名前が合っていても表示されない場合は、.txtの文字コードや、字幕表示オブジェクトの配置を確認します。PSDToolKitの環境設定で「字幕準備を生成」にチェックが入っているかも見直してください。
Whisperの文字起こしはそのまま字幕に使えますか?
そのままの公開はおすすめしません。英語音声の研究で約1%に存在しない文が混入したと報告されており、固有名詞と数字は必ず聞き直して確認すべきです。
特にBGM入りの音声や無音区間が長い音声、固有名詞が多い話題では誤りが増えやすくなります。修正はAviUtlに取り込む前に、srtの段階でまとめて行うと速く済みます。
AviUtl2でも同じ方法で字幕を入れられますか?
テキストを置いて入力するという基本は同じですが、旧AviUtl向けのプラグインはそのまま使えない場合があります。PSDToolKitや自動字幕もAviUtl2版を選びます。
AviUtl2向けには、PSDToolKit for AviUtl ExEdit2や、Whisperで字幕を生成するプラグインが別途公開されています。解説記事を参考にする際は、対象バージョンを必ず確認してください。
字幕をアニメーションで表示させるにはどうすればいいですか?
テキストに「アニメーション効果」フィルタを追加し、「画面外から登場」などを選びます。1文字ずつ出したい場合は「表示速度」を0以外に設定します。
ただし、セリフ字幕すべてに動きを付けると読めない時間が生まれます。動きはタイトルや強調テロップなど、要所だけに絞るのが見やすさの面で無難です。
字幕に背景(帯)を付けるにはどうしますか?
図形オブジェクトで四角形を作り、黒・半透明にして字幕より小さい番号のレイヤーに置きます。拡張編集はレイヤー番号が大きいほど手前に描画されます。
背景帯と字幕を毎回セットで置くなら、2つを選択してオブジェクトファイル(.exo)としてエクスポートしておくと、次からはドラッグ&ドロップで再利用できます。
自動文字起こしと手打ち、どちらが早いですか?
字幕が10行程度の短いショートなら手打ち+エイリアスで十分速いことが多く、数百行の長い実況なら自動文字起こし+修正が有利になりやすいです。
損益分岐は字幕の行数と修正率で変わります。1本目は両方の所要時間を計って比較し、自分の素材に合う方を選ぶのが確実です。
まとめ
AviUtlの字幕は、次の3段階で考えると迷いません。
- 基本:テキストオブジェクトを追加して入力する。複製して文字だけ書き換えるのが手打ちの時短
- 効率化:見た目はエイリアス(.exa)とオブジェクトファイル(.exo)で型にし、台本がある動画はPSDToolKitでwav+txtから字幕を自動配置する
- 自動化:台本がない音声だけ、Whisper等で文字起こし→srtで修正→.exoに変換してAviUtlに取り込む
そして最も重要なのは、台本がある合成音声動画では音声認識を経由せず、台本テキストをそのまま字幕にすることです。自動文字起こしは便利ですが、BGMとの重なり、長い無音、固有名詞、複数人の発話といった条件で精度が落ち、研究では音声に存在しない文が混入する例も報告されています。自動化しても「固有名詞と数字は聞き直す」という最終確認だけは残してください。
まずは手打ちで1本仕上げ、字幕の見た目をエイリアスとして保存するところから始めてください。そこまでできれば、PSDToolKitやWhisperを足したときに、どこでつまずいたかを自分で切り分けられるようになります。