YMM4(ゆっくりMovieMaker4)の文字起こしは、メニューの「ツール(T) → 文字起こし」から開く標準機能です。外部サイトやプラグインは要りません。2025年6月1日公開のv4.42.0.0で追加され、中身はオープンソースの音声認識エンジン「Whisper」をPC上で動かす仕組み(Whisper.cpp/Whisper.net)です。音声はPCの外に送られず、料金もかかりません。
使い方は「素材をタイムラインに置く → 文字起こしウィンドウでモデルを選ぶ → 解析 → 結果を確認して配置 → 誤字と改行を直す」の5段階です。ここで言っておきたいのは、モデル選びより「どんな音声を入れるか」のほうが仕上がりに効くということです。BGMが重なった音声、複数人が同時にしゃべる実況、専門用語だらけのナレーションでは、いちばん大きいモデルを選んでも修正量はあまり減りません。この記事では、公式リリースノートで確認できた事実と、確認できなかった点を分けて書いたうえで、モデル選択の目安、実況・ナレーション素材から字幕を作る手順、落ちる・進まない・精度が低いときの対処までまとめます(2026年9月26日時点の情報)。
YMM4の文字起こし機能とは?場所と対応バージョン
結論:ツールメニューの「文字起こし」から使えます。v4.42.0.0(2025年6月1日)以降のYMM4が必要です。古いバージョンのままだとメニューが出てきません。
ネットで「YMM4には自動文字起こし機能はない」と書かれたQ&Aを見かけたら、それは機能追加前の情報です。2025年6月より前の記事は、AviUtlのプラグインやVrewで字幕を作ってYMM4に読み込む方法を紹介していることが多いです。いまはYMM4だけで完結できます。
公式リリースノートで確認できる変更履歴
開発者の饅頭遣いさんが公開しているリリースノート(manjubox.net)から、文字起こしに関わる変更だけを抜き出しました。
| バージョン | 公開日 | 文字起こし関連の変更 |
|---|---|---|
| v4.42.0.0 | 2025-06-01 | 文字起こしに対応(ツール(T) → 文字起こし) |
| v4.42.0.4 | 2025-06-02 | Whisperの動作に必要なランタイムが無い環境で文字起こしウィンドウを開くとクラッシュする問題を修正/日本語などを含むパスにYMM4を置くとWhisperモデルが読み込まれない問題を修正 |
| v4.42.0.5 | 2025-06-04 | タイムラインの途中から文字起こしすると、先頭部分が文字起こしされる問題を修正 |
| v4.42.1.0 | 2025-06-08 | 文字起こし中に結果一覧がスクロールされない問題を修正 |
| v4.46.0.0 | 2025-11-01 | SileroVADによる発話区間検出を利用可能に/結果を選ぶとその位置へシークするように |
| v4.46.1.0 | 2025-11-02 | 選べるモデルに「ggml-large-v3.bin」を追加 |
| v4.46.1.2 | 2025-11-09 | 文字起こしツールの使用後にリソースが解放されない問題を修正 |
| v4.49.0.0 | 2026-02-01 | 解析中にウィンドウを閉じられてしまう問題を修正 |
| v4.53.0.3 | 2026-06-12 | VC++ランタイムが無い環境でクラッシュする問題を修正 |
| v4.53.0.4 | 2026-06-13 | 一部の区間でネイティブ処理が失敗すると全体が止まる問題を修正(その区間だけ飛ばして続行するように) |
| v4.55.0.0 | 2026-08-02 | 「無音区間をカット編集」を追加 |
この表から実務で役立つことが2つ分かります。
- 落ちる・止まる不具合の多くは、アップデートで直っている。クラッシュや中断が起きたら、設定を触る前に最新版へ更新してください。
- v4.55.0.0以降は、文字起こしツールで無音区間のカットもできる。実況素材の「間」を詰める作業と字幕作りを、同じウィンドウで進められます。
中身はWhisper.cpp。公開情報で確認できる範囲
YMM4のライセンス表記には、Whisper.cpp、Whisper.net、kotoba-whisper(kotoba-tech公開の日本語特化モデル、v2.0のggml版)、Silero VAD(発話区間を見つけるモデル)が載っています。ここから、PC上で動くWhisper系の音声認識を使っていることは確かです。
一方で、次の点は2026年9月時点の公開情報では確認できませんでした。
- モデル一覧の全項目(公式に名前が出ているのは「ggml-large-v3.bin」だけ。v4.42公開直後には、large-v3の軽量版「Turbo」がモデル選択画面に並んでいたというユーザー投稿がある)
- GPUで処理が速くなるかどうか、その条件
- 対応言語の一覧や、言語を切り替える設定があるか
この記事ではこれらを推測で断定しません。モデル名や選択肢は、手元のYMM4の文字起こしウィンドウに表示されているものが正解です。下の表の数字は、Whisper.cppで一般的に使われるモデルの目安として読んでください。
文字起こしの使い方|字幕を自動で入れる基本手順
結論:素材を置く → ツール(T)→文字起こし → モデルを選んで解析 → 結果を配置 → 手直し、の順です。初回はモデルのダウンロードが入るので、最初の1本は時間に余裕を持って始めてください。
- YMM4を最新版に更新する 起動時の更新通知か公式サイトから、v4.42.0.0以降(なるべく最新)にします。上の表のとおり、クラッシュ系の不具合はだいたい更新で直っています。
- 文字起こししたい素材をタイムラインに置く ゲーム実況の録画、マイクで録ったナレーションのwav、インタビューの動画などです。BGMは別レイヤーに分けるか、いったんミュートしておくと精度が上がります(理由は後で説明します)。
- 再生位置を始点に合わせる ユーザーの使用報告では、ウィンドウに「現在の再生位置から解析」する操作があります。動画の途中から始めたいときは、先に再生バーをその位置へ動かします(途中から始めると先頭が起こされる不具合はv4.42.0.5で直っています)。
- ツール(T) → 文字起こしを開く 文字起こし用のウィンドウが別に開きます。初めて使うときはモデルのダウンロードが必要な場合があります。
- モデルを選ぶ 迷ったら、軽めのモデル(Turbo系や日本語特化のkotoba-whisper系が一覧にあればそれ)で1〜2分だけ試します。精度が足りなければ「ggml-large-v3.bin」などの大きいモデルに切り替えます。
- 必要ならSileroVAD(発話区間検出)を有効にする v4.46.0.0以降で使えます。しゃべっていない区間を先に除くので、無音やゲーム音だけの区間に変な文字が入る「幻聴」が減りやすくなります。
- 解析を実行する 結果一覧が上から順に増えていきます。行を選ぶとその位置までシークするので(v4.46.0.0以降)、音を聞きながらその場で確認できます。
- 結果をタイムラインに配置する どの形式で置けるか(テキストアイテムか字幕か、など)はバージョンや設定で変わる可能性があります。自分の画面のボタンに従ってください。ある利用者は「特に設定しなくても、ある程度区切られた字幕として入った」と報告しています。
- フォント・位置・改行をそろえる 自動で入った字幕は、フォントや座標が既定値のままです。見た目の決め方はYMM4の字幕改行設定を参考に、1行の文字数と改行位置を先に決めておくと手直しが一気に進みます。
- 誤字を直して書き出す 固有名詞、専門用語、数字を中心に目で確認します。
YMM4の基本操作(タイムライン、アイテム、書き出し)がまだ不安な人は、先にゆっくりムービーメーカーの使い方で全体の流れを押さえておくと、この手順がすんなり頭に入ります。
所要時間の目安(実例)
ブログで公開されている使用例では、約25分の動画の解析が5分ほどで終わり、そのあと字幕の修正に約2時間かかったそうです。解析そのものは速く、時間がかかるのは修正だという点に注意してください。「文字起こしで字幕作業がゼロになる」と考えると期待外れになります。手打ちの数時間が、手直しの2時間に縮むくらいに考えておくのが現実的です。
モデルの選び方|精度・速度・PCスペックのトレードオフ
結論:まず軽めのモデルで試し、足りなければ大きいモデルへ上げます。精度、速度、必要なメモリはトレードオフです。最初から最大のモデルを選ぶと、ノートPCでは遅いうえに落ちやすくなります。
下の表は、Whisper.cpp(ggml形式)の代表的なモデルについて、一般に知られているファイルサイズと傾向をまとめたものです。YMM4の一覧にどのモデルが出るかは、手元の画面で確認してください(公式に名前が確認できたのはggml-large-v3.binだけです)。
| モデル(ggml) | ファイルサイズ目安 | 日本語の精度傾向 | 速度傾向 | 向いているPC・用途 |
|---|---|---|---|---|
| tiny / base | 約75MB / 約140MB | 低い。誤字が多く、実用はきびしい | 非常に速い | 動作確認用 |
| small | 約470MB | 聞き取りやすいナレーションなら使える | 速い | メモリ8GBクラスのノートPC |
| medium | 約1.5GB | 実用レベル。固有名詞は弱い | 普通 | メモリ16GBクラス |
| large-v3-turbo | 約1.6GB | large-v3に近い。やや劣る場面もある | largeより大幅に速い | 速度と精度のバランス重視 |
| kotoba-whisper v2.0 | 約1.5GB | 日本語特化。large-v3と同じくらいを目指した蒸留モデル | largeより大幅に速い | 日本語の実況・解説 |
| large-v3 | 約3.1GB | 最も高い傾向 | 遅い | メモリ16GB以上・精度優先 |
kotoba-whisper v2.0は、large-v3を日本語向けに蒸留したモデルです。開発元は「同じくらいの精度で推論が約6.3倍速い」と説明しています。ただし外部のレビューでは、オノマトペ(擬音語)が続く箇所で崩れやすいという報告もあります。擬音やかけ声が多いゲーム実況では、large-v3と両方で1分ほど試して比べるのが確実です。
モデル選びでよくある誤解(独自視点)
「大きいモデル=字幕の手直しが最小」と思われがちですが、実際の修正時間はモデル以外の3つの条件で大きく変わります。
- 音の条件:BGMや効果音が声に重なっていると、どのモデルでも崩れます。大きいモデルに変えるより、BGMを外して解析したほうが効きます。
- 話し方の条件:早口、語尾が消える話し方、2人以上の同時発話は苦手です。実況者同士のかけ合いは、話者が混ざった1行になりがちです。
- 語彙の条件:ゲームのキャラ名、仮想通貨の銘柄名、社内用語などはモデルが知らない言葉です。モデルを大きくしても出てこないことがよくあります。
つまり、モデルを上げて取れる精度には上限があるということです。その先は、録音環境の改善と、よく出る用語の一括置換のほうが効きます。
GPUについて
Whisper.cpp自体にはGPUで高速化する仕組みがあります。ただ、YMM4の文字起こしがGPUを使うのか、どのGPUに対応するのかは、公開情報では確認できませんでした。「GPUがあるから大きいモデルで大丈夫」とは言い切れないので、処理中にタスクマネージャーを開き、CPUとGPUの使用率を見て自分のPCで確かめてください。
ここまでの手順、1本ぶんまるごと自動でやりますShorty はテーマを入力するだけで、台本・AI音声・字幕・BGMを揃えた雑学ショート動画を生成します。無料プランは30日5本まで。無料で作ってみる実況・ナレーション素材から字幕を自動化する手順
結論:「録音を分ける → 声だけで解析 → 用語を一括で直す → 無音カット → 見た目をそろえる」の流れにすると、手直しがいちばん少なくて済みます。文字起こしボタンを押す前の準備で、仕上がりの8割が決まります。
ゲーム実況(生声)の場合
- マイク音声とゲーム音を別トラックで録る:OBSなどで音声トラックを分けて録画します。解析するのはマイク音声だけにします。
- マイク音声だけをタイムラインに置く:ゲーム音は別レイヤーでミュートにします。
- SileroVADを有効にして解析:ゲーム音しかない区間に不要な文字が入りにくくなります。
- 「無音区間をカット編集」(v4.55.0.0以降)で間を詰める:カットで字幕の位置がずれないか、必ず再生して確かめます。
- 固有名詞を一括置換:よく出るキャラ名や技名は、先にメモ帳へ「誤→正」の一覧を作っておくと速く直せます。
複数人の実況は、話者ごとに別トラックで録り、話者ごとに文字起こしするのがいちばん確実です。1本のミックス音声から話者を分けてくれる機能は、公開情報では確認できませんでした。
ナレーション(顔出しなし解説)の場合
- 原稿があるなら、そもそも文字起こしは要らない:YMM4には台本(CSV等)を読み込む機能があり、原稿から字幕を作るほうが正確です。
- 原稿なしで話した場合だけ文字起こしを使う:アドリブのナレーションや、昔録った音声を再利用する場合です。
- 数字と単位を重点的に確認する:「1.5倍」「3割」「2026年」のような数字は、読み方の揺れで表記がぶれやすいところです。
ここで1つ強調しておきます。合成音声(VOICEVOX、ゆっくりボイスなど)でセリフを作るタイプの動画には、文字起こし機能はほとんど要りません。YMM4ではセリフを入力した時点で字幕が作られるからです。ずんだもん動画の作り方や雑学動画の作り方で紹介しているような「台本→合成音声」の作り方なら、字幕はセリフ入力と同時にできあがります。文字起こしが本領を発揮するのは、生声・実写・既存の音声素材を扱うときです。
字幕を仕上げる前のチェックリスト
- [ ] 1行の文字数がそろっている(スマホで見て読める長さか)
- [ ] 改行が単語の途中で入っていない
- [ ] 固有名詞・数字・英字の表記が統一されている
- [ ] 無音カットのあとで字幕と声がずれていない
- [ ] 話者が混ざった行を分けた
- [ ] 「えー」「あのー」などのフィラーを残すか消すか、方針を決めて統一した
- [ ] 字幕が顔やゲームUIと重なっていない
落ちる・進まない・精度が低い時の対処表
結論:落ちる・進まないときは「最新版への更新」「VC++ランタイム」「保存場所のパス」「メモリ」の順に確認します。精度が低いときは「音の分離」「モデル変更」「VAD」の順に試します。
| 症状 | 考えられる原因 | 対処 |
|---|---|---|
| 文字起こしウィンドウを開くとYMM4が落ちる | Whisperの実行に必要なVC++ランタイムが無い/古いYMM4 | YMM4を最新版にする(v4.42.0.4・v4.53.0.3で修正済み)。直らなければMicrosoft公式のVisual C++再頒布可能パッケージを入れる |
| モデルが読み込めない・エラーになる | YMM4を日本語など全角文字を含むフォルダに置いている | 最新版へ更新(v4.42.0.4で修正済み)。念のためC:\YMM4のような半角英数字だけのパスに移す |
| 途中でエラーになって全体が止まる | 一部の区間でネイティブ処理が失敗している | v4.53.0.4以降は、その区間だけ飛ばして続行する。古い版なら更新する |
| 解析が進まない・極端に遅い | モデルが大きすぎる/メモリ不足/ほかの重いアプリが動いている | 軽いモデルに下げる。ブラウザや配信ソフトを閉じる。長い素材は区切って解析する |
| 何回か使うとPC全体が重くなる | 文字起こし後にリソースが解放されていない(旧版の不具合) | v4.46.1.2以降に更新。重いときはYMM4を再起動する |
| 途中から解析したのに先頭が起こされる | 旧版の不具合 | v4.42.0.5以降に更新 |
| 無音区間に意味のない文字が入る | Whisperが無音やノイズを言葉として拾っている | SileroVAD(発話区間検出)を有効にする |
| 誤字が多い | BGMや効果音が重なっている/早口/マイクが遠い | 声だけのトラックで解析する。モデルを大きくするのは最後 |
| 固有名詞がいつも間違う | モデルが知らない言葉 | 置換用の一覧を作って一括で直す。モデルを変えても直らないことが多い |
| 同じ文が何度も繰り返される | Whisper系モデルによくある繰り返し | VADを有効にする、モデルを変える、その区間だけ手で直す |
YMM4全体の動作が重いときは、文字起こし以外の原因(プレビュー解像度、エフェクトの多さ、キャッシュ)もありえます。YMM4が重い原因と対処法で編集全体の軽くし方も確認しておきましょう。また、字幕まわりを便利にするプラグインを入れて不具合が出た場合は、YMM4プラグインの入れ方の手順どおりに一度外して、切り分けてください。
見落とされがちな条件:素材の長さとメモリ(独自視点)
1時間を超える配信アーカイブをそのまま解析するのは避けたほうが安全です。大きいモデルほどメモリを使い、YMM4本体の編集データやプレビューとも取り合いになります。15〜30分ずつに区切って解析するほうが、途中で失敗したときのやり直しも短くて済みます。区切りの位置は、話の切れ目(無音部分)にするのがコツです。
CapCut・Vrewなど他ツールとの比較
結論:もともとYMM4で編集しているなら、YMM4内蔵の文字起こしがいちばん手間が少なく済みます。スマホで完結させたい、クラウドでも構わない、といった条件なら他のツールも選択肢になります。どれか1つが「最良」なのではなく、編集の流れに合うものを選ぶのが大事です。
| ツール | 処理する場所 | 料金 | 強み | 注意点 |
|---|---|---|---|---|
| YMM4の文字起こし | 自分のPC(Whisper系) | 無料 | 編集ソフトの中で完結。音声が外部に出ない | Windows専用。PCスペックに左右される。モデルの全体像は画面で確認が必要 |
| CapCutの自動字幕 | アプリ/クラウド | 無料枠あり(機能により有料) | スマホでも使える。テロップのデザインが豊富 | 無料で使える範囲や規約が変わることがある |
| Vrew | アプリ(音声認識はクラウドを利用) | 無料枠あり | 文字を編集すると動画がカットされる感覚 | 無料枠の上限がある。YMM4に持ってくるには書き出しの手間 |
| Shorty | Webサービス | 無料プランあり | 台本からショート動画をまとめて生成 | 無料プランは1本30秒まで・30日で5本まで・保存7日・ショート形式のみ |
Shortyは当サイトが開発・運営しているツールです。YMM4の文字起こしが「すでにある音声に字幕を付ける」ためのものなのに対し、Shortyは「台本からショート動画そのものを作る」ためのもので、目的が違います。生声の実況に字幕を付けたいならYMM4やCapCut、Vrewのほうが向いています。無料プランには上記の制約があるので、長尺動画には使えない点に注意してください。
CapCutの字幕の精度や直し方はCapCut自動字幕の精度で、Vrewを縦型動画に使う流れはVrewの使い方で詳しく書いています。
YMM4を選ぶべきケース・選ばないほうがいいケース
向いているケース
- 編集はもともとYMM4でやっている(素材の書き出しと読み込みの往復がいらない)
- 声の素材を外部サービスにアップロードしたくない
- 月に何本も作るので、クラウドの無料枠をすぐ使い切ってしまう
向いていないケース
- Macしか持っていない(YMM4はWindows向けのソフトです)
- メモリ8GB以下の古いノートPCで、長い素材を大きいモデルにかけたい
- スマホだけで撮影から投稿まで済ませたい
文字起こしで作業時間を減らすコツと限界
結論:減らせるのは「打ち込み」の時間で、「確認」の時間は残ります。確認をなくすと、誤字の多い字幕がそのまま公開されて、視聴者の離脱につながります。
時短のコツ
- 置換リストを育てる:チャンネルでよく出る用語の「誤→正」をテキストファイルにためていくと、2本目以降の修正がどんどん速くなります。
- 字幕スタイルを先に決める:フォント、縁取り、位置、1行の文字数をテンプレート化しておけば、文字起こし後の手直しが誤字修正だけで済みます。
- 最初の1分だけ大きいモデルと比べる:本番の前に、同じ1分を軽いモデルと重いモデルで起こして比べます。差が小さければ軽いモデルで全体を処理します。
- 結果一覧のシーク機能を使う:行を選ぶとその位置へ飛べるので、怪しい行だけを聞き直せます。
限界とリスク
- 100%の精度はない:どの音声認識モデルでも完璧な文字起こしはできません。特に数字や固有名詞の誤りは、情報発信系の動画だと信用に関わります。
- 著作権の問題は文字起こしでは解決しない:他人の動画や配信を文字起こしして字幕付きで再投稿するのは、字幕を付けても無断転載のままです。
- 収益化の審査との関係:自動字幕を付けただけの転載・切り抜きは、YouTubeの「再利用されたコンテンツ」と判断されるおそれがあります。自分の解説や編集を加えることが前提です。
- 仕様は変わる:モデルの一覧やボタン名はアップデートで変わることがあります。この記事の表も、2026年9月時点の公開情報にもとづいています。
よくある質問
YMM4の文字起こしはどこにありますか?
メニューの「ツール(T) → 文字起こし」です。v4.42.0.0(2025年6月1日公開)以降で使えます。メニューに無い場合は、YMM4が古いバージョンのままの可能性が高いです。起動時の更新通知か公式サイトから最新版に更新してください。
YMM4の文字起こしは無料ですか?
はい、追加料金はかかりません。YMM4に組み込まれたWhisper系エンジンがPC上で動くため、クラウドの利用料も要りません。そのかわり処理はPCのCPU・メモリで行われるので、スペックによって速さが大きく変わります。
どのモデルを選べばいいですか?
まずは軽めのモデル(Turbo系や日本語特化のkotoba-whisper系が一覧にあればそれ)で1分だけ試しましょう。精度が足りないと感じたら、ggml-large-v3.binなどの大きいモデルに上げてください。モデル一覧は公式の全リストが公開されていないので、画面に出ている選択肢を基準にします。
文字起こしするとYMM4が落ちます。どうすればいいですか?
まず最新版に更新し、それでも落ちるならVisual C++ランタイムを入れてください。ランタイムが無い環境でのクラッシュは、v4.42.0.4とv4.53.0.3で修正されています。YMM4を日本語を含むフォルダに置いている場合は、半角英数字だけのパスに移すのも効果的です。
文字起こしが途中で止まる・進まないのはなぜですか?
モデルが大きすぎるか、メモリが足りないことが多いです。軽いモデルに下げ、ほかのアプリを閉じ、長い素材は15〜30分ずつに区切ってください。一部の区間の失敗で全体が止まる不具合は、v4.53.0.4以降でその区間だけ飛ばして続行するように直っています。
文字起こしの精度を上げるにはどうすればいいですか?
いちばん効くのは、BGMや効果音を外して声だけで解析することです。そのうえでSileroVAD(発話区間検出)を有効にし、最後の手段としてモデルを大きくします。固有名詞はモデルでは直りにくいので、置換リストで一括修正するほうが確実です。
GPUを使えば速くなりますか?
YMM4の文字起こしがGPUを使うかどうかは、公開情報では確認できませんでした。中で使っているWhisper.cppにはGPUで高速化する仕組みがありますが、YMM4での有効条件は不明です。処理中にタスクマネージャーでGPU使用率を見て、自分の環境で確かめてください。
ゆっくりボイスやずんだもんの動画にも文字起こしは必要ですか?
ほぼ不要です。合成音声のセリフは入力した時点で字幕になるので、文字起こしする場面がありません。文字起こしが役立つのは、生声の実況やナレーション、実写動画、すでにある音声素材に字幕を付けたいときです。
英語の音声も文字起こしできますか?
Whisperは多言語に対応したモデルですが、YMM4で言語を切り替える設定があるかは公開情報では確認できませんでした。短い英語の音声で試して、結果を見て判断してください。なお、kotoba-whisper系は日本語特化のモデルなので、英語には向きません。
文字起こし結果を字幕としてそのまま使って大丈夫ですか?
公開前に必ず人の目で確認してください。数字・固有名詞・同音異義語の誤りはよく起きます。情報発信系の動画で間違った数字が映ると、コメント欄で指摘されて信用を落とします。確認の手間まで含めて作業時間を見積もりましょう。
まとめ
YMM4の文字起こしは、ツール(T) → 文字起こしから使える無料の標準機能です。中身はPC上で動くWhisper系エンジン(Whisper.cpp/kotoba-whisper/Silero VAD)で、2025年6月のv4.42.0.0で追加されてから、クラッシュの修正、発話区間検出、large-v3モデルの追加、無音区間カットと改良が続いています。
- 使い方:素材を置く → モデルを選ぶ → 解析 → 配置 → 手直し
- モデル:軽いモデルで試し、足りなければ大きいモデルへ。ただし修正量を決めるのは「音の条件」「話し方」「語彙」
- トラブル:落ちる・進まないときは、更新 → VC++ランタイム → 半角パス → メモリの順に確認
- 限界:打ち込みは減るが確認は残る。25分の動画でも手直しに2時間ほどかかった例がある
合成音声で作るずんだもん動画や雑学動画なら、文字起こしより台本入力のほうが速くて正確です。生声・実写の素材を扱うときに、この機能を使ってください。YMM4の操作に慣れていない場合は、ゆっくりムービーメーカーの使い方から順に進めると、字幕作業までつまずかずに進められます。