「aivisspeech モデル 追加」で検索しているなら、結論から言うと作業自体は5分で終わります。AivisHubという公式の配布サイトから.aivmxファイルをダウンロードし、AivisSpeechの「音声合成モデルの管理」からインストールするだけで、標準搭載のキャラクター以外の声を使えるようになります。難しい設定は一切不要です。
ただし、雑学ショート動画のナレーションに使うつもりなら、手順そのものより先に確認しておくべきことがあります。それは「そのモデルを収益化コンテンツに使っていいのか」というライセンスの話です。AivisHubで配布されているモデルはすべて同じ条件ではなく、商用利用不可のものも普通に存在します。この記事では追加手順に加えて、他の解説記事があまり踏み込んでいないライセンス確認の実務フローと、雑学ショート動画の量産運用でモデルをどう使い分けるかまで具体的に解説します。
音声まわりだけでなく動画を1本完成させる流れを先に掴みたい人は、ずんだもん動画の作り方【2026年版・9ステップ】を読んでからこの記事に戻ると、設定がどの工程の話か迷わなくなります。
AivisSpeechのモデル追加の全体像とAivisHub とは
AivisSpeechは初回インストール時に数種類の標準音声(キャラクターボイス)しか搭載されていません。ナレーションのバリエーションを増やしたい、シリーズものの雑学ショート動画で「この声=このチャンネル」という認識を作りたい、といった場合は、追加の音声合成モデルをインストールする必要があります。
その追加モデルの主な配布元が「AivisHub」です。AivisSpeechを開発するAivis Projectが運営する公式の音声合成モデル共有サイトで、次のような特徴があります。
- Aivis Project公式が提供する「オフィシャルモデル」と、一般ユーザーが制作・アップロードした「ユーザーモデル」の両方が並んでいる
- 「ダウンロード数の多いモデル」「いいね数による人気順」「みんなの新着」といった複数の切り口で探索できる
- タグと検索機能があり、声質・性別・トーンなどの条件で絞り込める(タグをロックして関連モデルだけを表示する機能もある)
- 起動中のAivisSpeechに対して、ブラウザから1クリックでモデルをインストール・更新できる連携機能がある
- モデルには開発元・作成者が独自に設定したライセンス(ACML/ACML-NC/CC0/カスタムライセンスなど)が付与されており、モデルごとに利用条件が異なる
モデルファイルの実体は.aivmxという拡張子のファイルで、1モデルあたりのサイズはおおむね200〜300MBです。声の情報量が大きいぶんファイルサイズも大きく、複数モデルを入れるとストレージを圧迫する点は事前に知っておいた方がいいポイントです。
また、1つのモデルには複数の「スタイル」(通常・喜び・怒り・悲しみなどの感情バリエーション)が用意されていることが多く、モデルを1個追加するだけで声のトーン違いを何種類も使い分けられます。雑学ショート動画で「ここだけ驚いた感じで読ませたい」といった演出をしたい場合、新しいモデルを追加しなくても、既存モデルのスタイル切り替えだけで対応できるケースも多いので、モデルを増やす前にまず手元のモデルのスタイル一覧を確認しておくと無駄がありません。
なお、AivisSpeechは基本的にCPUだけでも動作する設計になっており、.aivmx形式もその前提で作られています。GPUが無いノートPCでも動きますが、モデル数を増やすほど起動時の読み込みやモデル切り替えにかかる時間はわずかに伸びます。量産作業でテンポよく収録したい場合は、常時ロードしておくモデルを絞っておいた方が体感的にも快適です。
追加前の準備:モデルの選び方とダウンロード
インストール作業に入る前に、AivisHub上でどのモデルを追加するか決めておきます。手順は次の通りです。
- ブラウザでAivisHubにアクセスする
- トップページの「オフィシャルモデル」「人気の音声合成モデル」「みんなの新着」などのカテゴリ、またはタグ検索から気になるモデルを探す
- モデルのカードをクリックして詳細ページを開く
- 詳細ページでサンプル音声を試聴し、声質・トーンが用途に合っているか確認する
- 同じ詳細ページに記載されているライセンス種別(ACML/ACML-NC/CC0/カスタムライセンスなど)を必ず確認する(後述の第5章で詳しく解説します)
- 問題なければ「ダウンロード」ボタンから
.aivmxファイルを取得する。AivisSpeechを起動した状態でアクセスしていれば、ダウンロードの代わりに1クリックインストールのボタンが使える場合もある
独自視点になりますが、この時点で「1個ずつ試して選ぶ」のはおすすめしません。1モデル200〜300MBあるため、5個ダウンロードして気に入った1個だけ残す、という使い方はストレージと通信量の無駄になります。サンプル音声はAivisHubの詳細ページ上で視聴できるので、ダウンロード前にその場で2〜3個に絞り込んでから実際に入れる、という順番にした方が効率的です。
【完全手順】AivisSpeechにモデルを追加する5ステップ
ダウンロードした.aivmxファイルを実際にAivisSpeechへ追加する手順です。
| ステップ | 操作内容 |
|---|---|
| 1 | AivisSpeechを起動する |
| 2 | 画面上部(またはメインメニュー)から「設定」を開き、「音声合成モデルの管理」を選択する |
| 3 | ウィンドウ右上の「インストール / 更新」ボタンをクリックする |
| 4 | 「ファイルからインストール」を選び、ダウンロードした.aivmxファイルを指定する |
| 5 | 「インストール完了」のポップアップが表示されたら完了。左側のモデル一覧に追加されているか確認する |
インストールが終わったら、メイン画面のテキスト入力欄の横にあるプロフィールアイコン(話者アイコン)をクリックすると、追加したモデルが選択肢に出てきます。あとは他の標準ボイスと同じ感覚でスタイル(感情・トーン)を選び、テキストを読み上げさせるだけです。
なお、AivisHubの1クリックインストール機能を使った場合は、ステップ2〜4がブラウザ操作だけで完了し、AivisSpeech側は自動的にモデルを受け取ります。何本もモデルを試す予定なら、こちらの方が手間が少なくなります。
モデルが表示されない・切り替わらないときの対処チェックリスト
インストールしたはずのモデルが一覧に出てこない、選択しても声が切り替わらない、というトラブルは実際によく起きます。上から順に確認してください。
- [ ] AivisSpeechを完全に再起動したか(インストール直後は反映されないことがある)
- [ ] ダウンロードしたファイルの拡張子が
.aivmxになっているか(.aivmのみのファイルはAivisSpeech単体では読み込めない) - [ ] インストール時に「インストール完了」のポップアップが実際に表示されたか(表示されなかった場合はファイルが壊れている可能性がある)
- [ ] ダウンロードが途中で止まっていないか(ファイルサイズが200MB前後あるはずなのに極端に小さい場合は再ダウンロード)
- [ ] ディスクの空き容量が十分にあるか(1モデル200〜300MB。複数追加していると数GB単位で消費する)
- [ ] 「音声合成モデルの管理」画面で該当モデルが「インストール済み」として表示されているか
- [ ] プロフィールアイコンのドロップダウンを開き直したか(表示更新が遅れることがある)
- [ ] セキュリティソフトやOSの警告でファイルの一部がブロックされていないか
それでも解決しない場合は、AivisSpeechの公式お問い合わせフォームから不具合の内容・再現手順・OS情報・エラーメッセージを添えて連絡する方法が用意されています。個人のブログ記事の情報だけで無理に解決しようとせず、公式サポートに投げた方が早いケースもあります。
商用利用前に必須のライセンス確認フロー
ここが、多くの解説記事が手順の説明だけで終わらせてしまい、深く踏み込んでいない部分です。雑学ショート動画のような収益化前提のコンテンツにAivisSpeechの追加モデルを使う場合、確認すべきはインストール方法ではなくライセンスです。
AivisHubで配布されているモデルには、主に次のようなライセンスが設定されています。
| ライセンス種別 | 商用利用 | クレジット表記 | 改変・派生利用 | 備考 |
|---|---|---|---|---|
| ACML | 原則可能 | モデルによる | モデルによる | Aivis Project独自の音声合成モデルライセンス。条件はモデルごとの詳細ページに明記 |
| ACML-NC | 不可(非商用限定) | モデルによる | モデルによる | 「NC」はNonCommercialの略。収益化動画への使用は規約違反になる |
| CC0 | 可能 | 不要 | 可能 | パブリックドメイン相当。最も制約が少ないが、配布モデル自体は少数派 |
| カスタムライセンス | モデルによる | モデルによる | モデルによる | 制作者が独自に条件を設定。詳細ページの記載を必ず読む必要がある |
この表はあくまで一般的な傾向であり、実際の利用条件は必ず配布元(AivisHubの各モデル詳細ページ)の利用規約を確認してください。同じACML表記でも、制作者が追加の条件(商用利用時は事前連絡が必要、特定ジャンルでの利用禁止など)を付け足しているケースもあります。「AI音声だから」「無料配布だから」という理由で確認を省略するのが一番危険です。
雑学ショート動画のナレーションで使う場合、実務的には次の順で確認すると漏れがありません。
- AivisHubのモデル詳細ページでライセンス種別(ACML/ACML-NC/CC0/カスタム)を確認する
- 「商用利用可否」の記載を探す。多くの詳細ページには可否が明記されているが、記載が見当たらない場合は不明扱いとして商用利用を避ける
- クレジット表記が必須のモデルかどうかを確認する。必須の場合は、動画の概要欄に配布ページ指定の書式でクレジットを入れる
- YouTubeパートナープログラムなど広告収益化をしている・する予定のチャンネルで使う場合は、そのモデルが「収益化コンテンツでの利用」を明示的に許可しているかも合わせて見る
- 判断がつかない場合は制作者への問い合わせフォームやSNSで直接確認する。それでも不明なら、そのモデルの使用自体を見送る
なお、AivisSpeechというソフトウェア本体(アプリ自体)の利用にクレジット表記は不要です。クレジット表記が問題になるのは、追加でインストールした個々の音声合成モデルのライセンス条件によります。ソフト本体とモデルのライセンスは別物、と覚えておくと混乱しません。
具体的なシーンで考えてみます。たとえば「ダウンロード数の多いモデルだから安全だろう」と考えて、詳細ページのライセンス欄を確認せずに広告収益化済みのショート動画チャンネルで使ってしまい、あとから該当モデルがACML-NC(非商用限定)だったと判明する、というのはありがちな事故パターンです。人気ランキングと利用条件はまったく別の指標なので、「みんな使っているから大丈夫」という思い込みで判断しないことが重要です。判断に迷うモデルについては、AivisHubの詳細ページにコメント欄や制作者への問い合わせ導線が用意されていることが多いので、そこから直接確認するのが最も確実です。
また、AivisSpeech本体だけでなく、Aivis Project が別途提供している「Aivis Cloud API」経由でモデルを使う場合は、ローカルのAivisSpeechとは規約上の扱いが異なることがあります。API経由での商用利用を検討している場合は、AivisSpeech単体の利用規約とは別に、Cloud API側の利用規約も確認してください。
ここまでの手順、1本ぶんまるごと自動でやりますShorty はテーマを入力するだけで、台本・AI音声・字幕・BGMを揃えた雑学ショート動画を生成します。無料プランは30日5本まで。無料で作ってみる人気モデルの傾向と雑学ショート動画向けの選定基準
AivisHubは「ダウンロード数」「いいね数」「新着」でランキングを見られますが、上位モデル=雑学ショート動画に最適、とは限りません。ランキング上位には感情表現が豊かなキャラクターボイス系や、特定のVTuber・キャラクターを想起させる声質のモデルが多く、これは雑談・実況・キャラクターコンテンツ向けの需要を反映したものです。
一方、雑学ショート動画のナレーションで重視すべきなのは、独自視点として次の軸です。
| 用途 | 重視すべき点 | 避けた方がいい傾向 |
|---|---|---|
| 雑学・豆知識系の淡々としたナレーション | 滑舌の明瞭さ・一定のテンポ・聞き疲れしない音域 | 感情の起伏が激しく抑揚が強すぎるモデル(情報が耳に入りにくくなる) |
| シリーズ物でチャンネルの「声」を固定したい | 汎用的で癖が少なく、長期間聞いても飽きにくい声質 | 流行り・話題性重視で人気が出ているが個性が強すぎるモデル(テキスト内容によって合わない場面が出る) |
| サムネイル・冒頭のフックで耳を引きたい | ハキハキした発声・高めのテンポ感 | ボソボソ系・囁き系(ショートの冒頭数秒で離脱されやすい) |
つまり「いいね数が多いから」ではなく、「自分のチャンネルの雑学ショート動画で毎回同じテンションで読んでも破綻しないか」を基準にサンプル音声を聴き比べるのが実務的です。AivisHubの詳細ページでは投稿されているサンプル音声を試聴できるので、候補を2〜3個に絞ったうえで、実際に使う予定の台本の一部を読ませて比較するのが確実です。
比較する際は、静かな環境で試聴するだけでなく、実際にショート動画へ組み込む想定でBGMを軽く重ねて聴いてみることもおすすめします。BGM無しでは聞き取りやすかった声が、実際の動画ではBGMに埋もれてしまう、というのはよくあるギャップです。特に低めのトーンで囁くように話すタイプのモデルは、単体では魅力的でも、BGM込みの完成形では聞き取りづらくなりがちなので注意してください。
また、AivisHubのタグ機能を使えば「ナレーション向き」「落ち着いた声」「はきはき」といった傾向のタグで絞り込める場合があります。人気ランキングだけでなくタグ検索も併用し、キャラクター性より明瞭さを優先する軸でモデルを探すのが、雑学ショート動画では効率的です。
自作・配布モデルを使う:Style-Bert-VITS2からAIVMX変換
AivisHubに欲しい声質のモデルが見当たらない場合、Style-Bert-VITS2などで学習済みの音声合成モデルを持っているなら、「AIVM Generator」というAivis Project公式の変換ツールを使って.aivmx形式に変換できます。手順の概要は次の通りです。
- AIVM Generatorに、学習済みモデル(
.safetensors)、ハイパーパラメータ(config.json)、スタイルベクトル(style_vectors.npy)の3ファイルをアップロードする - ONNX形式への変換を行う(数分程度。すでにONNXファイルを持っている場合はこのステップを省略できる)
- モデル名(必須)、制作者名、説明文、ライセンス情報などのメタデータを入力する
- 「AIVM/AIVMXファイル生成」ボタンを押すと、AivisSpeechにインストール可能な
.aivmxファイルが生成される
生成時にはボイスサンプルの生成でAivisSpeechのインストールが前提になっている点、AIVM(フルセット版)とAIVMX(軽量版)の違い — AivisSpeech単体ならAIVMXのみで足りるが、Aivis Cloud APIを使う場合は両方必要になる点にも注意してください。
必要な3ファイル(.safetensors・config.json・style_vectors.npy)は、Style-Bert-VITS2で学習を行った際に出力先フォルダへまとめて生成されます。学習環境と変換作業を別のPCで行う場合は、この3点セットを丸ごとコピーしておかないと変換の途中でやり直しになるので注意してください。ONNX変換に失敗した場合は、AIVM Generator側のサポート窓口に連絡すれば個別に対応してもらえる旨が案内されています。自己流で原因を探るより、早めに問い合わせた方が解決が早いケースが多いです。
ここで独自の注意点を補足します。この変換フローが使えるのは、あくまで「自分が学習・作成した、あるいは学習・配布の許可を得ている音声モデル」に限られます。他人の声を無断で学習させてモデル化し、それを.aivmxに変換して配布・利用することは、AivisSpeechの規約以前に、声の主のパーソナリティ権・著作権的な問題に抵触するおそれがあります。「変換ツールが技術的に使えること」と「その音声データを学習・配布していいこと」はまったく別の話です。
雑学ショート動画の運用で複数モデルを使い分けるコツ
ここまでの手順とライセンス確認を踏まえたうえで、実際に雑学ショート動画を量産する運用視点の話をします。これも他の解説記事にはあまり出てこない部分です。
モデルは技術的にはいくつでも追加できますが、実運用では2〜3個に絞ることをおすすめします。理由は次の3つです。
- 1モデル200〜300MBあるため、10個も入れるとPCのストレージを簡単に圧迫する
- 動画ごとに声を変えると、チャンネルとしての「聞き覚え」が育たず、リピート視聴につながりにくい
- 台本を書く・収録するたびに毎回モデルを選び直すのは、量産運用では地味に時間を食う
具体的には、「レギュラーボイス」を1つ固定してシリーズの軸にし、企画のトーンを変えたい回(怖い話系、ほっこり系など)だけサブボイスに切り替える、という2階建て構成がバランスが良い運用です。
また、AivisSpeechで生成した音声をショート動画に組み込む段階では、BGMや効果音の扱いも合わせて検討する必要があります。フリーで使える音源を探す場合はYouTubeオーディオライブラリの使い方を、AivisSpeech自体の基本操作をまだ固めていない場合はAivisSpeechの使い方を、雑学ショート動画全体のAI音声実装フローを見直したい場合は雑学ショート動画のAI音声実装ガイドを参考にしてください。
台本・ナレーション音声・BGMまでは揃ったが、そこから先の動画への組み込み・書き出し作業を自動化したい場合の選択肢の一つとして、当サイトが開発・運営しているツール「Shorty」もあります。無料プランは1本30秒まで・30日間で5本まで・保存期間7日・ショート形式のみという制約があるため、量産運用の本格的な代替にはなりませんが、AivisSpeechで作った音声を使った動画組み立てを一度試してみる用途には向いています。
よくある質問
Q. AivisSpeechに追加したモデルは無料で商用利用できますか? A. モデルのライセンスによります。ACMLライセンスやCC0のモデルは商用利用可能な場合が多い一方、ACML-NC(非商用限定)のモデルは収益化動画への使用が規約違反になります。AivisHubの各モデル詳細ページで個別に確認してください。
Q. モデルファイルの拡張子は何ですか?
A. .aivmxです。AivisSpeechにインストールできるのはこの形式のファイルで、.aivmのみのファイルは変換や追加処理が必要になる場合があります。
Q. モデルをインストールしたのに一覧に表示されません。 A. まずAivisSpeechを完全に再起動してください。それでも表示されない場合は、ファイルが途中でダウンロードエラーになっている可能性があるため、AivisHubから再ダウンロードしてください。
Q. AivisHub以外からモデルを入手する方法はありますか?
A. Style-Bert-VITS2などで自分が学習した音声モデルがあれば、AIVM Generatorという変換ツールで.aivmxに変換して使えます。ただし公式の配布元を経由しない個人配布のファイルを使う場合は、権利関係や安全性を自己責任で確認する必要があります。
Q. モデルは何個まで追加できますか? A. ソフトウェア側に明確な上限は設けられていませんが、1モデルあたり200〜300MBとサイズが大きいため、実務上はストレージ容量が上限になります。数個〜10個程度を目安に管理するのが現実的です。
Q. 追加したモデルを削除するにはどうすればいいですか? A. 「音声合成モデルの管理」画面から、対象のモデルを選んで削除操作を行います。インストール手順と同じ画面から操作できます。
Q. モデルのアップデートが配信されたらどうすればいいですか? A. AivisHub側でモデルが更新されている場合、同じ「インストール / 更新」ボタンから最新版のファイルを取得し直せば上書きされます。
Q. クレジット表記が必要なモデルの場合、どこに書けばいいですか? A. 一般的には動画の概要欄に、モデルの配布ページで指定されている書式(モデル名・制作者名・配布元URLなど)に沿って記載します。指定書式が明記されていない場合は、配布元に直接確認するのが確実です。
Q. 自分の声で音声合成モデルを作って配布してもいいですか? A. 自分自身の声を学習データにする場合は基本的に問題になりにくいですが、他人の声を本人の許可なく学習・モデル化して配布・利用することは、規約や権利の面でトラブルになる可能性が高いため避けてください。
Q. AIVMファイルとAIVMXファイルは何が違いますか? A. AIVMXはAivisSpeech(ローカルアプリ)へのインストールに最適化された軽量形式です。AIVMはよりフルセットな形式で、Aivis Cloud APIなど別の用途で使う場合に必要になります。AivisSpeech単体で使うだけならAIVMXのみで問題ありません。
Q. モデルを追加すると動作が重くなりますか? A. AivisSpeechはCPUだけでも動く設計ですが、インストールするモデル数が増えるほど起動時の読み込みや切り替えに多少時間がかかるようになります。量産作業でテンポよく収録したい場合は、常用するモデルを2〜3個程度に絞っておくと快適です。
Q. ライセンス表記がAivisHubのページに見当たらない場合はどうすればいいですか? A. 記載が見当たらない、または曖昧な場合は、商用利用不可・要確認として扱うのが安全です。制作者への問い合わせ導線がページにあれば、そこから直接確認してから使用を判断してください。
あわせてVOICEVOXの使い方2026(スマホでの手順つき)を読んでおくと、次の工程でつまずく箇所を先回りして潰せます。
まとめ
AivisSpeechへのモデル追加自体は、AivisHubから.aivmxファイルをダウンロードし、「音声合成モデルの管理」からインストールするだけの単純な作業です。表示されない・切り替わらないといったトラブルも、再起動やファイル破損の確認といった基本的なチェックでほとんど解決します。
一方で、雑学ショート動画のような収益化前提のコンテンツで使う場合は、手順の簡単さとは裏腹に、ライセンス確認というひと手間を省略できません。ACML・ACML-NC・CC0・カスタムライセンスのどれに該当するか、商用利用やクレジット表記の条件がどうなっているかは、AivisHubのモデル詳細ページと配布元の利用規約で必ず一つずつ確認してください。この記事のライセンス比較表はあくまで一般的な傾向であり、最終判断は個々のモデルの規約に従う必要があります。
手順・トラブル対処・ライセンス確認・運用の使い分けまで押さえておけば、AivisSpeechのモデル追加で迷う場面はほぼなくなるはずです。追加作業そのものに時間をかけるより、その先の「どのモデルを、どういう条件で、どのシリーズに使うか」という判断にこそ時間を割いた方が、雑学ショート動画の量産運用では結果的に近道になります。