ローカル音声合成で、紹介動画のナレーションを作った|区切り方とライセンスの話

短い音声を何本か作って動画のナレーションとしてつないだ流れを示したイメージ図 ITライフハック
この記事は約5分で読めます。
当ページはプロモーションが含まれています

前回まで、Irodori-TTS を Mac で動かした話と、英語をカタカナに置き換えた話を書きました。
今回は、実際に何を作ったかです。
自分のソフトを紹介する、2分ほどの動画のナレーションを作りました。
スライドと画面の録画に、音声を乗せる形です。
試してみた、ではなく、使った記録として書きます。
作ったものは公開しているので、先に置いておきます。文章で「自然でした」と書くより、聴いてもらうほうが早いと思うので。

ナレーションは、全部この方法で作りました。

原稿を区切って音声を作り、動画につなぐまでの流れを示した図

スポンサーリンク

作ったもの

2分ほどの紹介動画です。
スライドを何枚か並べて、画面の録画を挟んで、その上にナレーションを乗せました。
音声は、短く区切って何本か作って、あとでつないでいます。

スポンサーリンク

なぜ区切るのか

1回で生成できるのが、30秒ほどまでだからです。2分の原稿を、一度には作れません。
ただ、これは制約というより、都合がよかったです。
スライドの切り替わりに合わせて区切るので、もともと分けて作るものでした。

区切り方

スライド1枚につき、1本。これが分かりやすいと思います。
差し替えたくなったとき、その1本だけ作り直せばいいので。
1本を長くしすぎると、直すのが面倒になります。

声をどう用意したか

参照音声を使いました

手元にある音声を読み込ませると、その声で読み上げてくれます。
参照なしでも生成できますが、その場合は声がランダムになります。
動画で使うなら、声は固定したい。だから参照音声を使いました。

フリー素材から探しました

ここは、慎重に選ぶべきところです。
使用が自由に認められている音声を探して、それを使いました。
配布元の規約を読んで、この用途で問題ないことを確認しています。

やってはいけないこと

実在の人物の声を、勝手に使わない。
声優、配信者、知り合い。本人の許可なく声を再現するのは、避けるべきです。
技術的にはできてしまいます。できることと、やっていいことは別です。
他の解説記事でも、同じ注意が書かれています。そこは共通の認識だと思います。

読ませてみて

イントネーションが、自然でした

これが、いちばん驚いたところです。
棒読みになるかと思っていたのですが、そうなりませんでした。
文の区切り、上がり下がり、間の取り方。そのまま使える水準でした。

作り直しは、ほとんどありませんでした

1本につき、1回か2回。それで決まりました。
前回書いたとおり、1本の生成に1分ほどかかります。
作り直しが少ないので、その1分は許容できました。
10回やり直す前提なら、話は違ったと思います。

詰まったのは、英語だけ

前回書いた話です。
製品名やサービス名を、全部カタカナに置き換えました。
それ以外で、大きく困ったところはありませんでした。

つなぐ作業

音声編集ソフトで並べる

生成された音声ファイルを、順番に並べます。
動画編集ソフトでも、音声編集ソフトでも、できるほうで構いません。

間を調整する

ここは、手作業になります。
1本ずつ生成しているので、つなぎ目に無音がありません。あるいは、逆に長すぎる。
スライドの切り替わりに合わせて、少し空けると自然になります。

音量をそろえる

本によって、音量が微妙に違うことがあります。
編集ソフトでまとめて調整すると、聞いていて楽になります。

やってみて、よかったところ

何度でも作り直せる

これが、いちばん大きいと思います。
自分で録音すると、言い直しに気を使います。何度も録るのは疲れます。
生成なら、原稿を直して、もう一度押すだけです。
回数の制限もありません。ローカルで動いているので。

原稿を直しやすい

録音したあとに「ここを変えたい」と思うことがあります。
自分の声だと、その部分だけ録り直すのが難しい。声の調子が変わるので。
生成なら、その1本だけ作り直せば、前後と揃います。

自分の声を出さなくていい

これは、人によると思います。
自分の声を公開したくない場合や、録音できる環境がない場合。
静かな部屋、マイク、時間帯。そういう条件が要りません。

気をつけたところ

生成した音声には、透かしが入ります

これは知っておいたほうがいいと思います。
Irodori-TTS では、生成された音声に自動で電子透かしが埋め込まれます。
聞いて分かるものではありませんが、技術的には「生成された音声だ」と判別できる仕組みです。
隠して使うことは、想定されていないということだと思います。

ライセンスを確認する

コードは自由に使える形で公開されています。
ただし、モデルの重みについては、別に確認が要ります。
公開元の説明を読んで、自分の用途で問題ないかを確かめてください。
商用で使うなら、なおさらです。

参照音声の規約も、別に確認する

2つのライセンスが関わります。
音声合成そのものの条件と、参照に使った音声の条件。どちらも満たしている必要があります。
フリー素材でも、用途が限定されていることがあります。商用不可、加工不可など。

向いている場面

自分の用途で言うと、こういうものに向いていました。
短いナレーション。2分程度なら、区切って作れます。
作り置きするもの。締め切りに追われていない場面。
何度か直しそうなもの。原稿が固まっていないとき。

向いていないと思う場面

長い読み上げ。記事を丸ごと読ませるような使い方は、区切りが多くなりすぎます。
その場で必要なもの。1本1分なので、待てないなら別の手段を。
声そのものが大事な場面。本人の声で語る必要があるなら、録音してください。

まとめ

  • 2分ほどの紹介動画のナレーションを、短く区切って何本か作ってつないだ
  • 1回の生成は30秒ほどまで。スライド1枚につき1本が分かりやすい
  • 声は参照音声で固定。参照なしだと声がランダムになる
  • フリー素材から探して、規約を確認して使った
  • 実在の人物の声を、勝手に使わない。できることと、やっていいことは別
  • イントネーションが自然だった。棒読みにならない
  • 作り直しは1本につき1〜2回。だから1分の生成時間が許容できた
  • 詰まったのは英語だけ。カタカナに置き換えた
  • つなぐときは、間の調整と音量そろえが手作業になる
  • よかったのは、何度でも作り直せる/原稿を直しやすい/自分の声を出さなくていい
  • 生成音声には電子透かしが入る
  • ライセンスは2つ確認する。音声合成そのものと、参照音声の両方

試してみた、で終わらせずに、実際に使ってみてよかったと思っています。
速度は、NVIDIA のGPUに比べれば遅いです。ただ、作り直しが少なければ、待てました。
そして、自分で録音しなくていいというのが、思っていたより大きかった。
冒頭に置いた動画が、この方法で作ったものです。棒読みかどうかは、聴いて判断してもらうのがいちばん早いと思います。
このシリーズは、これで終わりです。Macでの速度、英語の置き換え、そして実際の制作。どれも、使ってみないと分からないことでした。

※本記事は2026年8月時点の内容です。ライセンスや仕様は変更されることがあるので、利用前に公開元の説明をご確認ください。

タイトルとURLをコピーしました