自分だけのVTuberキャラクターが、実際に喋っている動画を作れたら。絵は描けないし、モデリングソフトも使えない、そんな人でも実現できないでしょうか。
PixVerseを使えば、キャラクターデザインから、動き、喋る様子まで、すべてAIで一気に作れます。
この記事を読めば、PixVerseでVTuber風の喋る動画を作る方法が分かります。
無料でどこまでできるかはPixVerseを無料で使う方法、始め方と料金はPixVerseの始め方・料金・無料枠まとめ【実課金レビュー】にまとめています。
結論:キャラ作成から動画化、喋らせるまで可能
PixVerseでVTuber風の喋る動画を作る流れは、こうです。
- ①キャラクターの画像を作る:t2i(テキストから画像)でオリジナルデザインを作成
- ②アイドルモーションを付ける:i2v(画像から動画)で、微笑む・手を振るなどの動きを付けて動画化
- ③喋らせる:人声(リップシンク)機能で、②の動画にセリフと音声を合成
PixVerse を利用すれば、キャラのデザインを作れなくても、キャラに求める内容を文字で入力して、さらにそれを動画にして、さらにそれをリップシンク機能で喋らせるところまで、すべてを行うことができます。
ただ注意点として、このリップシンク機能は若干日本語対応が甘いです。確かに日本語を喋らせることはできるんだけども、よくあるような萌え声だったり、流暢な日本語で喋らせたりすることができず、どうしても少し外国人が日本語を読んだときのような音声になってしまいます。
実演①:オリジナルVTuberキャラクターを作りました
まず、t2i(テキストから画像)でキャラクターをデザインしました。入力したプロンプトはこちらです。
プロンプト:『Anime-style VTuber character, young woman with long silver twin-tails hair, big sparkling purple eyes, cat ear headphones, wearing a cute streaming outfit with digital circuit patterns, sitting in front of a colorful gaming setup background, vibrant anime illustration, clean lineart, vtuber avatar style』
ちなみに t2i というものは、Text-to-Image の略で、テキストから画像を生成する機能のことを示します。
アスペクト比は1:1(正方形)にしました。配信のアイコンやワイプにも使いやすい構図です。Qwen-imageモデルで、実測0クレジットで生成できました。

こんな感じでイメージしているものを文章にして入力するだけで、簡単にイメージしているようなVTuberの画像を生成することができます。
実演②:アイドルモーション(配信中のような自然な仕草)を付けました
次に、このキャラクター画像をi2vで動画化します。入力したプロンプトはこちらです。
プロンプト:『彼女が明るく微笑み、元気よく手を振る。まばたきをして、頭を軽くかしげる。配信中のような自然な仕草。背景のネオンライトがゆっくりと明滅する』
結果が下の動画です。笑顔・手振り・まばたきといった、配信中によく見る自然な仕草が再現されました。720P・5秒で実測50クレジットでした。
いや、マジでこのクオリティには本当にびっくりですよね。
さっきまでただ頭の中にあったイメージがそのまま画像になって、それがこんな感じで可愛い動画になって。本当にこの AI 動画生成は、今までのただの趣味のフェーズから、もうビジネスも含めて本格的に使える技術レベルに進化していることがわかります。
実演③:人声機能で、配信っぽいセリフを喋らせました
先ほどのアイドルモーション動画を、人声(リップシンク)機能のソースとしてアップロードし、セリフを入力しました。入力したセリフはこちらです。
『みなさん、こんにちは!本日の配信にお越しいただきありがとうございます。今日はPixVerseというAI動画生成サービスで、こうやってキャラクターが喋る動画も作れちゃうんです。すごいですよね!』
音声は「Auto」(自動音声)を選択しました。結果が下の動画です。セリフに合わせて口が動き、まるで本当に配信で喋っているような仕上がりになりました。45クレジットでした。
ただ、冒頭でも説明したように、この PixVerse のリップシンク機能がちょっと精度・性能的に厳しくて、せっかくかわいい動画を作れたにもかかわらず、リップシンクさせると音声が男性のロボットになってしまいます。ここだけが本当に残念な点です。
PixVerseのリップシンク機能は、プロンプトを入力するだけでなく、音声をアップロードして利用することもできます。
どうしてもPixVerseのリップシンク機能(プロンプト入力)を使う際は、音声が「萌え声」じゃなくなってしまうため、他の音声合成ソフトや音声合成ツールを使って音声を作成した上で、その音声をPixVerseにアップロードするのがおすすめです。そうすれば、ちゃんとPixVerseのリップシンク機能を萌え声で使うことができるようになります。
使い方:人声機能でキャラクターを喋らせる
手順は、次のとおりです。
- ①作成画面で「人声」タブを選ぶ
- ②アイドルモーション動画(②で作った動画)をソースとしてアップロードする
- ③セリフをテキストで入力する。先ほども説明したように、テキストではなく音声をアップロードすることをおすすめします。
- ④音声は「Auto」(自動音声)のままでOK:既存の音声ファイルをアップロードすることも可能です
- ⑤「作成」を押す
下が実際にセリフを入力した画面(日本語UI)です。

注意点:人声機能には『動画』が必要です
実際にやってみて分かった、重要な注意点があります。
- 人声(リップシンク)タブは、静止画をそのままアップロードできません:受け付けるファイル形式は動画(mp4・mov・webm)と音声のみです
- キャラクター画像だけを作った状態では、いきなり喋らせられない:先にi2vで動画化してから、その動画を人声のソースにする必要があります
つまり、『画像→動画→喋る動画』という2段階の変換が必要ということです。最初にこれを知らずに、画像を人声タブに直接アップロードしようとして戸惑いました。
クレジット消費のめやすと活用アイデア
今回の一連の作業でのクレジット消費は、次のとおりです。
| ステップ | クレジット |
|---|---|
| ①キャラクター画像の生成 | 実測0cr(Qwen-image) |
| ②アイドルモーション動画化(i2v) | 実測50cr(720P) |
| ③人声でリップシンク | 実測45cr |
合計で95クレジットほどで、キャラ設計から喋る動画まで一気に作れました。
- 配信のイントロ・アウトロ動画:オリジナルキャラクターの挨拶動画
- SNS投稿用のショート動画:VTuber風キャラのひとことコメント
- キャラクター紹介動画:自作キャラクターに自己紹介させる
同じキャラクター画像を使い回せば、セリフだけ差し替えて何本でも喋る動画が作れます。同じキャラクターを保つコツはキャラクター一貫性のコツ記事も参考にしてください。
PixVerse のプロプランでは月間 6,000 クレジット付与されるので、こういった動画を 60 個は生成することができます。本当に PixVerse は、他の AI 動画生成サービスと比べてもコスパが優れていることがわかります。
まとめ:3段階を踏めば、オリジナルVTuberが喋ります
PixVerseでVTuber風の喋る動画を作るには、①キャラクター画像を作る→②i2vで動きを付ける→③人声機能で喋らせるという3段階を踏みます。人声機能は動画をソースにする必要がある点に注意すれば、絵が描けなくてもモデリングソフトがなくても、オリジナルキャラクターが喋る動画を作れます。
まずは無料登録して、自分だけのキャラクターをデザインしてみてください。始め方や料金、リップシンクの詳しい使い方は関連記事でくわしく解説しています。
よくある質問(FAQ)
最後に PixVerse を利用した VTuber 風動画の作成、VTuber が喋っている YouTube 動画の作成について、よくある質問を以下にまとめておきます。
PixVerseでVTuber風の動画は作れますか?
作れます。t2iでキャラクターをデザインし、i2vで動きを付けた動画にしてから、人声(リップシンク)機能でセリフを喋らせる、という3段階の流れで作成できます。
キャラクター画像をそのまま喋らせることはできますか?
できません。人声(リップシンク)機能のソースは動画(mp4・mov・webmなど)のみ対応しており、静止画は直接アップロードできません。先にi2vで動画化してから、人声のソースとして使う必要があります。
セリフの音声はどうやって用意しますか?
「Auto」を選べば自動音声で読み上げてくれます。既存の音声ファイル(mp3・wav・m4aなど)をアップロードして、その音声に合わせて口を動かすことも可能です。
VTuber風動画の作例にはどれくらいクレジットがかかりましたか?
キャラクター画像の生成が実測0クレジット、アイドルモーションのi2vが50クレジット、人声でのリップシンクが45クレジットで、合計95クレジットほどでした。
同じキャラクターで複数の動画を作れますか?
作れます。同じキャラクター画像を使い回してアイドルモーションを作り、セリフだけを差し替えて人声を適用すれば、同じキャラクターのまま何本でも喋る動画を作成できます。
まとめ
PixVerseでVTuber風の喋る動画を作るには、キャラクター画像を作り、i2vで動きを付け、人声機能で喋らせるという3段階を踏みます。人声機能は動画をソースにする必要がある点に注意すれば、絵が描けなくてもモデリングソフトがなくても、オリジナルキャラクターが喋る動画を作れます。
まずは無料登録して、自分だけのキャラクターをデザインしてみてください。始め方・料金・リップシンクの詳しい使い方は関連記事でくわしく解説しています。
関連記事
- PixVerseのリップシンク・人声の使い方|人物動画に日本語セリフを喋らせる手順を実際の作例つきで解説【2026年】
- PixVerseのプロンプトの書き方|同じ画像で『あいまい』と『具体的』を比較してみた【実演つき】【2026年】
- PixVerseのキャラクター一貫性を保つコツ|同じ画像を使い回すと顔がブレない理由を検証【実演つき】【2026年】
テンプレートで、手早く1本作れます
プロンプトを書き込まなくても形になります。管理人も有料プランでほぼ全機能を検証しました。無料枠は毎日回復します。
※広告リンクです。ここから登録いただくと管理人のお財布が少しあたたまり、次の検証の課金代になります。もちろんみなさんの料金は変わりません。


コメント