『文章を入力するだけで、動画が作れるって本当?』——本当です。これがテキストから動画を作るAI(t2v=text to video)です。作りたい映像を言葉で書くだけで、数分後にはシネマティックな動画ができあがります。
この記事を読めば、テキストから動画を作る方法と、上手なプロンプトの書き方が分かります。作例はすべてAIで生成したものです。
どのAI動画ツールを使うか迷っている方は、AI動画生成ツールおすすめ7選|実際に課金して比べたランキングもあわせてご覧ください。
テキストから動画を作るAI(t2v)とは?
テキストから動画を作るAI(t2v)とは、作りたい映像を文章(プロンプト)で入力すると、AIが自動で動画を生成してくれる技術です。
『画像から動画(i2v)』が手持ちの画像を動かすのに対して、t2vはゼロから、言葉だけで映像を作れるのが特徴です。カメラも素材も要らず、頭の中のイメージを言葉にするだけで形になります。まずは、実際にどんな動画が作れるのか、作例から見ていきましょう。
【作例①】文章から実写風のシネマ動画が作れます
『ネオンが光る雨の東京の街で、傘をさした女性が立つ』という文章だけから生成した動画が下です。濡れた路面の反射、映画のような色づかい、自然な人物まで、実写のワンシーンのように仕上がっています。素材を一切使わず、言葉だけでここまで作れます。
【作例②】空撮のような風景も文章だけで作れます
『紅葉の山あいを、朝もやの中でドローンが飛ぶ』という文章から、空撮のような雄大な風景動画も作れます。谷を流れる川や滝、朝もや、差し込む朝日まで表現され、カメラがゆっくり前進する動きも自然です。ロケも撮影機材も不要で、こうした映像が数分で手に入ります。
【作例③】商品広告のようなマクロ映像も作れます
『氷の入ったグラスにドリンクが注がれる』という文章から、広告に使えるようなマクロ映像も作れます。氷の透明感や結露、注がれる液体まで丁寧で、飲料・食品のPRカットとしてそのまま使えます。文章の書き方次第で、人物からモノまで幅広く作れるのがt2vの強みです。
テキストから動画の作り方【手順】を紹介します
作り方は、とてもシンプルです。3ステップで紹介します。
- ①プロンプト(文章)を入力します:作りたい映像を文章で書き、モデル・長さ・比率を選んで「生成」を押します
- ②AIが動画を生成します:数分待つと、AIが自動で動画を作ります
- ③完成した動画をダウンロードします:仕上がりを確認して、そのまま保存・投稿できます
下が、その3ステップの実際の画面(日本語)です。難しい設定は不要で、慣れれば数分で1本作れます。

上手なプロンプトのコツをまとめました
t2vはプロンプト(文章)の書き方で仕上がりが大きく変わります。狙いどおりに作るコツです。
- 『何が・どこで・どんな雰囲気か』を書きます:主役・場所・ムード(例:夕暮れ、シネマティック)をはっきり書きます
- カメラの動きを指定します:『ゆっくり前進』『クローズアップ』などを入れると、映像が締まります
- 光や色を指定します:『朝日』『ネオン』『暖色』など、光の情報が質感を大きく左右します
- 盛り込みすぎないようにします:要素を詰め込みすぎると崩れやすいので、1シーンに絞ります
最初はうまくいかなくても、少しずつ言葉を変えて何本か試すと、狙いに近づきます。安いモデルで方向性を固めてから、本番を高品質モデルで作ると無駄がありません。
テキストから動画が得意なおすすめツールを紹介します
t2v(テキストから動画)は、多くのAI動画生成ツールで使えます。とくにおすすめは次の2つです。
- Pollo AI:Veo・Kling・Sora・Seedanceなど多数のモデルを1つで使い分けられます。同じ文章をモデルを変えて作り比べできるので、t2vの練習にも最適です
- DomoAI:実写風からアニメ調まで、スタイルを変えたt2vが得意です
どちらも無料枠から試せるので、まずは気になる文章を入れて、1本作ってみるのがおすすめです。詳しいツール比較は、関連記事でまとめています。
まとめ
テキストから動画を作るAI(t2v)は、文章を入力するだけで、実写風のシネマ映像から空撮の風景、商品広告まで、数分で作れる技術です。仕上がりを左右するのはプロンプトの書き方で、『何が・どこで・どんな雰囲気・どんなカメラワークか』を意識すると、狙いに近づきます。まずはPollo AIやDomoAIの無料枠で、頭の中のイメージを言葉にして1本作ってみてください。想像を映像にする面白さを、きっと実感できるはずです。
よくある質問(FAQ)
テキストから動画を作るAI(t2v)とは何ですか?
作りたい映像を文章(プロンプト)で入力すると、AIが自動で動画を生成してくれる技術です。画像から動画(i2v)が手持ちの画像を動かすのに対し、t2vはゼロから言葉だけで映像を作れます。
文章だけで本当に動画が作れますか?
作れます。この記事の作例も、すべて文章だけから生成しています。実写風のシネマ映像・空撮の風景・商品広告のようなマクロ映像まで、幅広く作れます。
上手なプロンプトのコツはありますか?
『何が・どこで・どんな雰囲気か』を明確に書き、カメラの動きや光・色も指定すると、狙いどおりになりやすいです。要素を詰め込みすぎず1シーンに絞ること、少しずつ言葉を変えて何本か試すことも有効です。
テキストから動画が作れるおすすめツールは?
多数のモデルを使い分けられるPollo AI、スタイル変換が得意なDomoAIがおすすめです。どちらも無料枠から試せます。同じ文章をモデルを変えて作り比べられるPollo AIは、t2vの練習にも向いています。
まとめ
テキストから動画を作るAI(t2v)は、文章を入力するだけで、プロ級の動画が数分で作れる技術です。仕上がりのカギはプロンプトの書き方で、『何が・どこで・どんな雰囲気・どんなカメラワークか』を意識すると狙いに近づきます。まずはPollo AIやDomoAIの無料枠で、頭の中のイメージを言葉にして1本作ってみてください。画像から動画(i2v)やおすすめ比較の記事もあわせてどうぞ。
30以上のモデルを1つのアカウントで
Kling・Veo・Soraを個別に契約しなくても、Pollo AIならまとめて試せます。管理人もプロプラン(月額$29)で検証しています。
※広告リンクです。ここから登録いただくと管理人のお財布が少しあたたまり、次の検証の課金代になります。もちろんみなさんの料金は変わりません。


コメント