AI画像生成5モデルを同じ日本語プロンプトで比較|20枚生成して消費クレジットと日本語対応を実測【2026年7月】

『画像生成AIって結局どれがいいの?』

AI動画生成やAI画像生成をやる上で、多くの人が実際に迷う観点であり、疑問に思う点だと思います。

スペックの表などはまとまってはいるんですけれども、結局、実際に日本語で使った時にどれくらい性能が出るのかというのは、本当にわからないですよね。

今回は実際に5つのモデルについて20枚画像生成してみて、実際に使ってみた結果についてまとめていきます。

大きく観点としては、値段・日本語プロンプトでの指示が通るのか?・日本語の看板文字が書けるのか?という点について着目して評価してみます。

検証日: 2026年7月31日。Pollo AIのウルトラプラン(実際に課金しています)経由で、Midjourney V8.1・GPT Image 2・Stable Diffusion 3・Recraft v3・Ideogram v2 Turboの5モデルに、まったく同じ日本語プロンプトを入れて各4枚ずつ、合計20枚を生成しました(消費176クレジット)。出力枚数はすべて4枚、アスペクト比はすべて16:9に揃えた統制条件です。消費クレジットは生成の前後の残高の差から測った実測値で、生成された画像はすべてダウンロードして解像度とファイルサイズを確認し、MD5で別々の画像であることを照合しています。円換算はウルトラプランを基準にした概算(1クレジット約3.3円)です。なお2026年7月30日にPollo AIの生成クレジットが全体的に4倍になっていますので、金額は日付とあわせてお読みください。各モデル1回(4枚)ずつという制約がありますので、数字はひとつの目安としてお読みください。

結論:GPT-Image2 が日本語描写は最強

先に今回の検証の概要などををまとめておきます。

今回の検証では、全モデル共通で以下のプロンプトを利用しました。

夜の路地裏にある小さなラーメン屋台。湯気とネオンの反射。年配の店主が鍋を振っている。シネマティックな照明。

以下のように日本語のプロンプトは、Stable Diffusion 3 以外はすべて画像生成に反映することができます。

一方で、日本語の看板を高い精度で出力できるものは、GPT Image 2 だけでした。

モデル4枚あたり概算解像度日本語プロンプト日本語の看板文字
Midjourney V8.112約40円1456×8164枚中1枚
GPT Image 216(無制限で0約53円2560×14404枚とも○
Stable Diffusion 340約132円1344×768×
Recraft v348約158円1820×1024×
Ideogram v2 Turbo60約198円1312×736×(英字は○)

今回の検証結果からわかることを以下に3つまとめておきます。

  • 値段が5倍違う:Midjourney V8.1の12クレジットに対し、Ideogram v2 Turboは60クレジットです
  • Stable Diffusion 3だけが日本語プロンプトで失敗他の4つは問題なく描けています
  • この5モデルの中では解像度がいちばん高いGPT Image 2が、値段では2番目に安い
管理人がいちばん意外だったのは、高いモデルほど良いという関係がまったく成立しなかったことです。最高額のIdeogramは解像度が最も低く、最安のMidjourney V8.1は普通に良い絵を出してきました。

同じプロンプトで比較

各モデルから2枚ずつ抜き出して並べました。すべて同じ日・同じ日本語プロンプト・同じ4枚出力・同じ16:9です。

上から4つ(Midjourney V8.1/GPT Image 2/Ideogram v2 Turbo/Recraft v3)は、夜の路地裏・屋台・湯気・ネオン・人物がそろっています。

いちばん下のStable Diffusion 3だけが、明るいテーブルに置かれた丼になりました。夜でも屋台でもなく、人も写っていません。このように、Stable Diffusion 3 では日本語が全く効かないことがわかります。

日本語の文字の出力に加えて、実際に書く絵の傾向も異なっていることがわかります。具体的なモデルごとの傾向を以下に示します。

  • Midjourney V8.1:湯気やガラス越しの表現に寄っていて、雰囲気重視です
  • GPT Image 2:解像度が最も高く、看板の文字まで作り込んでいます
  • Ideogram v2 Turbo:構図が引き気味で、街の広がりを見せてきます
  • Recraft v3:色が青緑に寄った統一感のある絵づくりです
同じプロンプトで並べるとこうなります

日本語の看板文字を書けたのは1モデルだけでした

AI画像生成の弱点としてよく挙がるのが、絵の中の文字です。実際に確かめました。

モデル看板の日本語枚数
GPT Image 2「ラーメン」「中華そば」「ホテル」が読めます4枚中4枚
Midjourney V8.11枚だけ「ラーメン」が正しい4枚中1枚
Midjourney v7すべてでたらめな字8枚中0枚
Ideogram v2 Turbo日本語は×。ただし英字の「RAMEN」は読めます
Recraft v3すべてでたらめな字4枚中0枚

拡大して並べたのが下の画像です。Midjourneyは漢字のような形をしているだけで読める字になっていません。GPT Image 2は同じ日本語プロンプトで「ラーメン」「中華そば」をきちんと書いています。

面白かったのはIdeogram v2 Turboです。このモデルは文字の描画に強いことで知られていて、実際に「RAMEN」という英字の看板は完璧に読める字で出してきました。ところが日本語は崩れます。英字には強いが日本語は別ということのようです。

日本語の文字を絵に入れたいなら、この5モデルの中ではGPT Image 2の一択です。(後述しますが、あとから測った安い帯の3モデルも日本語を描けました。)

日本語の看板文字を書けたのは1モデルだけでした

Stable Diffusion 3・Ideogram・Recraftの作例

後半3モデルの4枚ずつを、そのまま置いておきます。

Stable Diffusion 3:1344×768/4枚/40クレジット(約132円)
4枚とも明るいテーブルの丼です。指示した7要素のうち通ったのは「ラーメン」だけでした。なお同じ内容を英語に直したら7つとも出ましたので、モデルの実力の問題ではなく日本語の扱いをうまく行うことができず、変な画像が生成されていることがわかります。

Ideogram v2 Turbo:1312×736/4枚/60クレジット(約198円)
今回いちばん高額でしたが、解像度は最も低いという結果でした。絵そのものは指示どおりで、英字の看板がきれいに出るのが持ち味です。

Recraft v3:1820×1024/4枚/48クレジット(約158円)
解像度は2番目に高く、色調が青緑に寄った統一感のある絵づくりでした。4枚の振れ幅は小さめです。

Stable Diffusion 3・Ideogram・Recraftの作例

【全モデル】Pollo AIで使える画像モデルの価格まとめ(2026年8月1日)

この記事で作例を出した5モデル以外にも、Pollo AIにはたくさんの画像モデルが載っています。ブランドをひとつずつ展開して、使えるモデルの表示クレジットを全部読み取りました。

ブランドモデル4枚あたり1枚あたり実測の解像度備考
Flux AIFlux Schnell41
Flux AIFlux Dev821816×1024LoRAの項目あり
Flux AIFlux Dev Lora82LoRAの項目あり
Nano BananaNano Banana 2 Lite82
SeedreamSeedream 5.0 Pro82
Pollo AIPollo Image 2.082
MidjourneyMidjourney V8.11231456×8164枚固定。50%off中
SeedreamSeedream 4.0123
OpenAIGPT Image 21642560×1440無制限の対象=0クレジット
SeedreamSeedream 5.0 Lite164無制限の対象=0クレジット
Nano BananaNano Banana164
SeedreamSeedream 4.5164
Pollo AIPollo Image 1.6164
OpenAIGPT Image 1.5205
OpenAIGPT Image 1205
MidjourneyMidjourney v72461456×8164枚固定
Flux AIFlux 2 Max246公式の最新FLUX.2世代
Nano BananaNano Banana 2328無制限の対象=0クレジット
Stability AIStable Diffusion 340101344×768日本語プロンプトが通りません
RecraftRecraft v348121820×1024
Flux AIFlux 1.1 Pro4812
Flux AIFlux Kontext Pro4812
IdeogramIdeogram v2 Turbo60151312×736英字の看板は正確に描けます
Flux AIFlux 1.1 Pro Ultra6416
Nano BananaNano Banana Pro7218
Flux AIFlux Kontext Max9624今回測った画像モデルで最高額

読み取ってみて分かったことを4つ挙げます。

  • 最安はFlux Schnellで、4枚4クレジット=1枚1クレジット:最高額のFlux Kontext Max(96クレジット)とは24倍の差があります。同じFluxブランドの中での差です
  • 高いほど良い、というわけではない:作例を比べたところ、60クレジットのIdeogram v2 Turboが解像度は最も低く(1312×736)、12クレジットのMidjourney V8.1のほうが良い絵を出しています
  • 設定は前に使ったモデルから引き継がれる:同じモデルでも表示額が変わることがあります。切り替えたら必ず生成ボタンの数字を見てください

なおFlux KontextとGPT-4oは、選択が切り替わらず読み取れませんでした。前のモデルの価格が表示されたままになるため、数字を載せていません。

管理人がここで一度失敗しています。Flux Kontextを選んだつもりで前のモデルの値段を記録しかけました。モデルを切り替えたら、チップに出ているモデル名が変わっているかを必ず見てください。切り替わっていないと、別のモデルの値段を自分のメモに書いてしまいます。

各モデルの詳しい実測はPollo AIの消費クレジット・生成時間 早見表にもまとめています。

【追記】最安帯の4モデルも生成(2026年8月1日)

価格表を作ったあとで、いちばん安い帯のモデルも実際に生成してみました。同じ日本語プロンプト・同じ4枚出力です。合計28クレジットで15枚作れました。

モデル4枚あたり1枚あたりファイルサイズ絵柄日本語の看板
Flux Schnell4193〜161KBイラスト調崩れます
Nano Banana 2 Lite82163〜204KB写真調読めます(ラーメン大将/博多ラーメン/餃子/居酒屋)
Seedream 5.0 Pro821.35〜1.51MB写真調読めます(提灯の「ラーメン」が4枚とも)
Pollo Image 2.0821.90〜1.95MB写真調読めます(ラーメン/餃子)

この記事の前半で「日本語の文字を絵に入れられるのはGPT Image 2だけ」と書きましたが、それは最初に測った5モデルの中での話でした。安い帯まで広げて測ったところ、Nano Banana 2 Lite・Seedream 5.0 Pro・Pollo Image 2.0の3つも日本語の看板を正しく描けました。しかも1枚2クレジットで、GPT Image 2(1枚4クレジット)の半額です。

また、最安のFlux Schnell(1枚1クレジット)だけが写真ではなくイラスト調で、ファイルサイズも他の10分の1以下でした。1枚あたりの値段は2倍しか違わないのに、出てくるものの性格がまったく違います。

管理人が正直に驚いたのはSeedream 5.0 Proでした。8クレジット(4枚で約26円)で、提灯の「ラーメン」が4枚とも読めて、雰囲気もいちばん良い。60クレジットのIdeogram v2 Turboより安くて、日本語も通って、絵も好みでした。値段だけで判断すると、こういうモデルを見落とします。
最安帯4モデルの比較
上からFlux Schnell(1枚1クレジット)/Nano Banana 2 Lite/Seedream 5.0 Pro/Pollo Image 2.0(各1枚2クレジット)。すべて同じ日本語プロンプト・1024×1024です

用途別のおすすめAI画像生成モデル

実測をふまえた使い分けを以下示します。

やりたいこと選ぶモデル理由
日本語の文字を絵に入れたいGPT Image 24枚とも正しく書けたのはここだけです
安く数を作りたいMidjourney V8.14枚12クレジット。5モデル中最安です
とにかく無料で作りたいGPT Image 2ウルトラプランの無制限の対象で0クレジットでした
解像度がほしいGPT Image 2(2560×1440)/Recraft v3(1820×1024)この2つが飛び抜けています
英字のロゴや看板を入れたいIdeogram v2 Turbo英字は完璧に読める字で出ました
Stable Diffusionを試したいStable Diffusion 3ただしプロンプトは英語で書いてください

また、実際には PolloAI(Pollo AI)では「ウルトラプラン」というものが用意されていて、ウルトラプランであれば、以下に示す対象のモデルは無制限で画像生成することができます。

  • 対象:GPT Image 2/Seedream 5.0 Lite/Nano Banana 2
  • 対象外:Midjourney(v7・V8.1とも)/Stable Diffusion 3/Ideogram/Recraft

数をこなす前提なら、この差はかなり大きいです。

管理人の結論としては、まずGPT Image 2で数を作って当たりのプロンプトを見つけ、雰囲気を作り込みたい1枚だけMidjourney V8.1に回す、という順番が無駄がありませんでした。

0クレジットで作れるモデルが、いちばん日本語に強い

ここまで20モデル以上を測ってきて、最後にウルトラプランの「無制限」の対象になっているモデルをまとめて生成しました。

モデル定価無制限で解像度日本語の看板
Nano Banana 232〜440クレジット2048×2048読めます(屋台/らーめん昇龍/らーめん)
Seedream 5.0 Lite160クレジット2048×2048読めます(らーめん/ラーメン)
Nano Banana Pro720クレジット1024×1024読めます(ラーメン多数)
Grok Imagine120クレジット1024×1024読めます(ラーメンのネオンが3枚とも)
Seedream 4.5160クレジット2048×2048一部あやしい字が混じります
Kling V3 Omni80クレジット1024×1024看板より人物のアップに寄る絵づくりでした
Wan 2.78対象外1024×1024読めます(ラーメン/ラーメン台)
Seedream 4.012対象外1024×1024漢字風であやしい字が出ます
Flux 2 Max(最新FLUX.2世代)24対象外1008×1008読めます(ラーメン)

この結果から分かることを以下に3つまとめておきます。

  • 0クレジットで作れるモデルが、そろって日本語の看板を描けました。Nano Banana 2・Seedream 5.0 Lite・Nano Banana Pro・Grok Imagineの4つです。お金を払うモデルを探すより先に、まず無制限の対象を試すほうが早いという結論になります
  • 解像度でも0クレジット組が上でした。Nano Banana 2とSeedream 5.0 Liteは2048×2048(約420万画素)です。この記事の前半で「解像度がいちばん高い」と書いたGPT Image 2は2560×1440(約370万画素)ですので、画素数ではこちらが上回ります
  • 定価72クレジットのNano Banana Proが0クレジットで使えます。画像モデルの中では高額な部類ですが、無制限の対象なので実質タダでした。定価だけを見て候補から外すと、いちばん惜しい見落としになります
管理人はここまで「安い順に試す」という考え方で進めてきましたが、最後にひっくり返りました。ウルトラプランを使っているなら、値段の話より先に「無制限の対象かどうか」を見るべきでした。0クレジットで2048×2048、しかも日本語の看板まで描けるモデルがあるのに、60クレジット払ってIdeogramを回していたことになります。

このようにウルトラプランを利用した無制限画像生成を念頭に置くと、若干結論も変わってきます。

  • ウルトラプランを使っている方Nano Banana 2(0クレジット・2048×2048・日本語の看板が読める)が第一候補です
  • クレジットを払って作る方:Midjourney V8.1(1枚3クレジット)かWan 2.7(1枚2クレジット)。どちらも日本語が通ります
  • 人物を大きく写したい方:Kling V3 Omniが、看板より人物に寄った絵を出してきました
無制限対象を含む9モデルの比較
上から6つ(Grok Imagine/Seedream 5.0 Lite/Nano Banana 2/Kling V3 Omni/Nano Banana Pro/Seedream 4.5)はすべて0クレジットです。下3つ(Wan 2.7/Seedream 4.0/Flux 2 Max)は8〜24クレジットでした。すべて同じ日本語プロンプトです

今回の検証の制約事項

今回の検証の制約事項についても、正直に書いておきます。

  • 各モデル1回(4枚)ずつしか生成していません。AI画像は同じプロンプトでも毎回変わりますので、画質の優劣を決めるには枚数が足りていません。
  • プロンプトは1種類だけです。「夜の街」という題材に寄った結果である可能性があります。人物ポートレートや商品写真では順位が変わるかもしれません
  • 解像度は各モデルの既定(自動)です。揃えられませんでしたので、そのまま並べています
  • Flux・Qwen Image・Dall-E・Imagenは今回試していません。Pollo AIには載っていますが、今回の5モデルには含めていません
  • ローカル環境とは比べていません。すべてPollo AI経由の結果です
  • 価格は変わります。2026年7月30日にPollo AIの生成クレジットが全体的に4倍になった実績があります。Midjourney V8.1の12クレジットは50%offによるもので、定価は25クレジットです

試していないことを試したことにはしません。追加で分かったことがあれば追記します。

よくある質問(FAQ)

最後によくある質問を以下にまとめておきます。

5モデルの中でいちばん安いのはどれですか?

Midjourney V8.1で、4枚12クレジット(約40円)でした。いちばん高いIdeogram v2 Turboは60クレジット(約198円)で、5倍の差があります。ただしGPT Image 2はウルトラプランの無制限の対象なので、実質0クレジットで作れました。

日本語プロンプトはどのモデルでも通りますか?

通りませんでした。5モデルのうちStable Diffusion 3だけが、指示した7要素のうち「ラーメン」しか反映しませんでした。他の4モデル(Midjourney V8.1・GPT Image 2・Ideogram v2 Turbo・Recraft v3)は問題なく描けています。SD3は英語に直せば通ります。

絵の中に日本語の文字を入れられるモデルはどれですか?

この5モデルの中ではGPT Image 2だけです。ただし後半で追記したとおり、より安いNano Banana 2 Lite・Seedream 5.0 Pro・Pollo Image 2.0(いずれも1枚2クレジット)も日本語の看板を描けました。4枚とも「ラーメン」「中華そば」が読める字で出ました。Midjourney V8.1は4枚中1枚、v7は8枚中0枚、RecraftとIdeogramは日本語が崩れました。ただしIdeogramは英字の「RAMEN」を完璧に描いています。

解像度がいちばん高いのはどれですか?

GPT Image 2の2560×1440です。次がRecraft v3の1820×1024、Midjourneyの1456×816、Stable Diffusion 3の1344×768、Ideogram v2 Turboの1312×736という順でした。いちばん高額なIdeogramが解像度は最も低いという結果です。

結局どれを選べばいいですか?

日本語の文字を入れたいならGPT Image 2、安く数を作りたいならMidjourney V8.1です。管理人はGPT Image 2で数を作って当たりのプロンプトを見つけ、仕上げの1枚だけMidjourney V8.1に回すという使い分けをしています。同じ画面でモデルを切り替えられるので、この順番が無駄になりません。

まとめ

5モデルに同じ日本語プロンプトを入れて20枚生成した結果、価格が5倍違うことと、高いほど良いという関係が成立しないことがはっきりしました。

最高額のIdeogram v2 Turbo(60クレジット)は解像度が最も低く、最安のMidjourney V8.1(12クレジット)は普通に良い絵を出しています。

日本語まわりでも差が出ました。Stable Diffusion 3だけが日本語プロンプトで主題を落としました。絵の中の日本語文字については、この5モデルではGPT Image 2だけが4枚とも正しく書けています。ただし記事の後半で追記したとおり、あとから測った安い帯のNano Banana 2 Lite・Seedream 5.0 Pro・Pollo Image 2.0(いずれも1枚2クレジット)も日本語の看板を描けました。

Ideogramは文字に強いモデルとして知られていて、実際に英字の「RAMEN」は完璧でしたが、日本語は崩れます。

実務での使い分けとしては、日本語の文字が要るならGPT Image 2、安く数を作るならMidjourney V8.1です。とくにGPT Image 2はウルトラプランの無制限の対象で0クレジットになりますので、試作の段階で回数を稼ぐならここが効きます。

Midjourney・Stable Diffusion 3・Ideogram・Recraftはいずれも無制限の対象外で、押した回数ぶん必ず減ります。この違いは数をこなすほど効いてきます。

30以上のモデルを1つのアカウントで

Kling・Veo・Soraを個別に契約しなくても、Pollo AIならまとめて試せます。管理人もプロプラン(月額$29)で検証しています。

無料でPollo AIを試す →

※広告リンクです。ここから登録いただくと管理人のお財布が少しあたたまり、次の検証の課金代になります。もちろんみなさんの料金は変わりません。

関連記事

コメント

タイトルとURLをコピーしました