『Stable Diffusionのプロンプト、日本語で書いても大丈夫?』
管理人も気になっていたので、同じ内容を日本語と英語で書き分けて、Stable Diffusion 3で8枚生成して、実際に検証してみました
結果はかなりはっきりしていて、日本語では「ラーメン」しか拾ってくれませんでした。
指示した「夜の路地裏」「屋台」「年配の店主」「ネオン」は、4枚とも1つも出ていません。
同じ内容を英語に直したら、全部出ました。払ったクレジットは同じ40です。
検証結果:Stable Diffusionは英語プロンプトしか受け付けない。
なお、今回のStable Diffusionの検証は、ローカルにインストールせずにPollo AIで実施しました。Pollo AIでStable Diffusionを試す手順はStable Diffusionをインストールせずにブラウザで使う方法にまとめています。
結論:日本語だと名詞ひとつしか残りませんでした
使ったプロンプトはこれです。
夜の路地裏にある小さなラーメン屋台。湯気とネオンの反射。年配の店主が鍋を振っている。シネマティックな照明。
要素を分解すると7つあります。結果を並べます。それぞれの要素がどれぐらい想定通り反映されたかを以下に示しています。
| 指示した要素 | 日本語プロンプト | 英語プロンプト |
|---|---|---|
| 夜 | × | ○ |
| 路地裏 | × | ○ |
| 屋台 | × | ○ |
| ラーメン | ○ | ○ |
| 湯気 | × | ○ |
| ネオン | × | ○ |
| 年配の店主が鍋を振る | × | ○ |
7つのうち、日本語で通ったのは「ラーメン」だけです。一方で、英語では7つの要素ともちゃんと生成画像に反映されました。
消費クレジットは日本語も英語も同じ40。モデルも設定も変えていません。
日本語 vs 英語の比較
上の4枚が日本語、下の2枚が英語です。
日本語版:1344×768/4枚/消費40クレジット(約132円)
英語版:1344×768/4枚/消費40クレジット(約132円)
日本語版は4枚とも明るい店内のテーブルに置かれた丼です。夜でもなく、屋台でもなく、人も写っていません。
英語版は夜の路地裏に立つ屋台、立ちのぼる湯気、ネオンの看板、鍋を振る人物がそろっています。
翻訳しただけで、ここまで変わりました。

プロンプトが難しすぎたわけではない
「そのプロンプトが複雑すぎるだけでは?」と思われるかもしれません。同じ日本語プロンプトを、同じ日に他のモデルにも入れました。
| モデル | 4枚あたり | 同じ日本語プロンプトの結果 |
|---|---|---|
| Midjourney V8.1 | 12クレジット | 屋台・夜・店主・ネオンすべて出ました |
| GPT Image 2 | 16(無制限で0) | すべて出た上に、看板の「ラーメン」まで正しく描けています |
| Ideogram v2 Turbo | 60クレジット | すべて出ました。英字の看板も読めます |
| Recraft v3 | 48クレジット | すべて出ました |
| Stable Diffusion 3 | 40クレジット | 「ラーメン」だけでした |
5つのうち4つは、同じ日本語で問題なく描けています。落ちたのはStable Diffusion 3だけです。
プロンプトの難易度ではなく、モデルごとの日本語の扱いの差だと考えるのが自然です。

動画のモデルでも同じ現象が発生
実はこれ、当サイトで2例目です。同じ日にGoogleのVeo 3(動画)でも同じ検証をしていて、そちらも日本語で主題が落ち、英語にしたら一発で通りました。
| モデル | 開発元 | 種類 | 日本語プロンプト |
|---|---|---|---|
| Stable Diffusion 3 | Stability AI(英) | 画像 | × |
| Veo 3 / Veo 3 Fast | Google(米) | 動画 | × |
| GPT Image 2 | OpenAI(米) | 画像 | ○ |
| Midjourney | Midjourney(米) | 画像 | ○ |
| Kling 2.6 | 快手(中) | 動画 | ○ |
| Seedance / Vidu Q2 | 中国系 | 動画 | ○ |
管理人が測った範囲では、中国系のモデルは日本語に強く、欧米系には当たり外れがあるという傾向でした。ただしMidjourneyやGPT Image 2は米国のモデルでも問題なく通りますので、「欧米系だからダメ」という単純な話ではありません。モデルごとに違います。
言えるのは「日本語で書くなら、そのモデルで通るかを一度確かめたほうがいい」ということが今回の検証の結果からわかります。
Stable Diffusion 3で使えるプロンプトの書き方
今回のStable Diffusion 3での実測をふまえた、プロンプトの書き方を以下にまとめておきます。
- 英語でプロンプト記載:これが一番効きます。難しい英語である必要はなく、今回使ったのも中学レベルの直訳です
- 要素をピリオドで区切って並べる:今回は「場所」「空気感」「人物と動作」「照明」の4文に分けました。長い1文にするより素直に反映されます
- 日本語で書きたい場合は、翻訳してから貼る:特別な言い回しは要りませんでした
実際に使った英語プロンプトの全文を置いておきます。そのまま使えます。
A small ramen stall in a narrow alley at night. Steam and neon reflections. An elderly shop owner tossing a wok. Cinematic lighting.
もし、英語は苦手だから日本語でプロンプトを書きたいという方は、Stable Diffusino以外のモデルを使うというのも1つの選択肢です。
同じPollo AIの画面で、日本語が通るモデルである、Midjourney や GPT Image 2を利用すれば、問題なく日本語プロンプトを書いたとしても、狙った通りの画像を生成することができます。
クレジット消費数は、Midjourney V8.1なら12クレジット、GPT Image 2ならウルトラプランの無制限で0クレジットでした。Stable Diffusion 3の40クレジットより安く、しかも日本語がそのまま通ります。
今回の検証の制約事項
今回の検証の中で検証しきれなかった内容について以下にまとめておきます。
- 各条件1回(4枚)ずつしか生成していません。AI画像は毎回結果が変わりますので、「日本語だと必ず落ちる」とまでは言えません。ただし日本語4枚が全滅で英語が全通りという結果は、偶然としては説明しにくいと考えています
- 英語版は4枚生成しましたが、記事には2枚を載せています。取得できたのが2枚だったためです
- Stable Diffusion 3以外のバージョンは試していません。ローカルで動かすWebUIや、SD 1.5・SDXLなどでは事情が違う可能性があります
- ローカル環境では試していません。この記事はすべてPollo AI経由の結果です
- 英語プロンプトは素直な直訳です。英語ならではの書き方まで詰めていません
- 「ネガティブプロンプト」は使っていません。今回は通常のプロンプトだけで比べています
もし、追加で分かったことがあれば追記します。
よくある質問(FAQ)
最後に、Stable Diffusionを用いた画像生成における日本語プロンプトの有効性についてよくある質問を以下にまとめておきます。
Stable Diffusionのプロンプトは日本語で書けますか?
書けますが、通りませんでした。管理人がStable Diffusion 3で試したところ、指示した7つの要素のうち日本語で反映されたのは「ラーメン」だけでした。夜・路地裏・屋台・湯気・ネオン・人物はすべて落ちています。同じ内容を英語にしたら7つとも出ました。
英語にすると何が変わりますか?
指示が反映されるようになります。今回は翻訳しただけで、夜の路地裏・屋台・湯気・ネオン・鍋を振る人物がすべて出ました。モデルも設定も消費クレジット(40)も同じです。英語のレベルは中学程度の直訳で足りました。
プロンプトが複雑すぎたのではないですか?
同じ日本語プロンプトを他の4モデル(Midjourney V8.1・GPT Image 2・Ideogram v2 Turbo・Recraft v3)にも入れましたが、いずれも正しく描けました。落ちたのはStable Diffusion 3だけですので、プロンプトの難易度ではなくモデル側の差だと考えられます。
日本語で書きたい場合はどうすればいいですか?
日本語が通るモデルに切り替えるのが早いです。同じPollo AIの画面で、Midjourney V8.1なら12クレジット、GPT Image 2ならウルトラプランの無制限で0クレジットでした。どちらもStable Diffusion 3の40クレジットより安く、日本語がそのまま通ります。
プロンプトの書き方にコツはありますか?
要素をピリオドで区切って並べるのが素直に効きました。今回は「場所」「空気感」「人物と動作」「照明」の4文に分けています。長い1文にするより反映されやすい印象でした。
まとめ
Stable Diffusion 3のプロンプトを日本語と英語で書き分けて8枚生成した結果、日本語では指示した7要素のうち「ラーメン」だけしか通りませんでした。
夜も路地裏も屋台も店主もネオンも、4枚すべてに出ていません。同じ内容を英語にしたら7つとも出ました。払ったクレジットはどちらも同じ40です。同じ日本語プロンプトをMidjourney V8.1・GPT Image 2・Ideogram v2 Turbo・Recraft v3に入れたところ、4つとも正しく描けましたので、これはプロンプトの難易度ではなくStable Diffusion 3側の仕様です。
対処は2つあります。ひとつは英語で書くこと。中学レベルの直訳で十分でした。もうひとつは、日本語が通るモデルに切り替えることです。Midjourney V8.1は12クレジット、GPT Image 2はウルトラプランなら0クレジットで、どちらもSD3の40クレジットより安く済みます。日本語で書きたいなら、後者のほうが手間もお金もかかりません。
30以上のモデルを1つのアカウントで
Kling・Veo・Soraを個別に契約しなくても、Pollo AIならまとめて試せます。管理人もプロプラン(月額$29)で検証しています。
※広告リンクです。ここから登録いただくと管理人のお財布が少しあたたまり、次の検証の課金代になります。もちろんみなさんの料金は変わりません。


コメント