Midjourneyのプロンプトって、英語で書かないとダメなの?
管理人も気になっていたので、同じ内容を日本語と英語で書き分けて、合計12枚を生成して比べました。
今回の検証の結果、日本語のプロンプトはそのまま通り、英語に直す必要はないことがわかりました。
ただ、どうしても画像の中に描かれる日本語の文字は、ほぼほぼ崩れてしまうことがわかりました。
もし、「ラーメン」と書いた看板を出したいなら、Midjourneyでは難しい、ということです。
料金の実測はMidjourneyの料金を実測に、手順はMidjourneyの使い方にまとめています。
結論:プロンプトは日本語OKだが、画像の中の文字は崩れる
先に結論をまとておきます。
| 項目 | 結果 |
|---|---|
| 日本語プロンプトで指示が通るか | 通ります。英語に直す必要はありませんでした |
| 日本語と英語で出来に差があるか | 差は感じませんでした。どちらも指示どおりです |
| 画像の中に日本語の文字を描けるか | ほぼ描けません。v7は8枚すべてでたらめな字でした |
| V8.1なら描けるか | 4枚中1枚だけ「ラーメン」が正しく出ました。改善はしていますが確実ではありません |
このように、日本語で生成する画像の指示自体は通りますが、画像の中の日本語の文字は大きく崩れてしまうことがわかりました。
検証:日本語プロンプトで指示した結果
実際に日本語プロンプトで画像を生成してみた結果について以下にまとめておきます。
プロンプト(全文)
夜の路地裏にある小さなラーメン屋台。湯気とネオンの反射。年配の店主が鍋を振っている。シネマティックな照明。
実際の出力:1456×816/4枚/1.29〜1.79MB
Midjourney v7・消費24クレジット(約79円)
「夜の路地裏」「ラーメン屋台」「湯気」「ネオンの反射」「年配の店主」「鍋を振っている」「シネマティックな照明」など、指示した要素がすべて反映されています。モノクロ2枚とカラー2枚という振れ幅も出しています。

作例:同じ内容を英語にした結果
次に、まったく同じ内容を英語に直しました。
プロンプト(全文)
A small ramen stall in a narrow alley at night. Steam and neon reflections. An elderly shop owner tossing a wok. Cinematic lighting.
実際の出力:1456×816/4枚
Midjourney v7・消費24クレジット(約79円)
こちらも指示どおりです。日本語版と比べて明確に良くなった、という差は見つけられませんでした。雰囲気の傾向が少し違うくらいで、どちらも使えます。
当サイトでは同じ検証をGoogleのVeo 3でもやっていますが、そちらは日本語だと指示した被写体がまったく出ませんでした。同じ「AIモデル」でも、日本語の扱いはこれだけ違います。

画像の中の日本語は崩れる
ここが今回いちばんはっきり出た弱点です。
上の8枚(日本語プロンプト4枚+英語プロンプト4枚)に写っている看板・のれん・提灯の文字を拡大しました。8枚すべてで、漢字のような形をしているだけで読める日本語になっていません。
下に並べたのは、まったく同じ日本語プロンプトをGPT Image 2に入れた結果です。こちらは「ラーメン」「中華そば」「ホテル」が読める字で出ています。
プロンプトを一切変えずに、あくまでもモデルだけ変更して検証してみました。
| モデル | 日本語の看板文字 | 4枚あたり |
|---|---|---|
| Midjourney v7(日本語プロンプト) | 4枚すべてでたらめ | 24クレジット |
| Midjourney v7(英語プロンプト) | 4枚すべてでたらめ | 24クレジット |
| Midjourney V8.1(日本語プロンプト) | 4枚中1枚だけ「ラーメン」が正しい | 12クレジット |
| GPT Image 2(日本語プロンプト) | 4枚すべて正しい | 16クレジット(無制限なら0) |

V8.1では少しだけ改善
最新のMidjourney V8.1でも、同じ日本語プロンプトを入れました。
実際の出力:1456×816/4枚
消費12クレジット(約40円)
4枚のうち1枚は「ラーメン」を正しく描けています(右下の1枚です)。残り3枚の看板文字は、やはり読めない字のままでした。
改善はしていますが、狙って出せるレベルではありません。4回に1回では、看板を主役にした絵には使えません。
なおV8.1はv7の半額(12クレジット対24クレジット)ですので、Pollo経由で使うならこちらを選ぶほうが得です。

日本語の文字を出したいときの回避策
実測した範囲で、現実的な手はこの3つです。
- 文字が要る絵はGPT Image 2で作る:同じPollo AIの画面でモデルを切り替えるだけです。しかもウルトラプランなら無制限の対象で0クレジットでした(Midjourneyは対象外です)
- Midjourneyでは文字の入らない構図にする:看板を写さない、寄りの構図にする、ぼかす。プロンプトに「看板」「文字」を書かないだけでもだいぶ変わります
- Midjourneyで絵を作って、文字は後から画像編集で載せる:いちばん確実です。ロゴや店名を正確に出したい商用用途なら、結局これが早いと思います
逆に言えば、文字が要らない絵ならMidjourneyの表現力は魅力的です。今回の12枚を見るかぎり、雰囲気の作り方はGPT Image 2より上だと感じました。使い分けの問題です。
私自身が AI 画像生成をするときは、基本的には Midjourney を使っています。
今回の検証で未検証の内容
今回の検証では Midjourney について、日本語プロンプトが通るのか、また生成される画像の中に記載されている日本語が正しく綺麗に書けているのかという点について検証しました。
一方で、すべてを検証できたわけではございませんので、具体的な未検証の内容について以下にまとめておきます。
- 各条件1回(4枚)ずつしか生成していません。AI画像は毎回結果が変わりますので、「日本語の看板は必ず崩れる」とまでは言えません。ただし12枚中11枚が崩れていますので、傾向としては十分だと考えています
- プロンプトに「『ラーメン』と書かれた看板」のように文字を明示していません。明示すれば結果が変わる可能性はあります。今回は「ラーメン屋台」という自然な指示で出た看板を見ています
- 公式のMidjourney(V8.2)では試していません。この記事はすべてPollo AI経由の結果で、載っているのはV8.1までです
- 英語プロンプトは素直な直訳です。英語ならではの書き方まで詰めていません
- ひらがな・カタカナ・漢字で崩れ方に差があるかは分けて見ていません。
今後の検証の中で、追加で分かったことがあれば追記します。
よくある質問(FAQ)
最後にMidjourneyの日本語プロンプトの有効性や生成画像の日本語文字の綺麗さなどについてよくある質問を以下にまとめておきます。
Midjourneyのプロンプトは日本語で書けますか?
書けます。管理人が実際に日本語で入れたところ、指示した要素がすべて反映されました。同じ内容を英語に直しても、はっきりした差は出ませんでした。英語に翻訳する手間は不要です。
画像の中に日本語の文字を出せますか?
苦手です。Midjourney v7では、日本語プロンプト4枚・英語プロンプト4枚の合計8枚すべてで、看板の文字が読めない字になりました。最新のV8.1では4枚中1枚だけ「ラーメン」が正しく出ましたが、狙って出せるレベルではありません。
日本語の文字を確実に出したい場合はどうすればいいですか?
同じPollo AIの画面でGPT Image 2に切り替えるのが早いです。同じ日本語プロンプトで4枚すべて「ラーメン」「中華そば」が読める字になりました。しかもウルトラプランなら無制限の対象で0クレジットです。確実さを求めるなら、Midjourneyで絵を作って文字は後から載せる方法が最も安全です。
日本語と英語、どちらのプロンプトが良いですか?
今回の8枚では差が見つけられませんでした。どちらでも指示どおりの絵になります。書きやすいほうで問題ありません。なお同じ検証をGoogleのVeo 3で行ったところ、そちらは日本語だと指示した被写体が出ませんでしたので、モデルによって事情はまったく違います。
V8.1とv7ではどちらが日本語に強いですか?
看板文字についてはV8.1のほうが少しだけ良い結果でした(4枚中1枚が正しい)。プロンプトの理解については、どちらも日本語で問題なく通ります。値段はV8.1が12クレジット、v7が24クレジットで、V8.1のほうが半額です。
まとめ
Midjourneyが日本語で使えるかを12枚生成して確かめた結果、プロンプトは日本語のままで問題なく通りました。同じ内容を英語に直しても差は見つけられませんでしたので、わざわざ翻訳する必要はありません。ただし画像の中に描かれる日本語の文字は別の話でした。
v7では日本語プロンプト・英語プロンプトあわせて8枚すべてで看板の字が崩れています。最新のV8.1で1枚だけ「ラーメン」が正しく出ましたが、4回に1回では狙って使えません。同じ日本語プロンプトをGPT Image 2に入れたら4枚すべてで正しく書けましたので、これはモデルの性格の差です。
日本の街並みを雰囲気で見せたいならMidjourney、看板の文字まで読ませたいならGPT Image 2がおすすめです。
30以上のモデルを1つのアカウントで
Kling・Veo・Soraを個別に契約しなくても、Pollo AIならまとめて試せます。管理人もプロプラン(月額$29)で検証しています。
※広告リンクです。ここから登録いただくと管理人のお財布が少しあたたまり、次の検証の課金代になります。もちろんみなさんの料金は変わりません。


コメント