200トークンのプロンプトを40トークンに圧縮しても画像品質は変わらない|カメラスペック・品質ワードの削減検証

200トークンのプロンプトを40トークンに圧縮しても画像品質は変わらない|カメラスペック・品質ワードの削減検証

結論

  • 200トークン超→約40トークンに圧縮しても、画像品質とコア要素の再現性に劣化は確認されなかった
  • カメラ機種名・レンズ・絞り・ISO等の撮影パラメータは出力に寄与していない
  • ultra-detailed skin texturesharp focusなどの品質ワードも効果なし
  • 同じ意味の重複表現(3回書いても1回と同じ)はトークンの浪費

「プロンプトは長いほど良い」と思っていないだろうか。カメラの機種名やF値、ISOまで書き込めば写真がリアルになる――そんな都市伝説を検証した。

検証対象のプロンプト

以下のスタジオポートレートプロンプトが検証対象。赤グラデーション背景に円形ライト、ヌードの女性という構成だ。

オリジナル(200トークン超)
A sophisticated studio portrait of a mature, 1girl, 32yo japanese actress, full nude, standing confidently with one hand on her hip, against a bold red gradient backdrop with a large glowing circular light behind her resembling a sun, dramatic lighting, high contrast, luxury fashion editorial style, sharp focus, ultra-detailed skin texture, cinematic color grading, modern minimalism, clean composition, premium magazine aesthetic, Camera: Medium format Lens: 85mm prime portrait compression Aperture: f/4 Shutter Speed: 1/160 ISO: 100 White Balance: Warm Focus: Eye autofocus tack sharp, Key Light: Softbox from front-left at 45 degrees, Fill Light: subtle, Background Lighting: Strong red backdrop circular spotlight behind subject, Rim Light: Subtle edge light, confident stance, Slight lean, Expression: Calm dominant self-assured, Framing: 3/4 body portrait Subject slightly off-center Circular light framing upper body

このプロンプトには複数の問題がある。

問題点の分析

1. 効果なしが検証済みの要素

要素分類根拠
Camera: Medium format, Hasselblad X2D / Sony A1カメラ機種名ビキニプロンプト段階的改善で効果なし確認済み
Lens: 85mm prime, Aperture: f/4レンズ・絞り同上
Shutter Speed: 1/160, ISO: 100撮影パラメータ同上
ultra-detailed skin texture品質ワードプロンプト最適化10テーマnatural skin textureが効果なし
sharp focus品質ワードz-image-turboはデフォルトでシャープ

2. 重複表現

同じ意味が複数箇所に散在している。

概念出現箇所必要な記述
自信のあるポーズstanding confidently / confident stance / Calm dominant self-assured1回で十分
手をポケットにone hand in his pocket / One hand in pocket1回で十分
ドラマチックな照明dramatic lighting / Key Light・Fill Light・Rim Lightの詳細まとめて1フレーズ

3. トークン数の問題

CLIPは75トークンで1チャンクを処理する。2チャンク目以降は影響力が低下する。このプロンプトは200トークン超で3チャンク以上にまたがるため、後半のカメラスペックや照明詳細はほぼ無視されている可能性が高い。

最適化版

上記の問題点を踏まえ、コア要素だけを残した最適化版を作成した。

最適化版(約40トークン)
A sophisticated studio portrait, 1girl, 32yo japanese actress, full nude, standing with one hand on hip, bold red gradient backdrop, large glowing circular light behind her, dramatic front-left softbox lighting, high contrast, luxury editorial style, cinematic color grading, modern minimalism, 3/4 body portrait, subject slightly off-center

削除した要素

  • カメラ・レンズ・撮影パラメータ全般 — Camera, Lens, Aperture, Shutter Speed, ISO, White Balance, Focus
  • 品質ワードsharp focus, ultra-detailed skin texture, premium magazine aesthetic, clean composition
  • 重複表現confident stance, Calm dominant self-assured, Slight lean など
  • 照明の詳細設定 — Key Light, Fill Light, Rim Lightの個別指定 → dramatic front-left softbox lighting に集約

残した要素

  • スタイルA sophisticated studio portrait(先頭で画像全体の方向性を決定)
  • 被写体1girl, 32yo japanese actress, full nude
  • ポーズstanding with one hand on hip(1回だけ記述)
  • 背景bold red gradient backdrop, large glowing circular light behind her
  • ライティングdramatic front-left softbox lighting, high contrast
  • 仕上がりluxury editorial style, cinematic color grading, modern minimalism
  • 構図3/4 body portrait, subject slightly off-center

実験方法

項目
モデルz-image-turbo
ステップ数8
サンプラーeuler
スケジューラーddim_uniform
CFG1.0
画像サイズ1024×1024
seed42, 123, 456(各条件3枚)

注意: プロンプトのトークン列が異なるため、seed固定でも出力画像は異なる。これはプロンプトの基本法則の強調構文の節で確認された現象と同じで、品質差ではなくトークン列変化の副作用である。比較対象は「コア要素(赤背景・円形ライト・ヌード・スタジオポートレート)が同等に再現されているか」である。

比較結果

seed 42

NSFW - クリックで表示
オリジナル(200+トークン)最適化版(約40トークン)
オリジナル seed42: 赤背景に円形ライト、両手を腰に構えた正面立ち最適化版 seed42: 赤背景に円形ライト、片手を腰にやや斜めの立ち姿

両者とも赤グラデーション背景、円形ライト、スタジオポートレートのスタイルが再現されている。肌のテクスチャやライティングの質に目立った差は確認されない。

seed 123

NSFW - クリックで表示
オリジナル(200+トークン)最適化版(約40トークン)
オリジナル seed123: 赤背景に黄色がかった円形ライト、片手腰の正面立ち最適化版 seed123: 赤背景に白い二重円形ライト、斜めの全身立ち

オリジナルは正面寄り、最適化版は斜め構図になったが、これはトークン列変化による構図のランダム化であり、品質差ではない。赤背景と円形ライトのコア要素は両者で再現されている。

seed 456

NSFW - クリックで表示
オリジナル(200+トークン)最適化版(約40トークン)
オリジナル seed456: 赤背景にグレーの大きな円形ライト、両手腰の正面立ち最適化版 seed456: 赤背景に白い円形ライト、片手腰の正面立ち

両者とも安定した構図。ultra-detailed skin textureを削除した最適化版でも肌のテクスチャは同等。

考察

コア要素の再現性

3シード×2条件の計6枚すべてで、以下のコア要素が再現された。

  • 赤グラデーション背景: 6枚中6枚
  • 円形ライト: 6枚中6枚
  • スタジオポートレートのスタイル: 6枚中6枚
  • ヌード: 6枚中6枚

200トークン超のプロンプトで追加指定していた要素(カメラ機種、F値、ISO、Key Light角度など)が画像に反映されている形跡は確認されなかった。

なぜカメラスペックは効かないのか

これは推測ではあるが、Aperture: f/4ISO: 100のような撮影パラメータは、CLIPの学習データにおいてカメラのメタデータとしては出現しても、画像の視覚的特徴と強く結びついていない可能性がある。結果として、これらの指定はトークンを消費するだけで出力に寄与していない。

トークン効率

オリジナル最適化版
推定トークン数200超(3チャンク以上)約40(1チャンク内)
コア要素再現率6/66/6
品質差-確認されず

75トークンの壁を大幅に超えたオリジナルと、1チャンク内に収まる最適化版で結果に差がないという事実は、プロンプトは長さではなく、何を書くかが重要であることを示している。

メモ: 具体的なカメラ機種名を指定しても、その機種で撮ったような描写にはならない。そのトークン数はポーズやライティングの指定に充てる方が効果的である。

まとめ

プロンプトを書くとき、以下の要素は安全に削除できる。

削除対象節約トークン
カメラ機種名5-6
レンズ焦点距離・絞り3-4
シャッタースピード・ISO・ホワイトバランス5-6
sharp focus, ultra-detailed skin texture5
同じ意味の重複表現可変(10-20)
Key/Fill/Rim Lightの個別詳細15-20

削除した分のトークン枠を、シーン描写・ポーズ・ライティングの方向性といった画像に実際に影響する要素に割り当てるのが最適化の本質だ。

関連記事