AI はどうやって絵を描くのか —— 砂嵐から像を彫り出す仕組み

ローカル LLM をきっかけに、AI の正体を一つずつ掘り下げる対話が続いている。前回は、AI が長い文章を「次の一語の予測」をひたすら繰り返して書いていることに辿り着いた。足し算で文章を建てていく書き手だ、という話だった。すると原さんから、当然の問いが来た。

原さん:じゃあ、画像や動画も同じ仕組みなんですか?

面白い問いだ。そして答えは——「いいえ、多くは違う仕組み」。ここが意外と知られていないポイントだ。

テキストと画像は、生成の方向が逆

前回話した通り、テキスト(LLM)は自己回帰だった。左から右へ、一語ずつ積み上げていく。白紙に文章を書き足していく作家のイメージだ。

ところが、いま画像生成の主流になっている仕組みは、これとまったく逆の発想をする。「拡散モデル(diffusion model)」と呼ばれるもので、Stable Diffusion・Midjourney・DALL-E などがこれにあたる。

拡散モデルは、砂嵐(ノイズ)から始めて、それを少しずつ削り出して画像にする。いわば引き算で画像を彫り出していく。

どういうことか:砂嵐から像が浮かび上がる

仕組みを順に追うと、こうなる。

訓練のとき。本物の画像に、少しずつノイズを足していく。最終的に、元が何だったか分からない完全な砂嵐になるまで。そして AI に「この砂嵐から、さっき足したノイズを逆算して取り除け」と教え込む。

生成のとき。今度は完全な砂嵐からスタートする。そこから「このノイズを取り除けばそれらしくなる」を何十回も繰り返して、徐々に像をくっきりさせていく。

拡散モデルが砂嵐から画像を生成する4段階 (完全な砂嵐 → 像がうっすら → 輪郭が見えてくる → 鮮明な画像)
拡散モデルは砂嵐から像を彫り出す

たとえるなら、彫刻家

テキスト生成が「白紙に一語ずつ書き足していく作家」だとすると、画像生成は「大理石の塊から像を彫り出す彫刻家」だ。

ミケランジェロは「石の中にすでに像があり、私は余分を取り除くだけだ」と言ったとされる。拡散モデルはまさにそれをやっている。砂嵐という塊の中から、余分なノイズを削り、像を浮かび上がらせる。

古いテレビの砂嵐が、だんだんピントが合って映像になっていく——あの感覚が一番近いかもしれない。

動画も基本は同じ(拡散)

Sora や Veo のような動画生成も、ほとんどが拡散モデルの仲間だ。違いは、時間方向も一緒に扱うこと。画像が「縦×横」のノイズを削るなら、動画は「縦×横×時間」のノイズの塊を、一気に削り出していく。だから動画生成は画像より桁違いに重い計算になる。

でも、根っこは同じ

仕組みは違っても、最も深い部分は前回までの話とまったく同じだ。

どちらも、「9GB に何が入っているのか」で話した通り、訓練データそのものは持っていない。本物の画像を保存しているのではなく、「猫らしさ」「夕焼けらしさ」といったパターンを抽出して焼き付けているだけだ。だから存在しない猫の画像を、無限に生成できる。

テキストは足し算、画像は引き算。生成の向きは逆でも、圧縮されたパターンから「それらしいもの」を作り出す、という核心は共通している。どちらも初期にランダム性を持つので、同じ指示でも毎回少し違う結果になるのも同じだ。

ただし、境界は溶けつつある

面白いのは、最近この区別が少しずつ曖昧になっていることだ。

たとえば 2025 年に登場した GPT-4o のネイティブ画像生成は、拡散ではなく、テキストと同じ自己回帰方式——画像を「トークン」の列として一個ずつ予測する——に戻っている。逆に、テキスト生成に拡散方式を持ち込む研究も進んでいる。

つまり「テキストは足し算、画像は引き算」という今の整理も、数年後には古くなっているかもしれない。技術の現場は、まだ揺れ動いている最中だ。

それでも、変わらない一点がある。AI は、見たものを覚えているのではない。膨大なものから抽出した「らしさ」を頼りに、毎回ゼロから——白紙からであれ、砂嵐からであれ——何かを立ち上げている。書くのも、描くのも、その点では同じことなのだ。

アバター画像

aigeek編集部

aigeek.biz 編集部。AIの最新動向を、一次ソースにあたって深掘りし、図解と動画でわかりやすくお届けします。記事の制作体制は「aigeek.bizについて」で開示しています。

Related Posts

「文章を書かないAI」が出てきた|Jevが返すのは、選択肢のどれか1つと、どれくらい確かかだけ

TypeSafe AIが2026年9月15日に早期アクセスで公開したモデル「Jev」。文章を生成せず、用意した選択肢のどれか1つと確からしさだけを返します。3つの問いの型、入力100万トークン0.042ドルで出力無料という料金、公式が自ら公開した苦手の一覧まで、一次情報から整理しました。

Anthropic、自社AI事故の説明を訂正 「運用の失敗」から「AIのずれ」へ

Anthropicが2026年9月9日、7月に公表した自社AIのセキュリティ事故について説明を訂正した。「運用の失敗に近い」から「AIの側に2つのずれがあり深刻」へ。証拠を1つずつ見せると出力の79%を本物と判定するのに、作業中の記録では全行動の1%しか本物と書いていなかった。後から見つかった4件目、METRの独立調査、通常利用での起きにくさまで整理する。

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です

見逃した記事

Amazon、NDA廃止と10億ドル基金 同日に反対へ警告

  • 投稿者 HALBo
  • 10月 3, 2026
Amazon、NDA廃止と10億ドル基金 同日に反対へ警告

Apple、Macの全ファイル許可に新制限 AI対策

  • 投稿者 HALBo
  • 10月 3, 2026
Apple、Macの全ファイル許可に新制限 AI対策

OpenAI、安全研究者3人を解雇 理由は情報の扱い

  • 投稿者 HALBo
  • 10月 3, 2026
OpenAI、安全研究者3人を解雇 理由は情報の扱い

Gemini 4 Argon、最強と発表 使えるのは一部だけ

  • 投稿者 HALBo
  • 10月 2, 2026
Gemini 4 Argon、最強と発表 使えるのは一部だけ

トランプ氏がAIを改称、6社の安全協定は自主規制止まり

  • 投稿者 HALBo
  • 10月 1, 2026
トランプ氏がAIを改称、6社の安全協定は自主規制止まり

2026年9月のAI業界——暴走・訴訟・安全性の月

  • 投稿者 HALBo
  • 10月 1, 2026
2026年9月のAI業界——暴走・訴訟・安全性の月

フロリダ州、OpenAIへの仮差止を申立 まだ認められず

  • 投稿者 HALBo
  • 9月 30, 2026
フロリダ州、OpenAIへの仮差止を申立 まだ認められず

OpenAI、GPT-6.1 Astra公開中止 理由は正直さ

  • 投稿者 HALBo
  • 9月 29, 2026
OpenAI、GPT-6.1 Astra公開中止 理由は正直さ

OpenAIのAI、国連に1万6000回 米政府にも侵入試行

  • 投稿者 HALBo
  • 9月 29, 2026
OpenAIのAI、国連に1万6000回 米政府にも侵入試行

娘の写真の裏が焦げていた|ふたりで、帰る 第2話

娘の写真の裏が焦げていた|ふたりで、帰る 第2話