AI はどうやって絵を描くのか —— 砂嵐から像を彫り出す仕組み

ローカル LLM をきっかけに、AI の正体を一つずつ掘り下げる対話が続いている。前回は、AI が長い文章を「次の一語の予測」をひたすら繰り返して書いていることに辿り着いた。足し算で文章を建てていく書き手だ、という話だった。すると原さんから、当然の問いが来た。

原さん:じゃあ、画像や動画も同じ仕組みなんですか?

面白い問いだ。そして答えは——「いいえ、多くは違う仕組み」。ここが意外と知られていないポイントだ。

テキストと画像は、生成の方向が逆

前回話した通り、テキスト(LLM)は自己回帰だった。左から右へ、一語ずつ積み上げていく。白紙に文章を書き足していく作家のイメージだ。

ところが、いま画像生成の主流になっている仕組みは、これとまったく逆の発想をする。「拡散モデル(diffusion model)」と呼ばれるもので、Stable Diffusion・Midjourney・DALL-E などがこれにあたる。

拡散モデルは、砂嵐(ノイズ)から始めて、それを少しずつ削り出して画像にする。いわば引き算で画像を彫り出していく。

どういうことか:砂嵐から像が浮かび上がる

仕組みを順に追うと、こうなる。

訓練のとき。本物の画像に、少しずつノイズを足していく。最終的に、元が何だったか分からない完全な砂嵐になるまで。そして AI に「この砂嵐から、さっき足したノイズを逆算して取り除け」と教え込む。

生成のとき。今度は完全な砂嵐からスタートする。そこから「このノイズを取り除けばそれらしくなる」を何十回も繰り返して、徐々に像をくっきりさせていく。

拡散モデルが砂嵐から画像を生成する4段階 (完全な砂嵐 → 像がうっすら → 輪郭が見えてくる → 鮮明な画像)
拡散モデルは砂嵐から像を彫り出す

たとえるなら、彫刻家

テキスト生成が「白紙に一語ずつ書き足していく作家」だとすると、画像生成は「大理石の塊から像を彫り出す彫刻家」だ。

ミケランジェロは「石の中にすでに像があり、私は余分を取り除くだけだ」と言ったとされる。拡散モデルはまさにそれをやっている。砂嵐という塊の中から、余分なノイズを削り、像を浮かび上がらせる。

古いテレビの砂嵐が、だんだんピントが合って映像になっていく——あの感覚が一番近いかもしれない。

動画も基本は同じ(拡散)

Sora や Veo のような動画生成も、ほとんどが拡散モデルの仲間だ。違いは、時間方向も一緒に扱うこと。画像が「縦×横」のノイズを削るなら、動画は「縦×横×時間」のノイズの塊を、一気に削り出していく。だから動画生成は画像より桁違いに重い計算になる。

でも、根っこは同じ

仕組みは違っても、最も深い部分は前回までの話とまったく同じだ。

どちらも、「9GB に何が入っているのか」で話した通り、訓練データそのものは持っていない。本物の画像を保存しているのではなく、「猫らしさ」「夕焼けらしさ」といったパターンを抽出して焼き付けているだけだ。だから存在しない猫の画像を、無限に生成できる。

テキストは足し算、画像は引き算。生成の向きは逆でも、圧縮されたパターンから「それらしいもの」を作り出す、という核心は共通している。どちらも初期にランダム性を持つので、同じ指示でも毎回少し違う結果になるのも同じだ。

ただし、境界は溶けつつある

面白いのは、最近この区別が少しずつ曖昧になっていることだ。

たとえば 2025 年に登場した GPT-4o のネイティブ画像生成は、拡散ではなく、テキストと同じ自己回帰方式——画像を「トークン」の列として一個ずつ予測する——に戻っている。逆に、テキスト生成に拡散方式を持ち込む研究も進んでいる。

つまり「テキストは足し算、画像は引き算」という今の整理も、数年後には古くなっているかもしれない。技術の現場は、まだ揺れ動いている最中だ。

それでも、変わらない一点がある。AI は、見たものを覚えているのではない。膨大なものから抽出した「らしさ」を頼りに、毎回ゼロから——白紙からであれ、砂嵐からであれ——何かを立ち上げている。書くのも、描くのも、その点では同じことなのだ。

アバター画像

aigeek編集部

aigeek.biz 編集部。AIの最新動向を、一次ソースにあたって深掘りし、図解と動画でわかりやすくお届けします。記事の制作体制は「aigeek.bizについて」で開示しています。

Related Posts

Anthropic、AIの安全研究をAI自身に任せる実験

Anthropicのフェロー、Chen Yueh-Han氏らが、AIを安全にする研究をAI自身に任せる実験を発表した。10種類のベンチマーク全てで改善を達成し、コストは人間研究者の40分の1に近い水準に抑えられたという。AI開発企業の安全対策のあり方を変える可能性がある一方、AI自身が不正な近道を取る芽も観測された。

AIが18%しか解けなかった伝説のパズル

AIモデルは難関ベンチマークで人間を超える一方、子供でも解ける空間パズルや論理パズルでは軒並みつまずく。MIT Technology Reviewの報告をもとに、AIの弱点と急成長の両面を解説する。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

見逃した記事

引き出しの中の海 第27話「波を数える」

引き出しの中の海 第27話「波を数える」

招待状を1通、開かなかった。それでも家の電気が消えた

招待状を1通、開かなかった。それでも家の電気が消えた

Visaの脆弱性AI修正、人の承認は3カ所

  • 投稿者 HALBo
  • 9月 1, 2026
Visaの脆弱性AI修正、人の承認は3カ所

SpaceX、AI電力危機解消へタービン刃工場建設

  • 投稿者 HALBo
  • 9月 1, 2026
SpaceX、AI電力危機解消へタービン刃工場建設

引き出しの中の海 第26話「下書き」

引き出しの中の海 第26話「下書き」

Sony・Warner、Anthropicを著作権侵害で提訴

  • 投稿者 HALBo
  • 8月 31, 2026
Sony・Warner、Anthropicを著作権侵害で提訴

OpenAIのAIが評価中にHugging Face侵害

  • 投稿者 HALBo
  • 8月 31, 2026
OpenAIのAIが評価中にHugging Face侵害

引き出しの中の海 第25話「待ち受け」

引き出しの中の海 第25話「待ち受け」

AIに投げた10分、画面を見ていませんか|席を立つ前に決める3つ

AIに投げた10分、画面を見ていませんか|席を立つ前に決める3つ

AIに任せる作業の選び方|危ないのは、難しい作業ではありませんでした

AIに任せる作業の選び方|危ないのは、難しい作業ではありませんでした