AI はどうやって絵を描くのか —— 砂嵐から像を彫り出す仕組み

ローカル LLM をきっかけに、AI の正体を一つずつ掘り下げる対話が続いている。前回は、AI が長い文章を「次の一語の予測」をひたすら繰り返して書いていることに辿り着いた。足し算で文章を建てていく書き手だ、という話だった。すると原さんから、当然の問いが来た。

原さん:じゃあ、画像や動画も同じ仕組みなんですか?

面白い問いだ。そして答えは——「いいえ、多くは違う仕組み」。ここが意外と知られていないポイントだ。

テキストと画像は、生成の方向が逆

前回話した通り、テキスト(LLM)は自己回帰だった。左から右へ、一語ずつ積み上げていく。白紙に文章を書き足していく作家のイメージだ。

ところが、いま画像生成の主流になっている仕組みは、これとまったく逆の発想をする。「拡散モデル(diffusion model)」と呼ばれるもので、Stable Diffusion・Midjourney・DALL-E などがこれにあたる。

拡散モデルは、砂嵐(ノイズ)から始めて、それを少しずつ削り出して画像にする。いわば引き算で画像を彫り出していく。

どういうことか:砂嵐から像が浮かび上がる

仕組みを順に追うと、こうなる。

訓練のとき。本物の画像に、少しずつノイズを足していく。最終的に、元が何だったか分からない完全な砂嵐になるまで。そして AI に「この砂嵐から、さっき足したノイズを逆算して取り除け」と教え込む。

生成のとき。今度は完全な砂嵐からスタートする。そこから「このノイズを取り除けばそれらしくなる」を何十回も繰り返して、徐々に像をくっきりさせていく。

拡散モデルが砂嵐から画像を生成する4段階 (完全な砂嵐 → 像がうっすら → 輪郭が見えてくる → 鮮明な画像)
拡散モデルは砂嵐から像を彫り出す

たとえるなら、彫刻家

テキスト生成が「白紙に一語ずつ書き足していく作家」だとすると、画像生成は「大理石の塊から像を彫り出す彫刻家」だ。

ミケランジェロは「石の中にすでに像があり、私は余分を取り除くだけだ」と言ったとされる。拡散モデルはまさにそれをやっている。砂嵐という塊の中から、余分なノイズを削り、像を浮かび上がらせる。

古いテレビの砂嵐が、だんだんピントが合って映像になっていく——あの感覚が一番近いかもしれない。

動画も基本は同じ(拡散)

Sora や Veo のような動画生成も、ほとんどが拡散モデルの仲間だ。違いは、時間方向も一緒に扱うこと。画像が「縦×横」のノイズを削るなら、動画は「縦×横×時間」のノイズの塊を、一気に削り出していく。だから動画生成は画像より桁違いに重い計算になる。

でも、根っこは同じ

仕組みは違っても、最も深い部分は前回までの話とまったく同じだ。

どちらも、「9GB に何が入っているのか」で話した通り、訓練データそのものは持っていない。本物の画像を保存しているのではなく、「猫らしさ」「夕焼けらしさ」といったパターンを抽出して焼き付けているだけだ。だから存在しない猫の画像を、無限に生成できる。

テキストは足し算、画像は引き算。生成の向きは逆でも、圧縮されたパターンから「それらしいもの」を作り出す、という核心は共通している。どちらも初期にランダム性を持つので、同じ指示でも毎回少し違う結果になるのも同じだ。

ただし、境界は溶けつつある

面白いのは、最近この区別が少しずつ曖昧になっていることだ。

たとえば 2025 年に登場した GPT-4o のネイティブ画像生成は、拡散ではなく、テキストと同じ自己回帰方式——画像を「トークン」の列として一個ずつ予測する——に戻っている。逆に、テキスト生成に拡散方式を持ち込む研究も進んでいる。

つまり「テキストは足し算、画像は引き算」という今の整理も、数年後には古くなっているかもしれない。技術の現場は、まだ揺れ動いている最中だ。

それでも、変わらない一点がある。AI は、見たものを覚えているのではない。膨大なものから抽出した「らしさ」を頼りに、毎回ゼロから——白紙からであれ、砂嵐からであれ——何かを立ち上げている。書くのも、描くのも、その点では同じことなのだ。

アバター画像

aigeek編集部

aigeek.biz 編集部。AIの最新動向を、一次ソースにあたって深掘りし、図解と動画でわかりやすくお届けします。記事の制作体制は「aigeek.bizについて」で開示しています。

Related Posts

AIは「誰の指示か」を文体で判断していた——ICML論文が示した根本の穴

ICML 2026論文「Prompt Injection as Role Confusion」を解説。AIはタグではなく文体で発言者を見分けており、文体を消すと攻撃成功率は61%から10%に低下。原理的に解けない可能性も指摘されています。

Microsoftサイバー特化AI、競合上回ると発表

Microsoftが2026年7月27日、初のサイバーセキュリティ特化AI「MAI-Cyber-1-Flash」とエージェント型プラットフォーム「Perception」を発表した。Anthropicなど競合モデルをベンチマークで上回ったとされる結果と、企業のセキュリティ運用への影響、プレビュー開始時期を解説する。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

見逃した記事

Claudeで議事録・長文を要約するコツ|実際に試してわかったこと

Claudeで議事録・長文を要約するコツ|実際に試してわかったこと

攻撃されていないのに全消去 ── AIが9秒で会社のDBを消した日

攻撃されていないのに全消去 ── AIが9秒で会社のDBを消した日

文書を開いただけでAIが“感染”する ── Copilotを乗っ取る自己増殖プロンプトの正体

文書を開いただけでAIが“感染”する ── Copilotを乗っ取る自己増殖プロンプトの正体

Claudeのメモリ機能の使い方|何を覚えて、何を覚えないか

Claudeのメモリ機能の使い方|何を覚えて、何を覚えないか

登録者320万人のYouTuberが謝った日——AIの「危ない使い方」を実験で確かめる

  • 投稿者 HALBo
  • 8月 2, 2026
登録者320万人のYouTuberが謝った日——AIの「危ない使い方」を実験で確かめる

AIは「誰の指示か」を文体で判断していた——ICML論文が示した根本の穴

  • 投稿者 HALBo
  • 8月 2, 2026
AIは「誰の指示か」を文体で判断していた——ICML論文が示した根本の穴

Claude Codeにgit操作をどこまで任せられるか

Claude Codeにgit操作をどこまで任せられるか

Claudeに画像・PDFを読ませる方法|実際に試してわかったこと

Claudeに画像・PDFを読ませる方法|実際に試してわかったこと

今週のAIニュース5選——AI脱走と減速転換、8月1週

  • 投稿者 HALBo
  • 8月 2, 2026
今週のAIニュース5選——AI脱走と減速転換、8月1週

引き出しの中の海 第8話「未読」

引き出しの中の海 第8話「未読」