「9GBに何が入っているのか」—— ローカルLLMを動かして気づいた、AIの正体

最近よく耳にする「ローカルLLM」というやつを、自分のパソコンで動かしてみることにした。NousCoder-14Bという、コーディングに強いとされるオープンソースのモデルだ。

ダウンロードはあっけなかった。9GB足らず。スマホで撮った動画が一本でこのくらいになることもある。それくらいのサイズだ。

それなのに、立ち上げてみると、世界中のプログラミング言語を操り、企業名を答え、私の質問に答えてくれる。

「これだけのものが、たった9GBに入っているのか?」

そう感じた瞬間が、今日の私にとって一番の発見につながった。備忘録として、Claudeとのやりとりをそのままに近い形で書き残しておく。

第一の疑問

:LLMのセットアップはあっという間に終わったんですけど、データをダウンロードしてた時間からしても、大したデータ量じゃないですよね。これって、学習したデータが全部アルゴリズムに吸収されていて、アルゴリズムの中から学習したデータが取り出されている状態になっているということなんですかね?

Claude:その直感、核心を突いています。ただ「学習したデータが取り出されている」という表現には、少し修正が必要です。正確には、学習データそのものは保存されていない。データから抽出された「パターン」や「規則性」が、140億個の数値(パラメータ)に焼き付けられた状態なんです。

:データを持っていない?

Claude:持っていないんです。これがLLMの一番不思議な性質です。

数字で見ると衝撃的だった

Claudeは具体的な数字を出してくれた。

NousCoder-14Bの中身は 140億個のパラメータ。Q4量子化という圧縮後のファイルサイズは 約9GB。一方、このモデルが学んだ訓練データは、推定で10兆トークン超——数十テラバイト規模のテキスト。

つまり、数十テラバイトの知識が、9ギガに「凝縮」されているように見える。でも正確には、圧縮ではなく抽出だとClaudeは言う。

料理人のたとえ

私がうまく飲み込めずにいると、Claudeはこんなたとえを使ってくれた。

プロの料理人は、人生で1万種類の料理を食べ、5,000種類を作ってきた。でも彼の脳内に、「レシピ集5,000ページ」が保存されているわけではない。

代わりに彼の脳内にあるのは、こういうパターンだ。「酸味と脂は合う」「玉ねぎは飴色に炒めると甘くなる」「魚は加熱しすぎると硬くなる」。これらを組み合わせて、初見の食材からも新しい料理を作れる。

LLMもまったく同じなのだという。「Pythonでフィボナッチ数列を書いて」と頼まれたとき、モデルは訓練データから該当コードを検索しているのではなく、訓練で学んだ「Python構文のパターン」「フィボナッチのアルゴリズムパターン」を組み合わせて生成している。

私の中で、何かがすっと腑に落ちた。

だから起きる、不思議な現象

この性質を理解すると、普段感じていた「AIあるある」が、説明できるようになる。

ハルシネーション(もっともらしい嘘)。モデルは事実をデータベースとして保存していないので、「もっともらしいパターン」を生成してしまう。実在しない論文や関数を堂々と出してくることがあるのは、検索ではなくパターン生成だから。

同じ質問で違う答えが返ってくる。データを参照しているのではなく、確率的に次の単語を選んで生成しているので、毎回少し違う答えになる。

訓練データから完全に消えた知識もある。よく出てくる情報(Python標準ライブラリの使い方など)は強く焼き付くが、訓練データに一度しか出てこなかった情報は、ほぼ完全に失われている。

これらは「バグ」ではなく、LLMの「仕様」なのだ。

第二の気づき

ここで私の頭に、もう一段深い疑問が浮かんできた。

:じゃあ、いろいろな会社の名前やプログラムコードも、蒸留されたアルゴリズムから再び生成されているってことでしょ?

Claude:その通りです。そしてこれがLLMを巡る、最大の倫理的・法的論争の核心でもあります。

GitHub Copilotが、GPLライセンスのコードを「学習データの再生」として吐き出してしまう問題。ニューヨーク・タイムズの過去記事が、特定のプロンプトで逐語的に再現されてしまった事件。Getty Imagesの透かしロゴが、AI生成画像にうっすら残っていた発見。

これらはすべて、LLMが「データを保存していない」と説明されながらも、訓練データの痕跡を確かに保持していることの証拠なのだという。完全な創造でもなく、完全なコピーでもない、その中間にある何か。200年の歴史を持つ著作権法が、想定していなかった状態。

感動の正体

これは、私にとって今日いちばんの発見だった。

普段ChatGPTやClaudeを使っていて、当たり前のように「何でも答えてくれる存在」として接していた。でも、9GBのファイルを自分のPCにダウンロードして、それが立ち上がる瞬間を見て、初めて立ち止まって考えた。

「これの中には、何が入っているのか?」

答えは、何も入っていなかった。正確には、データそのものは入っていなかった。入っていたのは、人類が書いた膨大なテキストから「蒸留」された、パターンのエッセンスだった。

それはある意味で、人間の「経験」に近いのかもしれない。私たちも、読んだ本の文字列を一字一句覚えているわけじゃない。でも、そこから抽出した「考え方」「言い回し」「世界の捉え方」が、自分の話し方や行動に滲み出る。

LLMもまた、そういう存在なのかもしれない。人類の書いてきた膨大なテキストを読み尽くして、そのパターンを身体化した、9GBの語り部。

クラウド越しに使っているだけでは、見えてこない景色だった。

今日学んだことの整理

LLMは訓練データを「保存」していない。訓練データから抽出された「パターン」を、140億個の数値に焼き付けている。だから、思ったより小さなファイルで動く。推論時には、そのパターンを組み合わせて、その場で生成している。企業名やコードも、検索ではなくパターン生成として出てくる。ただし、よく出てきたものは「丸暗記」に近い状態で再生されることもある。これが著作権を巡る論争の核心になっている。

ローカルLLMを動かすこと自体は、ただの技術的な遊びだ。でも、その9GBのファイルを手元に置いて初めて、AIというものが何なのか、少しだけ手触りを持って分かったような気がする。

アバター画像

aigeek編集部

aigeek.biz 編集部。AIの最新動向を、一次ソースにあたって深掘りし、図解と動画でわかりやすくお届けします。記事の制作体制は「aigeek.bizについて」で開示しています。

Related Posts

登録者320万人のYouTuberが謝った日——AIの「危ない使い方」を実験で確かめる

登録者320万人のハンク・グリーン氏がAI依存を謝罪。BCGのコンサルタント758名のランダム化比較試験では、AIが苦手な仕事で正答率が19ポイント低下しました。危ない使い方5つを、因果と相関を分けて整理します。

AIは「誰の指示か」を文体で判断していた——ICML論文が示した根本の穴

ICML 2026論文「Prompt Injection as Role Confusion」を解説。AIはタグではなく文体で発言者を見分けており、文体を消すと攻撃成功率は61%から10%に低下。原理的に解けない可能性も指摘されています。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

見逃した記事

Claudeで議事録・長文を要約するコツ|実際に試してわかったこと

Claudeで議事録・長文を要約するコツ|実際に試してわかったこと

攻撃されていないのに全消去 ── AIが9秒で会社のDBを消した日

攻撃されていないのに全消去 ── AIが9秒で会社のDBを消した日

文書を開いただけでAIが“感染”する ── Copilotを乗っ取る自己増殖プロンプトの正体

文書を開いただけでAIが“感染”する ── Copilotを乗っ取る自己増殖プロンプトの正体

Claudeのメモリ機能の使い方|何を覚えて、何を覚えないか

Claudeのメモリ機能の使い方|何を覚えて、何を覚えないか

登録者320万人のYouTuberが謝った日——AIの「危ない使い方」を実験で確かめる

  • 投稿者 HALBo
  • 8月 2, 2026
登録者320万人のYouTuberが謝った日——AIの「危ない使い方」を実験で確かめる

AIは「誰の指示か」を文体で判断していた——ICML論文が示した根本の穴

  • 投稿者 HALBo
  • 8月 2, 2026
AIは「誰の指示か」を文体で判断していた——ICML論文が示した根本の穴

Claude Codeにgit操作をどこまで任せられるか

Claude Codeにgit操作をどこまで任せられるか

Claudeに画像・PDFを読ませる方法|実際に試してわかったこと

Claudeに画像・PDFを読ませる方法|実際に試してわかったこと

今週のAIニュース5選——AI脱走と減速転換、8月1週

  • 投稿者 HALBo
  • 8月 2, 2026
今週のAIニュース5選——AI脱走と減速転換、8月1週

引き出しの中の海 第8話「未読」

引き出しの中の海 第8話「未読」