📑 目次
米国防総省が、AIを使った嘘発見器の改良に今後5年で3,030万ドルを充てる予算を要求している。MIT Technology Reviewが2026年9月25日に報じた。計画名は「Polygraph+」だ。予算書の詳細は、Inside Defenseが先に報じたという(MIT Technology Reviewによる)。米国ポリグラフ協会は、この検査の精度を80〜94%と主張している。高そうに聞こえるが、検査を受ける人数が国防総省の規模になると見え方が変わる。2003年の米国の報告書は、精度がそれなりに高い検査でも、不合格者のほとんどが無実になる計算例を示していた。AIを足すと何が変わるのかを、専門家の指摘とあわせて見る。
国防総省のAI嘘発見器「Polygraph+」の中身
予算は5年で3,030万ドルだ。内訳はThe Next Webによれば、2027年度が642万ドルで、その後2031年まで年565万〜645万ドルとなる(The Next Web)。議会はまだ承認していない。
実施するのは国防防諜・保安局(Defense Counterintelligence and Security Agency、DCSA)だ。連邦政府の身元調査を担う機関である。予算書の目的は、連邦政府のポリグラフ技術の近代化だ。ポリグラフとは、1920年代に発明された嘘発見器で、体に機器を付け、質問に答える間の生理的な反応を記録する。MIT Technology Reviewによると、米国の連邦政府は職員の審査で毎年数万件の検査を行っている。
The Next Webによると、予算書はAIと機械学習による採点、自動採点と判断支援のツールを挙げ、ソフトを磨くためのクラウド保存とデータ分析のツールも計画している。加えて「スタンドオフ・センシング」がある。体に機器を付けずに生理的な反応を読み取る能力のことだ。MIT Technology Reviewは、どの技術を使うかはまだ明らかでないと書く。
国防イノベーションユニットは2023年に、2社の試作を選んでいた。Presage Technologiesは普通のカメラで心拍数と呼吸数を測れると主張しており、Altec Researchの試作品は、国防イノベーションユニットが公開した画面では頭の動き、顔の皮膚温度、毛穴の活動を追っている。今回の予算との関係は、報道からは分からない。
時期の背景:リーク捜査でポリグラフが増えている
MIT Technology Reviewによると、Pete Hegseth国防長官の下で、国防総省は、報道機関へのリークとされるものの出どころを探すために、ポリグラフ検査を以前より多く使うようになった。この動きは国防総省内の緊張が高い時期に出てきた、とも書く。法学教授のMarion Oswald氏は、現政権のリークや忠誠心の欠如への懸念への対応のように強く見える、と述べている。
MIT Technology Reviewによると、9月にニューヨーク・タイムズが、イランとの戦争で米国の兵器備蓄が減っているという報道のあとに、統合参謀本部(Joint Staff)の将校約50人がポリグラフ検査を受けたと報じた。ニューヨーク・タイムズの原典は確認していない。本サイトでは、米軍のAIが出した誤りが報告書になった件も扱った。
「精度80〜94%」の落とし穴:科学アカデミー報告の1万人の例
MIT Technology Reviewは、米国ポリグラフ協会が「ポリグラフの精度は80〜94%」と主張していると書く。この割合が何を指すのかは、記事では定義されていない。本記事は「協会が主張する精度」と呼ぶ。
記事はこれに対し、2003年の全米研究評議会(NRC)の報告書が、この水準の精度のスクリーニング検査でも多くの間違いが出うると指摘した、と書く(MIT Technology Reviewの言い換えで、報告書の逐語ではない)。スクリーニングとは、問題のある人が含まれているかもしれない集団を、全員まとめて検査することだ。
もう1つ、人数の問題がある。国防総省は280万人を雇っている。MIT Technology Reviewの記者Amit Katwala氏は、不完全な仕組みをその規模で使えば、数万人を誤って疑うことになりうると書いた。これは記者の見立てで、国防総省や専門家の予測ではない。280万人全員が検査を受けると決まったわけでもない。
なぜ間違いが多くなるのか。NRC報告書の仮の計算例が示している(National Academies Press)。連邦機関が職員1万人を検査し、うち10人がスパイで、スパイは検査への対策(ごまかしの訓練)を使わないと仮定する。
まず、スパイの8割、つまり10人中8人を見つける設定にした場合だ。この設定だと、無実の人9,990人のうち1,598人も不合格になる。不合格者は合計で約1,600人になり、その大半が無実の人だ。スパイ2人は見逃される。
次に、無実の人の不合格を39人(約40人)に抑える設定にした場合だ。今度はスパイ10人のうち8人が見逃され、見つかるのは2人になる。
NRC報告書は、この2つの設定のどちらも受け入れられないとし、職員のスクリーニングにポリグラフを頼ることを正当化できる正確さではないと結論した。報告書をまとめた委員会の委員長Stephen Fienberg氏は、発表時に「National security is too important to be left to such a blunt instrument.(国家安全保障は、そのような鈍い道具に任せるには重要すぎる)」と述べた(National Academiesのニュースリリース)。一方で報告書は、ごまかしの訓練を受けていない被験者に対する特定の事件の検査なら、嘘と本当を「偶然よりずっと高いが、完璧にはほど遠い」水準で見分けられると書く。ただし、その研究結果をスクリーニングに当てはめることは正当化できないとも書いている。
ただし、この例は条件つきの仮の話で、従来のポリグラフについてのものだ。報告書の要旨は、この例がポリグラフに見込める以上の精度を仮定していると断っている。AIの数字ではないし、280万人にそのまま当てはめた数字でもない。例が示すのは構造だ。スパイがごく少数で、ほとんどが無実の集団を検査すると、不合格になる人のほとんどは無実になる。協会の精度80〜94%がこの例の設定と同じ意味かは、MIT Technology Reviewの記事から確認できない。
AIにすると何が変わるのか:専門家3人の見方
ノーサンブリア大学の法学者Kyri Kotsoglou氏は、この取り組みを「misguided(誤った試み)」と評した。AIをポリグラフに足すことは「the worst of both worlds」だとも述べた(MIT Technology Review。The Next Webも引用)。MIT Technology Reviewによれば、理由は、AIが生理データの新しいパターンを見つけても、それが嘘と結びつくかを確かめる「正解」(ground truth)がなく、妥当性のなさ(invalidity)の上に不確実性を足すだけだから、という。
MIT Technology Reviewは、AIが複数の測定値を組み合わせて、ごまかしにくい1つの「嘘の点数」を出す使い方が増えそうだと書く。エラスムス大学の准教授Sophie van der Zee氏は、生理的なストレス、頭の負荷、嘘を隠そうとする努力の3方向から測る方法を組み合わせるほど成功しやすい、と述べた。そのうえで「There is still no Pinocchio’s nose.」とも語った。誰にでも、いつでも当てはまる嘘の目印は、まだ見つかっていないという意味だ。
法学教授のMarion Oswald氏は、こう述べている。「Even if you have all the records in the world from polygraph tests, you don’t know whether those polygraph tests are right or not.」訳すと、ポリグラフ検査の記録が世界中に全部あっても、その検査が正しかったのかは分からない、となる。MIT Technology Reviewによれば、Oswald氏は、新しい嘘発見技術もポリグラフと同じように、科学的な道具というより心理的な小道具(psychological prop)として使われることを懸念している。
AIが理論上はポリグラフを改善しうるという見方も紹介されている。試験官が見つけられないデータのパターンをAIが見つけられれば、という条件つきだ(MIT Technology Review)。ただし、本記事が参照した範囲では、AIにすれば先ほどの1万人の例のような構造が変わるのかに答えた発言は見当たらない。
議会は未承認、DCSAは詳細に回答せず
議会はまだ承認していない。DCSAは、MIT Technology Reviewの詳細の問い合わせに回答しなかった。本記事が参照した範囲では、採点の方法や、誤りをどこまで許容するのかといった基準は示されていない。
米軍にAIを入れる動きは、トランプ氏が語ったAIフォース構想の記事でも扱った。
自社の検査にAI採点が入るとき、読者が確かめておくこと
ここからは事実ではなく筆者の助言だ。AIが点数をつける検査は、採用や人事、セキュリティの分野で企業にも売り込まれうる。導入の話が来たら、まず精度を人数で言い換えてもらいたい。検査を受ける人が1万人で本当に問題のある人が10人なら、何人が誤って疑われ、何人が見逃されるのか。人数で並べると見え方が変わる。
次に、結果が正しかったかをどう確かめているのかを聞く。Oswald氏の発言のとおり、記録が大量にあっても、記録だけでは検査が正しかったか分からない。最後に、不合格や要注意と出た人への手順を導入前に決めておく。点数だけで人事上の扱いを決めない、といった運用だ。
まとめ
国防総省の要求はまだ議会の承認前で、DCSAは詳細を明かしていない。精度80〜94%という数字は、検査を受ける人数と、本当に問題のある人の割合を添えて初めて意味を持つ。AIの採点が身近な検査に入るときは、何人が誤って疑われるのかを尋ねたい。
参考・出典
- MIT Technology Review「The Pentagon wants $30 million to build an AI-powered lie detector」(2026年9月25日・Amit Katwala)
- The Next Web「Pentagon seeks $30.3m for an AI lie detector that reads the body from afar」(2026年9月25日)
- 全米研究評議会「The Polygraph and Lie Detection」(2003年)
- National Academies ニュースリリース:Polygraph Testing Too Flawed for Security Screening(2003年)















