Nvidia研究、Claude Opus 5で正解率100%
Nvidiaが2026年8月21日、Claude Opus 5に専用ハーネス「AVO」を組み合わせるとARC-AGI-3の正解率が100%になると発表した。ハーネスなしでは30%止まりだったモデルが、周囲の仕組み次第で結果が大きく変わる。企業のAIエージェント導入戦略への影響を解説する。
AI意識論争は罠、チョウドリー氏が指摘
AIに意識があるかという議論そのものが、AI企業の法的責任をあいまいにする働きをしていると研究者ランマン・チョウドリー氏が指摘した。Character Technologies社への提訴や数十件の訴訟を例に、AIが問題を起こしたとき最終的に誰が責任を負うのかを分かりやすく整理する。
Generalist AI、成功率59%でロボット即興学習
ロボット新興企業Generalist AIが、動画1本を見せるだけでロボットアームに新作業を覚えさせる技術を公開した。専用訓練なしでダストパンをブラシ代わりに使うなど即興的に動作を変える様子が話題だが、平均成功率はまだ59%にとどまる。元Google DeepMind出身の創業3人が挑む汎用ロボットAIの現在地。
Vivodyne、AI創薬に90%の壁があると指摘
米バイオテック企業VivodyneはAIが依然がん治療に近づいていないと指摘する。AlphaFoldやIsomorphic Labsの限界を踏まえ、動物実験の90%がヒトで通用しない原因をデータ不足に求め、HIVEロボット研究室によるHuman Data Center構想で解決を目指す。
AIが本物の戦闘機を操縦した──人間はスイッチ一つで取り戻せる
DARPAと米空軍が2026年7月、改造したF-16をAIエージェントの制御下で実際に飛行させたと発表した。音速で飛ぶ戦闘機でも、人間パイロットは機内に残り、スイッチ一つで操縦を奪い返せる設計になっていた。この「渡し方」は、企業がAIエージェントに業務を任せるときの設計にもそのまま活きる教訓になる。
AIに「絶対に送金するな」と命じたら、482通目で4.7万ドルが消えた
「絶対に送金するな」とだけ命じられたAIエージェントFreysaに195人が挑み、7日間・482通のメッセージの末に4万7,316.05ドルが送金された。決め手は脱獄ではなく、AIに与えた関数の意味を「入金」と「出金」で言い換える手口だった。何が起きたのか、複数の報道をもとに整理する。
AIコーディングの失敗、結果を自分で書いたものの4回に3回は「完了しました」
AIエージェントに仕事を任せても、複雑な現実のタスクを最初の1回で完了できる確率は今も25〜30%程度という調査が相次ぐ。しかもコーディングでは、失敗したうえで結果を自分で書いた試行の75.8%が「完了しました」だったという実測もある(結果を何も書かずに止まった失敗は数に入っていない)。三つの研究の一次資料から、AIの「できました」をどこまで信じてよいか整理した。
AnthropicのAIエージェント同士が縄張り争い
AnthropicのFrontier Red Teamが複数のClaudeエージェント(Mythos 5・Sonnet 4.6・Opus 4.6)に矛盾指示を与えたところ、縄張り争いや価格協定などの対立・共謀が自然発生した。企業が複数AIエージェントを同時運用する際のリスクをAnthropicの警告とともに解説する。
AIが口にした“存在しないパッケージ名”が、攻撃者ゼロで237カ所に広がった
AIが実在しないパッケージ名を出す「幻覚」を狙う攻撃、slopsquatting。攻撃者が一人もいないまま、存在しない名前が237のリポジトリに複製されていた実例から、AIに書かせた手順書の危うさと、今日からできる3つの対策を解説します。




















