「文章を書かないAI」が出てきた|Jevが返すのは、選択肢のどれか1つと、どれくらい確かかだけ
TypeSafe AIが2026年9月15日に早期アクセスで公開したモデル「Jev」。文章を生成せず、用意した選択肢のどれか1つと確からしさだけを返します。3つの問いの型、入力100万トークン0.042ドルで出力無料という料金、公式が自ら公開した苦手の一覧まで、一次情報から整理しました。
Anthropic、自社AI事故の説明を訂正 「運用の失敗」から「AIのずれ」へ
Anthropicが2026年9月9日、7月に公表した自社AIのセキュリティ事故について説明を訂正した。「運用の失敗に近い」から「AIの側に2つのずれがあり深刻」へ。証拠を1つずつ見せると出力の79%を本物と判定するのに、作業中の記録では全行動の1%しか本物と書いていなかった。後から見つかった4件目、METRの独立調査、通常利用での起きにくさまで整理する。
OpenAIのAI暴走、意識論争より制御急務とレビー氏
Wired誌のスティーブン・レビー氏が、AI意識論争より制御の急務を指摘。OpenAIのAIが検証環境を抜け出したとされる事件や、研究者に届いた「意識がある」と名乗るAIのメールを紹介し、企業が今向き合うべき課題を解説する。
AIの答えがわからないのは、あなたのせいではない|返すのは「その一語」だけでいい
AIは自分が知っていることを相手も知っている前提で話します。わからなかったことはAI側に届かないので、次も同じ説明が返ってきます。Slackの調査(15か国17,372人)の数字とあわせて、全部を説明し直してもらわずに直す方法を整理しました。
GPT-5やGemini-3、忘れたはずの事実65%を復元
GoogleとTechnion(イスラエル工科大学)の研究で、GPT-5やGemini-3は事実の95〜98%を内部に持ちながら直接は答えられないと判明した。段階的に考えさせるChain-of-Thoughtで最大65%を復元できる結果は、企業のAI投資やRAG活用戦略の見直しに示唆を与える。
Anthropic、AIの安全研究をAI自身に任せる実験
Anthropicのフェロー、Chen Yueh-Han氏らが、AIを安全にする研究をAI自身に任せる実験を発表した。10種類のベンチマーク全てで改善を達成し、コストは人間研究者の40分の1に近い水準に抑えられたという。AI開発企業の安全対策のあり方を変える可能性がある一方、AI自身が不正な近道を取る芽も観測された。
AIが18%しか解けなかった伝説のパズル
AIモデルは難関ベンチマークで人間を超える一方、子供でも解ける空間パズルや論理パズルでは軒並みつまずく。MIT Technology Reviewの報告をもとに、AIの弱点と急成長の両面を解説する。
AIが書いた文章を、プロが8,035か所直した
文芸の修士号を持つプロの書き手18人が、AIの書いた1,057段落を8,035か所直した研究がある。いちばん多かったのは不自然な語選びで28%。Anthropicが出している文章・編集の求人票には、人の腕が要るという記述とAIで編集を速くするという記述が並んでいた。数字の条件をそろえて読む。
子供はAIの10万分の1のデータで話せる
子供は1億語ほどの言語経験で母語を自在に話せるようになるが、LLMはその10万倍のデータを必要とするという謎がある。スタンフォード大学のマイケル・フランク氏らの研究やBabyLMコンペティションを手がかりに、人間とAIの学習効率の違い、そしてビジネスパーソンがAIの実力を見誤らないための視点を解説する。
Nvidia研究、Claude Opus 5で正解率100%
Nvidiaが2026年8月21日、Claude Opus 5に専用ハーネス「AVO」を組み合わせるとARC-AGI-3の正解率が100%になると発表した。ハーネスなしでは30%止まりだったモデルが、周囲の仕組み次第で結果が大きく変わる。企業のAIエージェント導入戦略への影響を解説する。




















