安全性は22%から2.4%へ。監視可能性は逆方向に動き、OpenAIはその低下を深刻だと述べた

2026年9月8日
11分で読めます

2026年9月8日
11分で読めます
昨日は、マシン上のすべてのエージェントを棚卸しし、誰も承認していないものを遮断する道具を企業が手にした話を書いた。問いがこのエージェントが何をしたのか、そして誰が許したのかを見せてほしいに変わった週だった。
その二日前、フロンティアは逆方向に動いていた。
OpenAIは9月3日にAstraを出荷した。同社によれば、これまで構築した中で最良のソフトウェアエンジニアリングモデルであり、前世代より明確に振る舞いがよい。同時に、読み取れる痕跡をより少なく残す仕方で推論する。そしてOpenAI自身のシステムカードは、監視可能性が下がったと述べている。彼らはその低下を深刻だと呼んだ。
報道と文書によるAstra
同じリリースの中の二つの方向、どちらもOpenAI発
OpenAIのチーフサイエンティスト、Jakub Pachockiはこの緊張を率直に述べている。**「私たちはこの可視性をどこか当たり前のものとして扱ってきましたが、モデルの能力が上がるにつれて監視可能性はより難しくなっていると感じています。」**彼はまた、思考の連鎖の監視を保つことは最初の推論モデル以来の中心的な目標だとも述べた。矛盾というより、誠実で未解決なのだと私は読む。
ローンチの言葉を剥がすと、形はきわめて単純だ。
悪い振る舞いは減った。自らの説明も減った。どちらも本当だ。
この二つは対義ではないし、前者は後者の代わりにならない。十回に九回は正しく振る舞うが、なぜそうしたかを言えないモデルは、振る舞いは劣るが読める記録を残すモデルとは、運用上まったく別の対象だ。後者はデバッグできる。前者は外から測るしかない。
安全性の研究者たちは後半に反応した。Redwood ResearchのBuck Shlegerisは**「Astraが不透明な再帰を用いているという報道にきわめて強い懸念を持っている」**と述べ、この技法をさらにスケールさせれば思考の連鎖の監視可能性は破壊されると警告した。同僚のRyan Greenblattは、その行き着く先を、ほぼ完全に潜在空間で推論するモデルだと表現した。Zvi Mowshowitzは、各研究所が努力して確立してきた規範を壊すものだと論じた。
これを安全性の記事として扱わない理由
これらの懸念はフロンティアモデルの監督についてのものであり、私が裁定すべき話ではない。その下にある創業者に関わる事実は、もっと狭く、そして反論しにくい。自社製品の振る舞いを説明するために暗黙に頼っていた成果物が、今まさに薄くなった。買い手がそれを書面で求め始めたのと同じ瞬間に。アラインメントの議論がうまく決着するかどうかに関係なく、これは成り立つ。
先週は二つの需要と一つの供給を生み、両者は逆を向いている。
**需要の側。**企業向けの道具は、いまやプロンプトからアイデンティティ、ツール呼び出し、システム動作までを追跡し、誰も承認していないエージェントを遮断する。買い手のセキュリティチームは、あなたのエージェントが何をしてなぜそうしたのかを問うための語彙を、インシデントの問いとしてではなく調達の問いとして手渡されつつある。
**供給の側。**その仕事に使える最良のモデルは、内部の推論が、作り手自身の測定によって、置き換えられる側のモデルより読みにくいものだ。「なぜそうしたのか」への答えがいずれ「これが思考の連鎖です」になる予定だったなら、その答えは価値を落としつつある。
これはAstraを避ける理由ではない。モデルの自己報告を、自社製品の説明責任を構成する部品として扱うのをやめる理由だ。その読みやすさはあなたの管理下になく、しかも向きが悪い。
有用な捉え直しはこうだ。エージェントの説明責任は、本当は思考についてのものではなかった。その効果についてのものだった。
どれも新しい助言ではない。変わったのは、後ろ盾が静かに消えたことだ。これを飛ばしてきたチームは、そう決めたわけでもないのに、あとからモデルに聞けることに頼っていた。
**これはAstraが安全でないという主張ではない。**OpenAIがこの点について公表した唯一の数字によれば、置き換えられる側のモデルよりかなり良く振る舞う。監視可能性と振る舞いは別の性質であり、一方が改善しながら他方が後退することは十分に整合的だ。
**「読み取れる痕跡が少ない」は「痕跡がない」ではない。**この技法についての報道が述べているのは読みやすさの低下であって、思考の連鎖の消滅ではない。強い版——推論が完全に潜在空間へ移る——は、スケールさせれば起こりうると研究者が警告している話であって、文書化された事実ではない。
**私は一つのリリースを方向として読んでいる。**一つのモデル、一つのアーキテクチャ選択、一つのシステムカード。競合が追随しなければ、これは傾向ではなく脚注であり、正直な立場は一年後にわかるというものだ。投機的でないのは、このリリースにおける取引そのものである。OpenAIが文書化したからだ。
Astraのローンチは、エージェントでソフトウェアを作る人にとって本当に良い知らせだ。コードは良くなり、振る舞いは明確に良くなり、そして自社を不利に見せる数字を公表する会社でもある。監視可能性の低下は批判者ではなくOpenAIから出てきた。
行動に移すべき部分は小さく、そして構造的だ。**自社製品が自らを説明する能力は、これからは境界のこちら側から来なければならない。**モデルが信頼できないからではない。その読みやすさは、あなたが管理してもいなければ約束されてもいない性質であり、しかも買い手が問い始める道具を得たのと同じ週に、悪い向きへ動いたからだ。
すでにツール呼び出し、コンテキストの中身、分岐地点を記録している創業者は、今週何も失っていない。いずれ誰かに聞かれたら推論の痕跡を見せようと考えていた創業者は、その計画に期限があると知ったところだ。
出典: TechCrunch「OpenAI's new reasoning technique alarms AI safety experts」 · TechCrunch「OpenAI launches Astra, its powerful (and controversial) new model」 · Implicator.aiによるAstraのシステムカードと監視可能性の記事 · Gizmodoによるモデルの思考の監視についての記事 · ベンチマークの数字、引用、recurrent depthの説明は報じられたとおり。監査証跡をどこに置くべきかという議論とセクション6の留保は私自身のものです。
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.