OpenAIとAnthropicにおける再帰的自己改善(RSI) · 第1節(全9節)
1. RSIが意味しなければならないこと
「OpenAIとAnthropicは2026年12月から2027年3月の間に再帰的自己改善 (RSI) に到達する」という命題は、「再帰的自己改善」の意味が確定されるまで評価できない。この用語はラボの発信と文献において少なくとも5つの異なる意味で使われており、タイムラインの主張の信憑性はそれらの間で桁違いに変わる。この議論で最も頻繁に見られる修辞上の手口は、定義のすり替えである。「AIが我々のコードの大半を書く」「AIがAI研究を自動化する」「AIが人間なしに後継モデルを設計する」の間を、あたかも単一の主張であるかのように滑らかに移動する。
概念そのものはI.J. Goodに由来する。「超知能機械を、どれほど賢い人間であれ、そのあらゆる知的活動をはるかに凌駕できる機械と定義しよう。機械の設計はそうした知的活動の一つであるから、超知能機械はさらに優れた機械を設計できる。そのとき疑いなく『知能爆発』が起こるだろう」[Good, 1965]。Goodの定式化には本質的な再帰が含まれている。機械が機械を生み出す過程を改善するため、利得が複利的に積み上がる。
5段階のはしご
本報告書のタイムラインに関する主張はすべて、段階ごとに評価する。各段階は互換ではなく、ある段階の証拠は次の段階の証拠にはならない。
段階1:ラボにおけるAI支援コーディング。 人間が指示し、AIがコードを書く。2026年時点で検証済みかつ飽和している。
段階2:数時間規模の自律的エンジニアリング。 エージェントが、範囲の明確に限定されたソフトウェアまたはMLエンジニアリングのタスクを、限られた介入のもと、人間と同等の信頼性で最初から最後まで完了する。部分的に検証済みであり、測定手段には異論がある(第3節)。
段階3:実際のアルゴリズム上の利得をもたらす新規の研究アイデアの自律的な生成と検証。 エージェントが実装だけでなくアイデアそのものを選び、有能な人間の研究者が実質的な貢献と認めるような利得を生み出す。弱く、狭い範囲で検証済み。
段階4:閉じたループ。 AIが生み出した利得が、次のAI開発サイクルの所要時間を測定可能なかたちで短縮する。すなわちR&Dの出力がR&Dの速度への入力になる。これが「再帰的」自己改善の最小限の操作的定義であり、ループが閉じるということである。フロンティア規模では実証されていない。
段階5:人間をループから外した持続的な超指数関数的改善。 Good、Yudkowsky、Bostromが論じた古典的な知能爆発である[Bostrom, 2014]。実証されておらず、これを主張するラボもない。
一次資料まで遡ると、2026年12月から2027年3月という主張はほぼ例外なく段階1から3に関するものである。多くの人が直観的に理解し、安全性上および地政学上の重大性を生んでいる意味での本物のRSIには、最低でも段階4が必要であり、ハードテイクオフのシナリオでは段階5が必要になる。第2節で記録するように、公の議論で繰り返し見られる失敗パターンは、一つの文の中で段階1から段階4へ滑り移ることである。
ソフトテイクオフとハードテイクオフ
第二の区別は、このはしごを横断する。複利型(「ソフト」)RSI:改善は実在し自己強化的だが、ボトルネックと収穫逓減によって制約される。AI支援研究の各ラウンドは計算資源、実験の実時間、アイデアの限界収益の低下によって律速されるため、軌道はシンギュラリティではなく、速い指数関数的成長か穏やかな超指数関数的成長になる。Epoch AIのモデリングと、爆発的成長に関するErdil & Besirogluの研究はおおむねこの陣営に属する。両者は加速する成長を真剣に受け止めつつ、補完的なボトルネックを強調している[Erdil & Besiroglu, 2023, arXiv:2309.11690; Epoch AI, 2023–2025]。HansonおよびDavidsonの計算資源中心のテイクオフモデルは、RSIを実効計算量の成長の連続的な加速として扱う[Davidson, 2021–2023, Open Philanthropy]。
ハードテイクオフ型RSI:人間が介入できないまま、数日から数か月のうちに、人間をはるかに超える能力へと不連続かつ高速にブートストラップする。Yudkowskyが強調し、Bostromの一部の読解や、AI 2027の速いほうの分岐にも現れるシナリオである[Kokotajlo et al., 2025, https://ai-2027.com]。
この区別は分類のためだけでなく、政策にとって重要である。複利型RSIは、速いが統治可能でありうる移行を意味する。各サイクルが依然として観測可能な訓練実行とデプロイを経るため、デプロイ前評価、能力閾値、人間による監督は効力を保つ。ハードテイクオフは、移行が評価の周期を追い越すため、これらの手段が急速かつ壊滅的に機能しなくなりうることを意味する。Dean Ballは結果の空間を同じ継ぎ目で二分する。RSIが既存パラダイム内でのより速い進歩を意味し、公衆にはほとんど見えない「通常の指数関数」のケースと、技術の性質が不連続に変化するケースである[Ball, 2026]。公の議論の大半はこの二つを混同している。
ラボ自身の操作的定義
両ラボは閾値を文書化しており、閾値はガバナンス上の帰結を伴うため、いかなるインタビューの引用よりも有用である。いずれも予測ではなく安全措置の発動条件であり、これを予測として読むのは、この論争でよく見られる出所の取り違えである(「閾値ロンダリング」、第2節)。
OpenAI Preparedness Framework v2(2025年4月15日)は、AI自己改善を三つのフロンティア分類の一つとして追跡し、二つの閾値を設けている[OpenAI, 2025, https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf; wording verified]:
- High:モデルが「OpenAIのすべての研究者に、その研究者の2024年時点の基準と比べて、高い能力を持つ中堅リサーチエンジニアの助手を一人ずつ与えるのと同等の能力を備えている」こと。
- Critical:(先行指標として)超人的な研究科学者エージェントであるか、または(遅行指標として)「世代単位のモデル改善(例:OpenAI o1からOpenAI o3へ)を、2024年における同等の進歩の5分の1の実時間で(例:わずか4週間に短縮して)数か月にわたり持続的に」引き起こすこと。
Criticalの定義は、数か月にわたって持続する世代的改善の実時間圧縮という尺度で測られるため、公開されたRSIの操作化としては異例なほど精密である。これは段階4から5に位置する。Highはおおむね段階2から3に位置する。
AnthropicのResponsible Scaling Policyは、2026年2月24日発効のv3.0で再構成された[Anthropic, 2026a, https://www.anthropic.com/responsible-scaling-policy]。v2.xではAI R&Dの閾値が二つあった。AI R&D-4は「Anthropicの新人レベルでリモート勤務のみの研究者の仕事を完全に自動化する能力」、AI R&D-5は「実効的スケーリングの速度に劇的な加速を引き起こす能力」である。
RSP v3.0はこれらを単一の自動化AI R&D閾値に統合した。その文言は次のとおりであった。「我々の作業上の操作化は、あるモデルが2018年から2024年のAIの進歩2年分を1年に圧縮しうると我々が判断した時点で、このリスク閾値を発動させるというものである」[Anthropic, 2026a, https://www.anthropic.com/responsible-scaling-policy/rsp-v3-0; wording verified against the PDF]。これは事実上旧AI R&D-5の定義を採用したものであり、AI R&D-4の水準で「肯定的な論拠」を整備するというv2.xの約束は削除された[GovAI, 2026, https://www.governance.ai/analysis/anthropics-rsp-v3-0-how-it-works-whats-changed-and-some-reflections]。
この文言は5週間しか続かなかった。2026年4月2日発効のRSP v3.1はこの一文を削除し、二つの要件からなる基準をその場所に置いた。閾値が満たされるのは、「(1) 我々のモデルが、我々のResearch ScientistsとResearch Engineersの全員を、競争力のあるコスト(すなわち5倍以内)で完全に代替できる、または (2) AI R&Dの自動化に関係する可能性が高い理由によって、AIの進歩のペースの『劇的な加速』がある、のいずれかであると我々が判断した場合」である[Anthropic, 2026, RSP v3.1 redline, https://cdn.sanity.io/files/4zrzovbb/website/64cb0ac5eb0f8030187131f490827323e3d53308.pdf]。Anthropicのウェブ上の変更履歴は、v3.1の編集を「いずれも本方針の実質を大きく変えるものではない」ものと説明し、「倍増」の明確化にしか触れなかった。PDF内の変更履歴は、この変更が「我々の根底にある意図をよりよく反映させるための、いくつかの実質的な変更を伴う」と述べている[Anthropic, 2026, https://www.anthropic.com/responsible-scaling-policy; Anthropic, 2026, RSP v3.4, Changelog]。どちらも代替の要件を名指ししていない。
2026年7月8日発効のRSP v3.4が現行版であり、第二の要件を厳しくした。シナリオ(2)が生じたとされるのは、「(a) AI R&DへのAIの有意な寄与がない場合について、我々が予想する速度と、我々が観測した、長期にわたる進歩の最速の速度の双方と比べて、AIの総合的な能力の進歩の速度が2倍になることを我々が観測または予想し、かつ (b) この倍増が(人員、計算資源、一般的な生産性の増加といった他の要因ではなく)研究および/またはエンジニアリングの自動化に相当程度帰せられることがもっともらしく、そのためAIの進歩の傾向が続けばさらに大きな加速につながる可能性が高いと思われる」場合である[Anthropic, 2026, RSP v3.4, Section 1, pp. 9–10, https://cdn.sanity.io/files/4zrzovbb/website/0bacdc8440ea96e62a8766d99ebe1d4eea6d5f3a.pdf]。脚注はこの倍増を「基準であれば2年で見られるのと同じだけの進歩が1年で起きること」と定義し、これは「『研究者の生産性の倍増』と同じ考えではない」と付け加えている。第二の脚注は「長期にわたる」を「少なくとも3世代のモデルにわたって」と定義している。「双方」と「我々が観測した、長期にわたる進歩の最速の速度」という語句が、v3.4で挿入された部分である。変更履歴はその理由を示している。全体の進歩が「一定か減速している」一方で、AIツールがなかった場合よりはるかに速いとAnthropicが推定していたとしても、閾値は越えられないことになる。同じ項目は次のように述べる。「この閾値は劇的な再帰的自己改善の始まりを捉えることを意図しており、操作化が難しいことがわかっている」[Anthropic, 2026, RSP v3.4, Changelog, July 8, 2026]。
2月のガバナンス上の変更は今も有効であり、十分に議論されてこなかった。おおよそ段階3で発動したはずの閾値は廃止され、復活していない。Anthropicは別途、Claude Opus 4.5の能力を超える今後のすべてのモデルについて、個別に能力判断を行うのではなくAI R&D-4の基準を満たすことを約束した[confidence: medium — secondary summary of the Opus 4.6 system card]。
本報告書のはしごの上では、二つの要件は異なる場所に位置する。第二の要件は、ラボ自身の言葉による段階4である。それは、総合的な能力の進歩の倍増が測定または予想され、それが人員や計算資源ではなく自動化に帰せられ、かつ「さらに大きな加速につながる可能性が高いと思われる」種類のものであることを求める。この最後の節が閉じたループである。すなわち、R&Dの産出がR&Dの速度への入力になる。Anthropicはこれを能力の進歩の速度として測り、本報告書の段階4はサイクル時間として述べられているが、両者は同じ出来事を記述しており、AnthropicのRisk Reportはこの倍増を「超指数関数的な進歩」の「潜在的な早期警告」と呼んでいる。これは段階5である[Anthropic, 2026, Risk Report, August 2026, Section 3.5]。v3.4の編集はこの要件を段階4に近づけた。反実仮想との比較でしか存在しない倍増は、もはや数えられないからである。
第一の要件は、どの段階にも正確には位置しない。それは能力とコストについての言明であり、進歩のペースには言及しない。上級の職員を含むすべてのResearch Scientistを代替するには、研究センスを含む研究業務の全範囲にわたる段階3が必要である。Anthropic自身の評価は、同社のモデルは「我々のResearch ScientistsとResearch Engineers、とくに比較的上級の者を、まだ代替していない」というものである[Anthropic, 2026, Risk Report, August 2026, Section 3.4]。その位置にあるラボは段階4に必要な能力を持ち、おそらくその後まもなく段階4に達するだろうが、この要件は、いかなる加速も測定されないうちに、満たされたと宣言できる。したがって本報告書は要件(1)を段階3の最上部に置き、段階4にとって十分な能力ではあるが、その実証ではないものとする。要件(1)のみによる宣言は段階4の基準を満たさない。要件(2)による宣言は満たす。
両ラボの非対称性に注意されたい。OpenAIのHighは研究者の助手に関する閾値である。Anthropicの閾値は進歩の速度によって、または研究職員全体の置き換えによって満たされ、どちらの要件も、研究者一人ひとりに助手がつく水準をはるかに上回る。あるモデルがOpenAIのHighを上回りつつ、同時にAnthropicの閾値の両方の要件を下回ることは十分にありうる。したがって「どこまで近づいたか」のラボ間比較は同じ尺度によるものではなく、両ラボと一つの日付をあわせて挙げる主張はすべて、その点を念頭に読むべきである。
[訂正、バージョン1.16:バージョン1.0から1.15は、Anthropicの閾値をRSP v3.0の文言だけで、二次資料を通じた引用によって記述していた。RSP v3.1(2026年4月2日)はその文言を上で引用した二つの要件からなる基準に置き換え、RSP v3.4(2026年7月8日)はその第二の要件を厳しくした。バージョン1.15(第8.18節)は、方針そのものを開かないまま、Anthropicの8月のRisk Reportからこの変更を報告した。本改訂は、RSP v3.0、v3.1、v3.2、v3.3、v3.4と、v3.1およびv3.4のredlineを、一次資料のPDFから読んだ。未解決の問いQ13は閉じられた。]
学術的な分類
2026年7月のサーベイは、「有界の自己洗練」(収束的で測定可能であり、すでに産業で使われている)と「オープンエンドな再帰的自己改善」を区別し、システムを二つの軸で整理している。何が改善されるか(デプロイ時の挙動、訓練方針、評価器、あるいは研究プロセスそのもの)と、人間の監督下から完全自律までのループの閉鎖度である[Chen, Wang & Qu, 2026]。
中心的な実証的知見は、実証された自己改善の強さが検証の階層に沿うということである。形式的な検証器が存在する領域で最も強く、システムが自己評価する領域で最も弱く、自己確認ループやモデル崩壊といった失敗パターンを伴う。ボトルネックに関する結論は、「研究の方向設定」がフロンティアラボ全体で依然として人間の関与を要する領域であり、ループの完全な閉鎖を妨げているというものである[Chen, Wang & Qu, 2026]。
この検証階層の知見は証拠を扱う各節で繰り返し現れる。2026年の強力な自己改善の成果はすべて階層の形式的検証器側に位置しており、コーディングが近い将来の経路となるのは、まさにそれが検証の最も安価な領域だからである。
本報告書の以降で適用する基準はここから直接導かれる。2026年12月から2027年3月という主張は、ラボ自身が文書化した定義(OpenAIのCritical閾値とAnthropicの自動化AI R&D閾値のうち加速の要件)のもとで段階4/5の水準に照らして判定し、段階1から3の証拠はそれが示すものとしてのみ評価し、それ以上のものとはみなさない。