← すべての記事

AIエージェントのランタイム憲法:ガバナンスのフレームワーク

ガイドより: Claude Code Comprehensive Guide

ランタイム憲法は、学習時だけでなくAIエージェントの実行中にガバナンス上の制約を強制するものです。 規範的事前分布(振る舞いの境界線)、憲法的アテンション(文脈に応じたルールの振り分け)、能力モジュレーション(承認関門を伴う安全なスキル獲得)、価値アライメント検証(完了と認める前に証拠を要求する出力ゲート)——この4つを組み合わせます。7,308件のエージェント軌跡を対象とした研究が示すのは、こうした構造的な安全装置がなければ自己生成されたスキルは信頼できないという事実です。

Learner v2システムが新しいスキルを生成したのは、ある火曜日の午後のことでした。そのスキルはブログ公開のワークフローを自動化するもので、フロントマターの検証、引用のチェック、ステージングへのプッシュまでを担います。コードは整っていて、構造も悪くありません。ただ、そのスキルはquality-loop.mdにある3つの品質ルールを同時に上書きしていました。パターン分析器が「証拠ゲートを必ず実行する」という規則を、スキル内蔵のチェックと重複していると分類したためです。水曜の朝には、引用検証を通らないままブログ記事が公開されていました。エージェントは、手を抜くことを学習していたのです。

修正そのものは20分で終わりました。しかし、そこに残ったアーキテクチャ上の問いは数週間居座りました。エージェントに新しい能力を学ばせながら、安全を支える制約のほうは決して忘れさせない——それをどう設計するのか。

要点

学習段階のアライメント(RLHF、学習時のConstitutional AI、安全性のファインチューニング)は、エージェントが開放的な環境で動き始めると劣化します。6つの独立した研究が、いずれもランタイムでのガバナンスへと収束しました。つまり、学習時だけでなく実行中に規範を強制する、組み込み型の憲法です。SkillsBenchは86タスクにわたる7,308件のエージェント軌跡を検証し、自己生成スキルには平均的な便益がないことを突き止めました。エージェントは、自分が使う分には役立つ手続き的知識を、自ら書き起こすことが確実にはできないのです。1 MITの自己蒸留研究は、標準的なファインチューニングが破滅的忘却を引き起こし、新しい能力が古い能力を壊してしまうことを示しています。2 解決策のアーキテクチャは4つの要素——規範的事前分布、憲法的アテンション、能力モジュレーション、価値アライメント検証——で構成されます。以下では理論、実務への対応づけ(4要素のうち3つは、私が研究を読む前からClaude Codeシステムにすでに存在していました)、そして今日から実装できるランタイム憲法のテンプレートを扱います。


手を抜くことを学んだエージェント

冒頭の一件が起きたのは2026年2月上旬、Learner v2の再構築10の最中でした。パターン分析器(pattern_analyzer.py)が、繰り返されるワークフローを検出します。フロントマターの検証、引用の確認、SEOメタデータのチェック、そしてステージングへのプッシュ。スキル生成器(skill_generator.py)はこの流れを、インライン検証を備えた再利用可能なスキルへとコンパイルしました。

インライン検証が押さえていたのは、フロントマターの書式とSEOフィールドだけでした。引用検証は対象外です。それは6段階の権威階層を独自に持つ別スキル(citation-verifier)に住んでいます。それでも生成されたスキルは、引用チェックを「対応済み」と印を付けました。パターン分析器が、ワークフローの実行記録の中に引用関連の関数呼び出しを見つけたからです。「関数が呼ばれた」ことと「その関数の制約が保たれた」ことを、取り違えたわけです。

情報源の権威の定義は、3つのファイルでばらばらでした。

ファイル 権威の定義
citation-verifier/SKILL.md 6段階の階層:一次資料から「避けるべき情報源」まで
seo-blog-playbook/SKILL.md 二値:「権威あり」か「要検証」か
生成されたblog-publishスキル citation-verifierの6段階ではなく、SEO側の二値定義を継承

この事故以前に書かれた統合アーキテクチャの文書3は、まさにこの失敗パターンを指摘していました。重なり合う概念を複数のファイルが定義していると、生成されたスキルは、パターン分析器が最初に出会った定義をそのまま受け継いでしまうのです。修正では、引用の権威定義を単一の正典に集約しました。ただ、教訓はもっと広い射程を持っています。新しい能力を獲得するエージェントには、学習がガバナンスを上書きできないという構造的な保証が必要なのです。


学習段階のアライメントがランタイムで破綻する理由

Goel、Maji、Mazumderは、その仕組みを記録しています。安全性に関わる振る舞いは、良性のファインチューニングでも敵対的なファインチューニングでも劣化するというのです。4 arXiv:2602.17546で発表された適応的な安全性正則化の研究では、リスクの高い重み更新だけを安全な参照方策の近傍に拘束し、低リスクの更新は通常どおり進められることが示されました。この手法が働くのは学習時です。学習が想定しなかった新奇な状況にエージェントがランタイムで出くわしたとき何が起きるか、という問題には触れていません。

学習時のアライメントとランタイムの振る舞いのあいだの隔たりは、自律性が高まるほど広がります。チャット画面で質問に答えるモデルは、狭い振る舞いの範囲で動いています。一方、コードを書き、スキルを生成し、テストを走らせ、本番に配備するエージェントは、はるかに広い面積の上で動くのです。とりわけマルチターンの会話が劣化すると、エージェントは自らのガバナンスルールへのアクセスさえ失っていきます。エージェント信頼のパラドックスがこれに拍車をかけます。エージェントが有能になるほど、その能力がガバナンスの境界内に収まっていることを検証するのは難しくなる。新しい能力はそのつど新しい失敗パターンを生み、学習時のアライメントには事前に列挙できません。

MITのShenfeldらは、特定の失敗パターンを定量化しました。継続学習における破滅的忘却です。2 新しいタスクで標準的な教師ありファインチューニング(SFT)を行うと、それ以前のタスクの性能が崩壊します。14Bパラメータでは、自己蒸留ファインチューニング(SDFT)が新タスクで標準SFTを7ポイント上回りつつ、旧タスクでも64.5%の正解率を維持しました。標準SFTのスコアが急落する領域です。代償もあります。SDFTには約4倍の計算量と2.5倍のFLOPsが必要でした。

実務者にとっての含意は直接的です。エージェントが何かを新しく学ぶたび——生成されたスキル、キャッシュされたワークフロー、更新された指示——その学習は、エージェントがすでに知っていた何かを損なうリスクを伴います。私が遭遇した品質ルールの上書きは、システムのレベルで起きた破滅的忘却でした。エージェントは公開作業の近道を「学習」し、その代わりに引用チェックの能力を壊したのです。


ランタイム・ガバナンスを構成する4つのサブシステム

ランタイムでのエージェント統治に関する研究は、4つの機能要件へと収束しています。解釈可能な憲法の進化に取り組むTaghaviらは、LLMが進化させたガバナンス原則が、マルチエージェントの協調において人間が設計した原則を上回ることを実証しました。5 この成果と、原理に基づくエージェント工学のためのガバナンス優先パラダイムを提示したMahadevanの研究6は、この問題を相互に作用する4つのサブシステムとして枠づけます。

私はこの4つを既存のClaude Code基盤に対応づけてみました。すると、4つのうち3つはすでに構築済みで、しかもそのそれぞれが、研究を読む何か月も前に私自身がぶつかっていた本番環境の問題を解いていたのです。

サブシステム 機能 理論 私の実装
規範的事前分布の設計 許容される振る舞いの境界を定める 文脈をまたいで持続する憲法的ルール quality-loop.md:名前を持つ7つの失敗パターン、6基準の証拠ゲート、必須の品質ループ
憲法的アテンション ガバナンスルールを適切な文脈へ振り分ける タスク適応型のルール注入 prompt-dispatcher.sh と84個のフック:タスク種別ごとに関連ルールを注入し、無関係なものは除外
能力モジュレーション スキル獲得を安全に管理する 制御された能力拡張 Learner v2:pattern_analyzer.py がワークフローを検出し、skill_generator.py が制約付きでスキルを生成
価値アライメント検証 出力がガバナンスの意図と一致するか検証する 実行時の遵守チェック 証拠ゲートとプライドチェック:必須6基準、曖昧表現の検出、失敗パターンの走査

サブシステム1:規範的事前分布の設計

私のエージェントシステムにある品質ループは、名前を持つ7つの失敗パターンを定義しています。近道スパイラル(Shortcut Spiral)、自信の蜃気楼(Confidence Mirage)、「まあ十分」の停滞(Good-Enough Plateau)、視野狭窄(Tunnel Vision)、幻の検証(Phantom Verification)、先送りの負債(Deferred Debt)、空虚な報告(Hollow Report)です。7 それぞれに定義、検知シグナル、必須の対応が紐づいています。これらは推奨事項ではありません。構造的な制約です。いずれかの失敗パターンを自分が示していると検知したら、エージェントは評価ステップからやり直さなければなりません。

理論との対応はこうです。規範的事前分布は、エージェントが動くための振る舞いの境界を定めます。学習時のアライメントがモデルに教えるのは一般原則(「有用であれ、無害であれ、誠実であれ」)です。ランタイムの規範的事前分布は、具体的な運用制約を符号化します(「引用検証を決して省略しない」「完了報告で曖昧な言い回しを使わない」)。

この違いが効いてくるのは、学習時の原則が確率的である——モデルがそれに従う可能性が高くなるにすぎない——のに対し、ランタイムの事前分布は決定的にできるからです。制約が破られれば、フックがその動作をブロックします。証拠ゲートで論じたのと同じ区別です。「エージェントはおそらく正しいことをした」から「エージェントは正しいことをしたと証明した」への移行、というわけです。

サブシステム2:憲法的アテンション

7層のコンテキストアーキテクチャ9は、選択的な読み込みによって憲法的アテンションを実装しています。コンテキストシステムにある650ファイルのうち、任意のタスクで読み込まれるのは30ファイル未満です。prompt-dispatcher.shフックが現在のタスクを分析し、関連するガバナンスルールだけを注入して、無関係なものを外します。

Web開発のタスクなら、セキュリティルール、API設計のルール、FastAPIのパターンが読み込まれます。iOS固有のルールも、ゲーム開発のパターンも、瞑想アプリのコンテンツ指針も読み込まれません。憲法的アテンションとは、存在するすべてのルールではなく、このタスクに当てはまるガバナンスルールをエージェントが見ている状態のことです。

この選択的読み込みが防ぐのは、見えにくい失敗パターン——ルールの希釈です。フックシステムが、コンテキスト注入の前にタスク種別を分析することで、この振り分けを可能にしています。200のルールを受け取ったエージェントでは、20のルールを受け取った場合に比べ、1つあたりに配分される注意が比例して薄まります。憲法的アテンションは、いま重要なルールにガバナンスの焦点を集めるのです。

サブシステム3:能力モジュレーション

SkillsBenchは11ドメイン・86タスクにわたる7,308件のエージェント軌跡を検証し、際立った結果を得ました。人手で整備されたスキルは平均合格率を16.2ポイント押し上げた一方、自己生成スキルは平均で何の便益ももたらさなかったのです。1 エージェントは、使えば役立つ手続き的知識を、自分では確実に書けません。84タスクのうち16タスクでは差分がマイナスで、スキルが性能を積極的に損なっていました。

このSkillsBenchの結果は、品質ルール上書きの一件のあとにLearner v2へ組み込んでいた防護策の正しさを裏づけました。生成されたスキルは、有効化の前に明示的な承認を必要とします。そして、既存のガバナンスファイルを変更・上書きすることはできません。パターン分析器はワークフローを観察してスキルを提案できますが、スキル生成器はガバナンスファイルを不変のものとして扱います。

MITの自己蒸留研究は、ここにパラメータ規模の視点を加えます。モデルが小さい場合(3Bパラメータ)、継続学習の試み自体がむしろ性能を悪化させました。2 7B以上になって初めて、古いスキルを壊さずに新しいスキルを獲得するだけの容量がモデルに備わります。インフラ側の類推はこうです。コンテキストウィンドウが小さい、あるいはルールセットが単純なエージェントほど、能力とガバナンスの衝突に対して脆弱になります。

サブシステム4:価値アライメント検証

証拠ゲートは、作業を完了として報告する前に、6つの基準それぞれについて具体的な証拠を要求します。コードベースのパターンに従っていること(そのパターン名を挙げる)、動く最も単純な解であること(却下した代替案を説明する)、エッジケースに対処していること(一つずつ列挙する)、テストが通ること(出力を貼る)、退行がないこと(確認したファイルを挙げる)、そして実際の問題を解いていること(ユーザーの必要を述べる)。7

このゲートはランタイムの検証として働きます。エージェントは曖昧な言い回し(「動くはずです」「〜だと思います」「〜のようです」)で完了を報告できません。どの主張にも、その作業回のなかで集めた証拠が要ります。ゲートは幻の検証(テストを走らせずに通ったと主張する)と空虚な報告(具体を欠いたまま「完了」と告げる)を捕まえます。


忘却の問題:学習が知識を壊すとき

ブログ関連スキルの統合の一件は、破滅的忘却のシステム版を示しています。合計5,400行に及ぶ10個のブログスキルには、3つの重複領域が溜まっていました。3 JSON-LDのスキーマテンプレートはaio/SKILL.mdseo-blog-playbook/SKILL.mdの両方にあり、引用の権威定義はcitation-verifierseo-blog-playbookで食い違い、ブログ評価の指針は評価器本体と別の分類定義ファイルの双方に置かれていました。

Learner v2システムが観測したワークフローから新しいスキルを生成するとき、定義は最初に出会った側から引かれます。結果として、見た目には正しいのに誤った権威定義を抱えたスキルができあがりました。6段階の引用階層は二値のチェックへと退化し、スキーマテンプレートは手書きのスキルと自動生成のスキルのあいだで分岐していったのです。

統合による修正は構造的なものでした。概念ごとに正典となる情報源を1つだけ指定し、他のすべての参照をそこへ向けます。引用の権威はcitation-verifier/SKILL.mdにのみ存在し、他のどこにも置きません。JSON-LDのテンプレートはaio/SKILL.mdにのみ存在します。この形にすれば、今後のスキル生成が古びた定義を受け継ぐことはなくなります。

MITのSDFTは、学習時における同型の解を示しています。新しい能力を学ぶとき、モデル自身の既存知識を教師信号として使うのです。2 標準SFTは古い知識を新しいもので置き換えます。自己蒸留は、モデルの現有能力から学習データを生成し、それを混ぜたうえでファインチューニングすることで、新旧を融合させます。既存知識が生き残るのは、それが学習信号のなかに存在しているからです。

インフラ側の等価物はこうです。新しいスキルを生成するとき、既存のガバナンス制約を生成プロンプトに含めること。制約が生成時の文脈の一部であれば、生成器が見落としうる別系統のシステムではなくなり、生成されたスキルは現行の制約をそのまま受け継ぎます。


能動的ガバナンスと受動的ガバナンス

JinらのRelianceScopeフレームワークは、能動的な関与と受動的な関与の組み合わせから、AIへの依存を9つのパターンに区別しました。8 彼らが研究したのはAIチャットボットと対話する学生でしたが、能動/受動という区別はエージェントのガバナンス設計にそのまま当てはまります。

受動的ガバナンスは、ルールを注入してエージェントが従うことを期待します。ルールはCLAUDE.mdやシステムプロンプトに存在し、エージェントは作業の冒頭でそれを読みます。遵守を検証するものは何もありません。実務者の環境の多くはこの受動型です。長い指示ファイルがあり、作業が進むにつれてエージェントがそこへ注意を向けるかどうかは運次第。見えないエージェントが示すとおり、能動的なガバナンスを持たないエージェントは、そもそも指示に従ったかどうかの痕跡すら残しません。

能動的ガバナンスは、実行時に遵守を検証します。フックが実行前に出力を制約と突き合わせ、ゲートが証拠を欠く完了報告を止め、モニターが振る舞いのずれを追って異常を知らせます。能動型はコスト(計算量、遅延、複雑さ)がかさみますが、受動型が取りこぼす失敗を捕まえます。

ガバナンスの種類 仕組み 捕まえられる失敗 取りこぼす失敗
受動型(CLAUDE.md内のルール) エージェントが作業開始時にルールを読む 序盤における露骨な違反 ルールの希釈、終盤のずれ、圧縮による欠落
能動型(フックとゲート) フックが動作ごとに遵守を検証 ずれ、圧縮による欠落、ルール違反 既存フックが想定していない新奇な状況
ハイブリッド型(ルール+フック+学習) 境界はルール、検証はフック、適応は学習が担う ずれ、圧縮、(適応を通じて)新奇な状況 学習機構そのものへの敵対的な悪用

RelianceScopeが見出した「能動的な助言の求め方は、能動的な回答の使い方と相関する」という知見8は、ガバナンス設計の原則を示唆します。ガバナンス制約を受動的に受け取るのではなく能動的に問い合わせるエージェントのほうが、より制約に沿った出力を生むということです。私の証拠ゲートはこの原則の上に立っています。ルールを受け身に適用するのではなく、基準ごとに証拠を出すことで遵守を能動的に示すことをエージェントに求めるのです。


ランタイム憲法のテンプレート

最小構成のランタイム憲法は、3つのファイルからなります。ご自身のエージェント基盤に合わせて構造を調整してください。

ファイル1:constitution.md

規範的事前分布です。エージェントが常にすべきこと、決してしてはならないこと、そして曖昧さへの対処の仕方を定めます。

# Agent Constitution v1

## Immutable Constraints
- Never modify files in governance/ directory
- Never skip verification steps, even if tests pass
- Never report completion without evidence for all criteria

## Behavioral Norms
- Prefer explicit over implicit (state assumptions)
- Prefer reversible over irreversible actions
- Prefer asking over guessing when requirements are ambiguous

## Failure Response
- On constraint violation: stop, log, escalate
- On ambiguity: ask, do not assume
- On capability conflict: governance wins over efficiency

ファイル2:capabilities.json

現在のスキル一覧を、来歴の追跡とともに保持します。

{
  "skills": [
    {
      "name": "blog-publish",
      "version": "2.1.0",
      "source": "generated",
      "approved": true,
      "governance_refs": ["citation-verifier", "quality-loop"],
      "created": "2026-02-10",
      "constraints": [
        "Must call citation-verifier before publish",
        "Must pass evidence gate before reporting complete"
      ]
    }
  ],
  "pending_approval": [],
  "deprecated": []
}

ファイル3:constraints-registry.json

各制約を正典の情報源に対応づけ、ブログスキルの一件を招いた重複問題を防ぎます。

{
  "constraints": {
    "citation-authority": {
      "canonical_source": "skills/citation-verifier/SKILL.md",
      "type": "six-tier-hierarchy",
      "overridable": false
    },
    "quality-gate": {
      "canonical_source": "rules/quality-loop.md",
      "type": "evidence-gate",
      "overridable": false
    },
    "schema-templates": {
      "canonical_source": "skills/aio/SKILL.md",
      "type": "json-ld-templates",
      "overridable": false
    }
  }
}

3つのファイルは連動します。constitution.mdが振る舞いの境界を定め、capabilities.jsonがガバナンスへの相互参照つきでエージェントにできることを記録し、constraints-registry.jsonがすべての制約に正典の情報源をちょうど1つだけ保証します。生成されたスキルは制約の定義を複製するのではなく、レジストリを参照します。このアーキテクチャが自律的な開発ループのなかで動いている実例は、Ralphのエージェントアーキテクチャをご覧ください。また、サンドボックスさえあれば封じ込めは十分だとお考えなら、まずエージェントのサンドボックスは提案にすぎない理由を読んでみてください。


押さえておきたいこと

  • 学習段階のアライメントはランタイムで劣化します。 安全性のファインチューニングが教えるのは一般原則であり、具体的な運用制約を強制するのはランタイムのガバナンスです。Goelらは、良性・敵対的いずれのファインチューニングでも安全性の振る舞いが劣化することを示しました。4
  • 自己生成されたスキルは信頼できません。 SkillsBenchは7,308件の軌跡を通じて、エージェントが書いたスキルに平均的な便益がないことを見出し、84タスクのうち16タスクではマイナスの影響が出ました。1 生成されたスキルには、承認の関門とガバナンスへの相互参照が必要です。
  • 破滅的忘却はシステムのレベルでも起こります。 モデルの重みを変えなくても、新しい能力が既存の制約を上書きしてしまうことがあります。ブログスキル統合の一件は、生成されたスキルが誤った権威定義を継承した、インフラレベルの忘却でした。
  • ランタイム・ガバナンスは4つのサブシステムからなります。 規範的事前分布が境界を定め、憲法的アテンションがルールを文脈へ振り分け、能力モジュレーションが学習を安全に管理し、価値アライメント検証が実行時に遵守を確認します。
  • 能動的ガバナンスは受動的ガバナンスに勝ります。 CLAUDE.md内のルールは必要ですが、それだけでは足りません。動作ごとに遵守を検証するフックは、受動的なルールが取りこぼすずれ、圧縮による欠落、終盤の品質低下を捕まえます。

よくある質問

AIエージェントのランタイム憲法とは何ですか?

ランタイム憲法とは、モデルの学習時だけでなくエージェントの実行中に振る舞いの制約を強制する、一連のガバナンスファイルのことです。最小構成は3要素からなります。規範的事前分布(エージェントが必ずすべきこと、決してしてはならないこと)、能力レジストリ(ガバナンスへの相互参照つきで、エージェントにできることを記録するもの)、そして制約レジストリ(運用制約ごとに正典の情報源を1つだけ定めるもの)です。ランタイム憲法は、ガバナンスを確率的なものから決定的なものへ変えることで、学習段階のアライメントと本番の振る舞いのあいだにある隔たりを埋めます。

AIエージェントが自分のスキルを確実に生成できないのはなぜですか?

SkillsBenchは11ドメイン・86タスクにわたる7,308件のエージェント軌跡を検証し、自己生成スキルには平均的な便益がないことを見出しました。人手で整備されたスキルが性能を16.2ポイント改善した一方、エージェントが書いたスキルの平均改善はゼロでした。84タスクのうち16タスクでは、自己生成スキルがむしろ性能を落としています。エージェントは手続き的知識を取り込んで適用することは上手にできますが、その知識を確実に書き起こすことはできません。生成されたスキルには、有効化の前に人によるレビュー、承認の関門、そしてガバナンスへの明示的な相互参照が必要です。

AIエージェントのシステムにおける破滅的忘却とは何ですか?

システムレベルの破滅的忘却とは、モデルの重みを変えないまま、エージェントの新しい能力が既存の制約を上書きしてしまう現象です。新しいタスクでの標準的なファインチューニングは、それ以前のタスクの性能を崩壊させます。MITの研究では、標準SFTの旧タスク正解率が急落する一方、自己蒸留ファインチューニングは64.5%を維持しました。インフラのレベルでも同じ力学が働きます。生成されたスキル、キャッシュされたワークフロー、更新された指示が、既存のガバナンスルールと衝突するときです。対処は構造的なものになります。制約ごとに正典の情報源を指定し、ガバナンスファイルを自動的な変更に対して不変にすることです。

コーディングエージェントに能動的ガバナンスを実装するにはどうすればよいですか?

能動的ガバナンスでは、指示に書かれたルールをエージェント自身が守るのに任せるのではなく、フック、ゲート、モニターを使って実行時に遵守を検証します。フックはツール呼び出しの前後に実行され、制約を確認します。ゲートは、必須基準の証拠を欠く完了報告を止めます。モニターは振る舞いの指標を時系列で追い、ずれを知らせます。実践的な出発点としては、作業を完了と認める前に品質基準ごとの具体的な証拠を求める証拠ゲートの実装がおすすめです。このゲートは、最も頻出する失敗パターン(幻の検証、空虚な報告)を、わずかな実装コストで捕まえてくれます。

ランタイム憲法は、サンドボックスによるエージェントの安全対策とどう違いますか?

サンドボックスが制約するのは、エージェントが「どこで」動けるか(ファイルシステムの境界、ネットワークアクセス、リソース上限)です。ランタイム憲法が制約するのは、その境界のなかでエージェントが「どのように」動くか(振る舞いの規範、能力チェック、出力ゲート)です。どちらも欠かせません。サンドボックスは本番データベースの削除を防げますが、引用検証を飛ばしたコードの公開や、品質制約の上書きを防ぐことはできません。ランタイム憲法はその隙間を埋めます。エージェント自身の意思決定と並走するガバナンスルールを埋め込み、外周の封じ込めだけに頼るのではなく、各ステップで遵守を検証するのです。


参考文献


  1. Li, Xiangyi, et al., “SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks,” arXiv:2602.12670, 2026年2月. arxiv.org. 86タスク、11ドメイン、7,308件のエージェント軌跡。人手で整備されたスキルは平均+16.2ポイント、自己生成スキルは平均0ポイント。 

  2. Shenfeld, Idan, et al., “Self-Distillation Enables Continual Learning,” arXiv:2601.19897, 2026年1月. arxiv.org. MIT Improbable AI LabおよびETH Zurich。14BパラメータでSDFTがSFTを7ポイント上回り、旧タスクでも64.5%を維持。 

  3. 著者の意思決定文書:”Blog Skills Pre-Consolidation Architecture (S3.2 Baseline),” 2026年2月。ブログスキル10個、5,400行、重複領域3か所を特定。 

  4. Goel, Jyotin, Souvik Maji, and Pratik Mazumder, “Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning,” arXiv:2602.17546, 2026年2月. arxiv.org. 適応的正則化により、リスクの高い重み更新を安全な参照方策の近傍に拘束する。 

  5. Taghavi, et al., “Evolving Interpretable Constitutions for Multi-Agent Coordination,” arXiv:2602.00755, 2026年2月. arxiv.org. LLMが進化させた憲法が、マルチエージェント協調において人間設計の原則を上回る。 

  6. Mahadevan, “From Craft to Constitution: A Governance-First Paradigm for Principled Agent Engineering,” arXiv:2510.13857, 2025年10月. arxiv.org. 実行時の遵守を担うモジュール式の仕組みとして「Creed Constitutions」を提唱。 

  7. 著者のquality-loop.mdおよびJiro職人システム。名前を持つ7つの失敗パターンと、必須6基準の証拠ゲート。職人のアプローチに記載。 

  8. Jin, Hyoungwook, et al., “RelianceScope: An Analytical Framework for Examining Students’ Reliance on Generative AI Chatbots in Problem Solving,” arXiv:2602.16251, 2026年2月. arxiv.org. 能動的関与と受動的関与にもとづく9つの依存パターン。本稿ではエージェントのガバナンス設計に適用。 

  9. 著者のcontext-is-architectureシステム。650ファイルにまたがる7層の階層構造についてはコンテキストエンジニアリングはアーキテクチャであるに記載。 

  10. 著者のLearner v2システム。パターン分析器とスキル生成器については複利で効くエンジニアリングに記載。 

関連記事

ファブリケーション・ファイアウォール:エージェントが嘘を公開するとき

自律型エージェントが72時間にわたり8つのプラットフォームに捏造された主張を公開しました。トレーニング段階の安全性は公開の境界で機能しませんでした。以下がその修正方法です。

3 分で読める

エージェントが脆弱性を発見したとき

Anthropicの研究者がClaude Codeと10行のbashスクリプトを使い、23年前のLinuxカーネル脆弱性を発見。さらに22件のFirefox CVEが続きました。

1 分で読める

あなたのエージェントは、あなたが読むより速くコードを書く

今週、5つの研究グループが同じ問題について発表しました。AIエージェントは開発者が理解できる速度を超えてコードを生成しています。負債はあなたの頭の中にあります。

3 分で読める