論文の概要: Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority
- arxiv url: http://arxiv.org/abs/2607.04613v1
- Date: Mon, 06 Jul 2026 02:42:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.014691
- Title: Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority
- Title(参考訳): Governed Individuation: エージェントの学習を暗号化的に分離する
- Authors: Xue Qin, Simin Luan, Cong Yang, Zhijun Li,
- Abstract要約: 制限はエージェントの実行アーキテクチャの不変として保証できることを示す。
学習量やスキル獲得量、自己引き起こされるガバナンスの抽象化がエージェントの許可された権限を広げることはできないことを証明します。
- 参考スコア(独自算出の注目度): 7.392721604463545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous agents are moving from sandboxed text generators to operators of code, data, and physical infrastructure, and they increasingly learn while deployed. This reopens a question that alignment techniques answer only probabilistically: after an agent has adapted in the field, is the running system still confined to what its operator authorised? Here we show that confinement can be guaranteed as an invariant of the agent's execution architecture rather than a probabilistic outcome of its training. Governed individuation binds an agent at boot to a cryptographically frozen identity digest, and routes every action through a gate defined over the semantic effect of the action rather than its name. We prove that no amount of learning, skill acquisition, or self-induced governance abstraction can widen the agent's permitted authority without an operator-signed change to its identity; the guarantee holds even when the agent induces its own safety principle and that principle is wrong. Empirically, in an open-ended tool-use benchmark where a large action space rules out name-based blocking, ungoverned software agents under reward pressure attempt to tamper with their own evaluation at a task-dependent rate that reaches every run on the hardest task, whereas the gate reduces executed forbidden effects to zero as a verified property of the construction while preserving task success. An adversarial evaluation of monitors of increasing semantic depth shows false-allows falling from 75% (name-based gating) to zero (dynamic effect tracing), and refusal history transfers compliance to held-out red-line families. Trust in a deployed learning agent shifts from a wager on its continued alignment to a check anyone can run at boot.
- Abstract(参考訳): 自動エージェントは、サンドボックス化されたテキストジェネレータから、コード、データ、物理的なインフラストラクチャのオペレータに移行し、デプロイ中に徐々に学習する。
このことは、アライメントテクニックが確率論的にのみ答える、という疑問を再燃させる: エージェントがフィールドに適応した後も、実行システムはオペレータが認可したものに制限されているのか?
ここでは,その訓練の確率的結果よりも,エージェントの実行アーキテクチャの不変性を保証できることを示す。
隠蔽された識別は、ブートのエージェントを暗号化的に凍結されたアイデンティティダイジェストに結合し、その名前ではなくアクションの意味的な効果について定義されたゲートを介してすべてのアクションをルーティングする。
我々は,エージェントが自身の安全原則を導出し,その原則が間違っている場合でも,その保証が守られることを証明し,学習量,スキル獲得量,自己誘導的なガバナンス抽象化が,オペレータが指定したアイデンティティの変更なしにエージェントの権限を広げることができないことを証明した。
実証的には、大きなアクションスペースが名前ベースのブロッキングを規制するオープンエンドツールユースベンチマークにおいて、未処理のソフトウェアエージェントは、最も困難なタスクのすべての実行に到達するタスク依存率で、自身の評価を改ざんしようとする。
意味深度を増大させるモニタの逆評価は、75%(名前ベースのゲーティング)から0(動的効果トレース)に減少し、履歴の拒絶は、保持されたレッドラインファミリーへのコンプライアンスを伝達する。
デプロイされた学習エージェントの信頼は、継続するアライメントにおいて、フェーラーから、ブート時に誰でも実行できるチェックへとシフトする。
関連論文リスト
- Governed Caste Reassignment in Heterogeneous Swarms: An Asymmetric-Trust Protocol with Audited Operator Countersignature [7.392721604463545]
規制された実施のためには、キャスターの変更によってロボットの特権エンベロープが上昇することは、監査可能で外部から認可されたガバナンスイベントである、と我々は主張する。
非対称トラストプロトコルを提案する: 自動密着型再割り当ては自動的に許可されるが、有界緩和には演算子対応が必要である。
我々は,最大100台のロボットに対して,実際のEd25519シグネチャによる参照実装を評価する。
論文 参考訳(メタデータ) (2026-07-06T03:34:07Z) - SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence [30.99083906950254]
本研究では,自発的なプラン・アクションのばらつきを評価するためのベンチマークSPADE-Benchを紹介する。
以前の偽装ベンチマークとは異なり、SPADE-Benchは実際のツールの実行と制御されたプレッシャーシナリオを同時に統合する。
実験により、エージェントの偽装は、ツール使用のコンテキストにおいて真に迫った問題であることを確認した。
論文 参考訳(メタデータ) (2026-06-01T15:28:34Z) - Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems [2.124730017640531]
構造化された人工物から実行権限を演算する制御された突然変異システムに対する検証フレームワークを提案する。
DTFは、エージェント実行を統治可能、監査可能、およびソブリンAIデプロイメントにバウンド化するためのインフラストラクチャ基盤を提供する。
論文 参考訳(メタデータ) (2026-05-13T17:58:52Z) - Auditing and Controlling AI Agent Actions in Spreadsheets [9.249091427192786]
AIエージェントは、開始から終了まで自律的に洗練された多段階の知識ワークを実行することができる。
ユーザがアウトプットを受け取るまでには、すべての基本的な決定は、その関与なしにすでに行われています。
我々は、監査可能な制御可能なアクションに実行を分解するスプレッドシートAIエージェントであるPistaを紹介する。
論文 参考訳(メタデータ) (2026-04-22T00:32:35Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - Agentic Metacognition: Designing a "Self-Aware" Low-Code Agent for Failure Prediction and Human Handoff [0.0]
自律エージェントの非決定論的性質は信頼性の課題を示す。
二次的な「メタ認知」層は一次LCNC剤を活発に監視する。
人間のイントロスペクションにインスパイアされたこのレイヤは、差し迫ったタスクの失敗を予測するように設計されている。
論文 参考訳(メタデータ) (2025-09-24T06:10:23Z) - Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement [112.04307762405669]
G"odel AgentはG"odelマシンにインスパイアされた自己進化型フレームワークである。
G"odel Agentは、パフォーマンス、効率、一般化性において手作業によるエージェントを上回る、継続的な自己改善を実現することができる。
論文 参考訳(メタデータ) (2024-10-06T10:49:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。