論文の概要: G-CARB: Graph-Localized Conformal Agent Risk Budget for Compositional Harm
- arxiv url: http://arxiv.org/abs/2610.05563v1
- Date: Sun, 04 Oct 2026 21:49:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:04:01.939116
- Title: G-CARB: Graph-Localized Conformal Agent Risk Budget for Compositional Harm
- Title(参考訳): G-CARB:グラフローカライズされたコンフォーマルエージェントによる合成ハームのリスク予算
- Abstract要約: 小言語モデル(SLM)エージェントは、監視オーバーヘッドが少なく、ツールコール全体の結果を追跡する安全制御を必要とする。
我々はCARBを導入し、エージェントが停止する前に発生する害の台帳を使ってエージェントを停止する際の調整を行う。
- 参考スコア(独自算出の注目度): 8.024041325202612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Small language model (SLM) agents need safety controls that track consequences across tool calls with little monitoring overhead. A private read, for example, becomes a leak when a later action sends that data outside the system. We introduce CARB (Conformal Agent Risk Budget), which calibrates when to stop an agent using a ledger of harm incurred before stopping. Under exchangeable episodes, standard conformal risk control bounds this declared loss in expectation over calibration and a future episode. G-CARB selects scorer evidence along observable dependencies from private sources to outgoing actions. The ledger still covers the entire executed history, and computing the gate score requires no additional language-model inference. On AgentDojo replay with two 14B backbones, G-CARB roughly halves scorer-input records at intermediate risk budgets while improving autonomous task completion relative to full-prefix scoring; random context of the same size achieves similar gains. Controlled examples show how retaining the relevant dependency can further avoid stopping benign work.
- Abstract(参考訳): 小言語モデル(SLM)エージェントは、監視オーバーヘッドが少なく、ツールコール全体の結果を追跡する安全制御を必要とする。
例えば、プライベート読み取りは、後続のアクションがシステム外でそのデータを送信すると、リークとなる。
本稿では,CARB(Conformal Agent Risk Budget)を導入する。
交換可能なエピソードの下では、標準的な共形リスクコントロールは、キャリブレーションと将来のエピソードに対する期待の喪失を宣言する。
G-CARBは、プライベートソースから外部アクションへの観測可能な依存関係に沿ってスコアラエビデンスを選択する。
台帳は依然として実行された履歴全体をカバーしており、ゲートスコアの計算には追加の言語モデル推論は必要ない。
AgentDojoを2つの14Bバックボーンでリプレイすると、G-CARBは中間リスク予算でスコアインプットレコードをほぼ半減し、完全修正スコアと比較して自律的なタスク完了を改善する。
制御された例は、関連する依存関係を保持することで、良心的な作業の停止をさらに回避できることを示している。
関連論文リスト
- Can LLM Agents Automate Reinforcement Learning for Text-to-Speech? [64.13250261774849]
私たちは、共有ワークスペースの周りに、ヒューマンガイダンスとエージェント実行を構造化するコラボレーティブワークフローを構築します。
エージェントが何を自動化するかを測定するため、我々は公開レシピに対して段階的に軌道ステージを監査する。
以上の結果から, エージェントは不特定レシピを回収し, 改良し, 失速した場合には, 文献を調査し, LMキャリアからフローキャリアへピボットすることがわかった。
論文 参考訳(メタデータ) (2026-10-03T12:44:09Z) - $Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN [43.15181031994434]
本稿では,ゼロ知識監査制御とゼロ信頼検証エージェントインテントアーキテクチャを提案する。
実大規模言語モデルは、オペレータの意図をIntent Contractsに変換するために、非リアルタイムパスで使用される。
その結果、動作フィルタリングと攻撃レジリエンスを適度なレイテンシとシグナリングコストで改善したことが示唆された。
論文 参考訳(メタデータ) (2026-08-21T12:44:03Z) - Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention [14.376426170653707]
2つのトラジェクトリプレフィックスは、異なるアクションを必要とする間、同じリスク見積を持つことができる。
我々は、このミスマッチをターゲットエラーとして形式化し、介入の利点を特定する。
論文 参考訳(メタデータ) (2026-06-19T13:08:17Z) - ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift [0.0]
ドリフト中の検索・ツール利用エージェントに対する共形リスク制御手法であるToolChain-CRCを提案する。
この方法は各エージェントを行動、観察、最終的な出力の完全な軌跡として扱う。
ステップレベルのリスクスコアを構築し、それらを軌道上のリスクスコアに組み合わせ、アクセプションまたはインターベンルールを校正し、いつでもアラームを追加します。
論文 参考訳(メタデータ) (2026-06-16T20:27:37Z) - OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents [32.5466552510287]
漏れは累積的であり、個々に無害な放出は、正直だが、真正に曲がりくねった流しに蓄積される。
我々は、秘密に対する敵の信念がどれほど改善するかを予算化するランタイム仲介者であるOCELOTを提示する。
OCELOTは高いタスクユーティリティでのリークを著しく低減し、適応注入、ジェイルブレイク、累積推論、シンク共謀に抵抗する。
論文 参考訳(メタデータ) (2026-06-10T17:13:35Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - The Endogeneity of Miscalibration: Impossibility and Escape in Scored Reporting [2.3698341511302443]
自律エージェントからの真実の報告を排除することは、スケーラブルなAI監視における中核的な問題である。
プリンシパルは、厳密に適切なスコアリングルールを使用してエージェントのレポートをスコアリングするが、エージェントはまた、非正確チャンネルを通じてレポートの恩恵を受ける。
我々の主な成果は内在性であり、プリンシパルの最適監視は必ずしもスクリーンタイプに非ファイン承認関数を使用する。
論文 参考訳(メタデータ) (2026-05-08T12:42:28Z) - Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs [70.81495077853673]
ハードゲートのセーフティチェッカーは、しばしばベンダーのモデル仕様に過度に反抗し、不平を言う。
この研究は、ガーディアン・アズ・ア・アドバイザ(GaaA)というソフトゲーティングパイプラインを導入し、保護者がバイナリリスクラベルを予測し、このアドバイスを元のクエリに再推論する。
全体として、GaaAはモデル仕様に従うようモデルに指示し、過度な拒絶を減らしながら安全性を維持している。
論文 参考訳(メタデータ) (2026-04-08T23:47:29Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - Offline Reinforcement Learning as Anti-Exploration [49.72457136766916]
我々は、新たなオフラインRLエージェントを設計するためのボーナスベースの探索に関する文献から着想を得た。
中心となるアイデアは、探索のために追加するのではなく、報酬から予測ベースの探査ボーナスを減じることだ。
我々のエージェントは、連続的な制御ロコモーションと操作タスクのセットにおいて、最先端技術と競合していることを示す。
論文 参考訳(メタデータ) (2021-06-11T14:41:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。