論文の概要: Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls
- arxiv url: http://arxiv.org/abs/2607.24343v2
- Date: Fri, 31 Jul 2026 11:27:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.209123
- Title: Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls
- Title(参考訳): 凝集リスクを超えて:LLMツールコールにおける役割抽出型コンフォーマルリスク制御
- Authors: Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Khandaker Rifah Tasnia, Md Hasibul Amin, Sifat Rahman Ahona, Juena Ahmed Noshin,
- Abstract要約: 既存の共形リスク管理手法は、ツールコール全体を認証する。
我々は、フィールドごとの共形リスク制御、すなわち、フィールドごとの検知をラップするキャリブレーション層を導入する。
総合認定が粗悪さの代償を支払うことを示し、その役割の出現頻度に比例して、稀な役割の効果的な予算を締め付ける。
- 参考スコア(独自算出の注目度): 0.6823575235014339
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language-model agents act through structured tool calls whose arguments carry very different risks: untrusted content may legitimately shape an email body but should never set a recipient, account, command, or credential. Existing conformal risk control methods certify a tool call as a whole, so a failure in one rare high-risk field can be averaged away by the many benign arguments around it, leaving the argument that causes harm uncertified. We introduce role-stratified per-field conformal risk control, a calibration layer that wraps any per-field detector and assigns a separate threshold and risk budget to each semantic argument role. We show that aggregate certification pays a price of coarseness, tightening a rare role's effective budget in proportion to how often that role appears, whereas role-stratified calibration certifies each sufficiently sampled role directly with a finite-sample guarantee and pools the rarest roles. Across AgentDojo and InjecAgent with six language models, our method achieves the most consistent role-specific budget compliance among the methods we evaluate under model and attack transfer, detector noise, gradual drift, unseen tool suites, and adaptive attacks, providing formal per-role guarantees under exchangeability or after recalibration. These results suggest that structured tool calls should be certified at the semantic-role level, not the whole action.
- Abstract(参考訳): 信頼できないコンテンツは、Eメール本体を合法的に形成するが、受信者、アカウント、コマンド、クレデンシャルを設定するべきではない。
既存の共形リスク制御手法は、ツールコール全体を認証するので、1つの稀なハイリスクフィールドにおける失敗は、その周りの多くの良質な議論によって平均化され、害の原因となる議論は未証明のままである。
我々は、フィールドごとの共形リスク制御、すなわち、フィールドごとの検知をラップし、各セマンティックな議論ロールに別のしきい値とリスク予算を割り当てるキャリブレーション層を導入する。
その結果,アグリゲーション・アグリゲーションが粗悪なコストを負担し,その頻度に比例してレアロールの効果的な予算を締め付ける一方で,ロール・ストラテリファイド・キャリブレーションは,各ロールを有限サンプル保証で直接的に検定し,レアロールをプールする。
AgentDojoとInjecAgentを6つの言語モデルで組み合わせることで、モデルおよびアタック転送、検知ノイズ、段階的ドリフト、未確認ツールスイート、アダプティブアタックで評価した手法の中で、最も一貫した役割特異的な予算コンプライアンスを実現し、交換可能性または再校正後の正式なロール単位保証を提供する。
これらの結果は、構造化されたツールコールは、アクション全体ではなく、セマンティック・ロールレベルで認証されるべきであることを示唆している。
関連論文リスト
- Invisible Manipulation Channels in AI-Assisted Financial Advisory: Implications for Market Integrity and Regulatory Design [2.061257001243159]
本稿では,LLM推論のサンプリング層で動作している目に見えない操作チャネルを実験的に検証する。
この推測段階の操作は統計的に検出が困難であることを示す。
リスクの高い金融AIシステムに対するQRNG認証を必須とする4つの規制改正を提案する。
論文 参考訳(メタデータ) (2026-06-15T02:27:42Z) - Interactive Critique-Revision Training for Reliable Structured LLM Generation [18.00222080273147]
DPA-GRPOは,構成された検証器の介入による2人プレイヤジェネレータゲームのためのペアアクショントレーニング手法である。
我々は,非正規化ゲームを分析し,厳格に低いリワード介入やリビジョン行動に対する肯定的な確率が,一側偏差を生み出すことを示す。
TaxCalc TY24の実験では、DPA-GRPOはゼロショット生成とジェネレータのみのRLベースラインよりも構造化された決定精度を向上させる。
論文 参考訳(メタデータ) (2026-05-08T17:00:38Z) - Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation [50.23374353859762]
多様な単発デモを収集することで「最大限のカバレッジ」を達成できる。
我々は、この現象を包括的-密度トレードオフとして定式化する。
Anchor-Centric Adaptation (ACA) は、2段階のフレームワークで、まずコアアンカーでの繰り返しデモを通じてポリシースケルトンを安定化し、次に教師力によるエラーマイニングと制約付き残差更新を通じて高リスク境界までカバー範囲を広げる。
論文 参考訳(メタデータ) (2026-05-08T07:35:24Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Conformal Thinking: Risk Control for Reasoning on a Compute Budget [60.65072883773352]
大規模言語モデル(LLM)の推論により、トークンの予算が増加するにつれて、データセットレベルの精度が向上する。
我々は、予算設定問題をリスクコントロールとして再設定し、計算を最小化しながらエラー率を制限する。
我々のフレームワークは、モデルが自信のあるときに推論を停止する上位しきい値と、未解決のインスタンスを事前に停止させる新しい下位しきい値を導入する。
論文 参考訳(メタデータ) (2026-02-03T18:17:22Z) - Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models [63.368505631152594]
安全調整は、大きな推論モデル(LRM)の一般的な推論能力を乱す安全税を発生させる。
LRMの安全アライメントに使われる既存のデータセットは、通常、外部のLRMまたは人間のラベルから安全推論の痕跡と回答を蒸留することによって構築される。
本稿では,DGRと呼ばれる安全アライメントデータセット構築手法を提案する。DGRは,既存のアウト・オブ・ディストリビューション型安全推論データセットを改良し,目標のLLM内部分布に適合させる。
論文 参考訳(メタデータ) (2026-02-02T14:18:48Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Audit the Whisper: Detecting Steganographic Collusion in Multi-Agent LLMs [0.0]
Audit the Whisperは、理論、ベンチマーク設計、検出、検証にまたがるカンファレンスグレードの研究成果物である。
i) パラフレーズ, レート制限, 役割置換などの介入が, ペアリングしたKullback-Leibler診断によって定量的なペナルティの操作を課すことを示すチャネル容量分析を行った。
我々は、匿名化された再生スクリプト、匿名化されたマニフェスト、ドキュメントをリリースし、外部監査官がすべての図を再現し、二重盲検要件を満たし、最小限の努力でフレームワークを拡張します。
論文 参考訳(メタデータ) (2025-10-05T17:51:52Z) - Conditional Conformal Risk Adaptation [9.559062601251464]
セグメンテーションタスクの条件付きリスク制御を大幅に改善する適応予測セットを作成するための新しいスコア関数を開発する。
画素単位での包含推定の信頼性を高めるための特殊確率校正フレームワークを提案する。
ポリープセグメンテーション実験により, 3つの手法が有意な限界リスク制御を提供し, より一貫した条件リスク制御を実現することを示した。
論文 参考訳(メタデータ) (2025-04-10T10:01:06Z) - Safe Deployment for Counterfactual Learning to Rank with Exposure-Based
Risk Minimization [63.93275508300137]
本稿では,安全な配置を理論的に保証する新たなリスク認識型対実学習ランク法を提案する。
提案手法の有効性を実験的に検証し,データが少ない場合の動作不良の早期回避に有効であることを示す。
論文 参考訳(メタデータ) (2023-04-26T15:54:23Z) - How does the Combined Risk Affect the Performance of Unsupervised Domain
Adaptation Approaches? [33.65954640678556]
unsupervised domain adaptation (uda)は、ソースドメインからのラベル付きサンプルとターゲットドメインからのラベルなしサンプルでターゲット分類器をトレーニングすることを目的としている。
e-mixnetは、ラベル付きソースサンプルと疑似ラベル付きターゲットサンプルに汎用的なビビナル分布である強化ミックスアップを使用して、複合リスクのプロキシを計算する。
論文 参考訳(メタデータ) (2020-12-30T00:46:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。