論文の概要: IH-Benchmark: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications
- arxiv url: http://arxiv.org/abs/2607.25987v2
- Date: Wed, 29 Jul 2026 14:39:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.74353
- Title: IH-Benchmark: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications
- Title(参考訳): IH-Benchmark: LLMアプリケーションにおける命令階層ロバストネスのための競合中心ベンチマーク
- Authors: Conor McCauley, Zeliang Kan, Jason Martin,
- Abstract要約: IH-Benchmarkは、直接システムユーザ競合(S>U)とツール経由のユーザツール競合(U>T)にまたがる、命令階層の堅牢性のためのコンフリクト中心のベンチマークである。
37モデル中、階層順守は98.2%から20.5%の範囲で評価されている。
強いS>Uコンプライアンスは、U>Tロバストネスの信頼できるプロキシではないことが分かりました。
- 参考スコア(独自算出の注目度): 1.9966419762834917
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a language model receives conflicting instructions from different priority levels, which one does it actually follow? This question lies at the heart of reliable LLM deployment. Existing benchmarks answer this only partially, often focusing on a single hierarchy edge or adapting public datasets with limited tool-use coverage. We present IH-Benchmark, a conflict-centered benchmark for instruction-hierarchy robustness across direct system-user conflicts (S>U) and tool-mediated user-tool (U>T) conflicts. IH-Benchmark is built from a human-authored taxonomy of 44 constraint families across generic, health, finance, retail, and coding settings, and evaluates scenarios with a uniform binary pass/fail protocol combining a predicate DSL with category-scoped LLM judges. Across 37 evaluated models, hierarchy compliance ranges from 98.2% to 20.5%. We find that strong S>U compliance is not a reliable proxy for U>T robustness: several models preserve system constraints under direct user conflict but degrade sharply when conflicting instructions appear in tool outputs. Constraint hardening also reveals a split between models: some failures are largely fixed by stronger warnings, while others persist across all strictness levels. Finally, the most revealing failures are often subtle rather than overtly dangerous; models resist unauthorized purchases or bulk ticket closure more reliably than injected disclaimers or small factual distortions. These results suggest that instruction-hierarchy robustness is not a single capability, but a set of behaviors that must be evaluated across conflict surfaces, constraint types, and attack presentations.
- Abstract(参考訳): 言語モデルが異なる優先度レベルから競合する命令を受け取るとき、実際にどの命令に従うのか?
この質問は、信頼性の高いLLMデプロイメントの中心にあります。
既存のベンチマークでは、部分的にのみ答えることができ、多くの場合、単一の階層エッジにフォーカスするか、ツールの使用範囲が限定されたパブリックデータセットを適用する。
We present IH-Benchmark, a conflict-centered benchmark for instruction-hierarchy robustness across direct system-user conflicts (S>U) and tool-mediated user-tool conflicts (U>T)。
IH-Benchmarkは、ジェネリック、ヘルス、ファイナンス、小売、コーディング設定にまたがる44の制約されたファミリーの人間による分類から構築され、述語DSLとカテゴリスコープのLLMジャッジを組み合わせた統一されたバイナリパス/フェイルプロトコルでシナリオを評価する。
37モデル中、階層順守は98.2%から20.5%の範囲で評価されている。
いくつかのモデルでは、直接ユーザ間の競合の下でシステムの制約を保っているが、ツール出力に矛盾する命令が現れると、急激に低下する。
いくつかの障害は強い警告によって主に固定されるが、他の障害はすべての厳密度レベルにわたって持続する。
最後に、最も明らかな失敗は、過度に危険というよりは微妙なものである。モデルは、不正な購入やバルクチケットの閉鎖に、注入された請求書や小さな事実の歪みよりも確実に抵抗する。
これらの結果から,命令階層の堅牢性は単一能力ではなく,競合面や制約型,攻撃的プレゼンテーションなどを通じて評価しなければならない行動の集合であることが示唆された。
関連論文リスト
- The Patchwork Problem in LLM-Generated Code [3.4562767039451674]
本稿では,リポジトリアーティファクトのグラフ表現に対する一貫性不変量として構造コヒーレンスを定式化する。
2つのフロンティアモデルに対する実証的な評価によると、構造的失敗の大部分は、型チェック、テスト、SASTを完全に回避している。
論文 参考訳(メタデータ) (2026-07-09T23:01:54Z) - Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces [32.850551109913845]
大規模言語モデル(LLM)の安全なデプロイにとって、ジェイルブレイク攻撃は依然として重要な脅威である
このプロンプト中心のパラダイムは、ステートフルで関数呼び出し環境における構造的脆弱性を見落としていることを示す。
我々は、シミュレートされたモデレーショントレースに基づくブラックボックス攻撃フレームワークであるSMTを通じて、このアーキテクチャ欠陥を利用する。
論文 参考訳(メタデータ) (2026-07-01T06:08:07Z) - PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs [1.7243216387069673]
大きな言語モデル(LLM)は、しばしば矛盾するプロンプトに遭遇する。
現在のインストラクションは、これらのメタインストラクションを独立した形で評価する。
矛盾する命令が与えられた場合のLCMの挙動を解析するためのフレームワーク textitPRIME を導入する。
論文 参考訳(メタデータ) (2026-06-21T12:30:23Z) - CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection [56.64398465636452]
ジェネレーティブAIは、マルチモーダルなフェイクニュースをますます現実的で広範にし、公共の信頼と社会的安定に深刻な脅威を与えている。
textbfConflict-textbfOriented textbfREasoning (textbfCORE) フレームワークを提案する。
COREは堅牢で一般化可能なコンフリクト検出を実現し、いくつかのサンプルやゼロショット設定で、目に見えない操作タイプに効果的かつ迅速に適応する。
論文 参考訳(メタデータ) (2026-06-02T02:53:48Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Many-Tier Instruction Hierarchy in LLM Agents [71.50171548872596]
Many-Tier Instruction Hierarchy (ManyIH)は、任意の特権レベルを持つ命令間の命令競合を解決するためのパラダイムである。
ManyIH-Benchは、LLMによって開発され、人間が検証した制約を構成し、46の現実世界のエージェントにまたがる現実的で難しいテストケースを作成する。
論文 参考訳(メタデータ) (2026-04-10T16:00:04Z) - RULERS: Locked Rubrics and Evidence-Anchored Scoring for Robust LLM Evaluation [15.787947727055611]
本稿では,自然言語ルーブを実行可能な仕様に変換するコンパイラ・エグゼクタフレームワークであるRULERSを紹介する。
RULERSは、基準をバージョニングされた不変バンドルにコンパイルし、決定論的証拠検証による構造化復号を強制し、軽量なワッサーシュタインベースのポストホックキャリブレーションを適用する。
論文 参考訳(メタデータ) (2026-01-13T15:31:42Z) - Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts [75.20929587906228]
LLM(Large Language Model)を利用したマルチエージェントシステム(MAS)は、複雑なタスクにおける協調推論、ツールの使用、役割特化調整を急速に進めている。
しかし、信頼性クリティカルなデプロイメントは、体系的な障害モード、すなわち命令の競合による階層的コンプライアンスによって妨げられている。
論文 参考訳(メタデータ) (2025-09-27T08:43:34Z) - Steerable Adversarial Scenario Generation through Test-Time Preference Alignment [58.37104890690234]
対立シナリオ生成は、自律運転システムの安全性評価のためのコスト効率の良いアプローチである。
textbfSteerable textbfAdversarial scenario textbfGEnerator (SAGE) という新しいフレームワークを導入する。
SAGEは、逆境とリアリズムの間のトレードオフを、再トレーニングなしできめ細かいテストタイムコントロールを可能にします。
論文 参考訳(メタデータ) (2025-09-24T13:27:35Z) - CONGRA: Benchmarking Automatic Conflict Resolution [3.9910625211670485]
ConGraは、ソフトウェアマージツールのパフォーマンスを評価するために設計されたベンチマークスキームである。
我々は34の現実世界プロジェクトから44,948のコンフリクトに基づいて大規模な評価データセットを構築した。
論文 参考訳(メタデータ) (2024-09-21T12:21:41Z) - AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric Knowledge [57.66282463340297]
知識の衝突は、大きな言語モデルの文脈における情報と、そのパラメータに格納された知識との相違から生じる。
コンフリクトの度合いに基づいて動的に調整の重みを推定する,AdaCADと呼ばれる細粒度なインスタンスレベルのアプローチを提案する。
ADACADは静的コントラストベースラインよりも平均QA精度14.21%(絶対)のデコードベースラインを一貫して上回り、要約の事実性を6.19倍(AlignScore)向上させることを示す。
論文 参考訳(メタデータ) (2024-09-11T16:35:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。