論文の概要: The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF
- arxiv url: http://arxiv.org/abs/2605.29491v1
- Date: Thu, 28 May 2026 07:18:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.929982
- Title: The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF
- Title(参考訳): ヘルプフルネスの曲線:DistractionIFによるロバストネスとディトラクタインストラクションの逆スケーリング法則
- Authors: Zeli Su, Zhankai Xu, Tianlei Chen, Longfei Zheng, Xiaolu Zhang, Jun Zhou, Wentao Zhang,
- Abstract要約: 大規模言語モデル (LLM) は、エージェントおよび検索強化世代 (RAG) システムにますます多くデプロイされている。
実際には、そのような文脈は、しばしば非構造化され、良性だが命令のようなセマンティックノイズで汚染される。
本稿では、参照テキストにおけるそのような注意散らし命令に対する堅牢性を評価するためのベンチマークであるDistractionIFを紹介する。
- 参考スコア(独自算出の注目度): 19.923694743124475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed in agentic and retrieval-augmented generation (RAG) systems, where they must execute user-specified tasks over externally provided reference text. In practice, such context is often unstructured and contaminated with benign but instruction-like semantic noise, such as editorial comments and system traces, which should be treated strictly as data. We introduce DistractionIF, a benchmark designed to evaluate robustness against such distractor instructions in reference text. Across a broad range of models, we observe a consistent inverse scaling phenomenon: larger models are often less robust, with performance dropping by up to 30 points as scale increases. Mechanistically, our perplexity analysis reveals that scaling erodes the probabilistic boundary between robust and distracted behaviors, making models increasingly prone to over-interpreting noise as instructions. To address this, we demonstrate that reinforcement learning, specifically Group Relative Policy Optimization (GRPO), can restore this boundary, improving robustness by up to 15.5% without compromising general instruction-following capability. Our findings highlight a critical instruction-following robustness gap in reference-grounded tasks and establish reinforcement learning as a promising path for enforcing strict data-instruction separation at scale.
- Abstract(参考訳): 大規模言語モデル (LLM) は、エージェントおよび検索拡張世代 (RAG) システムにますますデプロイされ、外部に提供された参照テキスト上でユーザ指定タスクを実行する必要がある。
実際には、このようなコンテキストは、しばしば非構造化され、良心的だが命令のようなセマンティックノイズ(編集コメントやシステムトレースなど)で汚染され、厳密にはデータとして扱われるべきである。
本稿では、参照テキストにおけるそのような注意散らし命令に対する堅牢性を評価するためのベンチマークであるDistractionIFを紹介する。
広い範囲のモデルにおいて、我々は一貫した逆スケーリング現象を観察する: 大きなモデルは多くの場合、スケールが増加するにつれて、パフォーマンスが最大30ポイント低下する。
機械学的には、我々のパープレキシティ分析は、スケーリングが頑健な行動と気を散らした行動の確率的境界を損なうことを示し、モデルが指示としてノイズを過度に解釈する傾向を増す。
これを解決するために、強化学習、特にグループ相対政策最適化(GRPO)がこの境界を回復し、一般的な指示追従能力を損なうことなく、最大15.5%の堅牢性を向上できることを示した。
本研究は, 基準接地作業において, 重要な指導・追従の堅牢性ギャップを浮き彫りにし, 大規模に厳密なデータ指示分離を行う上で有望な経路として強化学習を確立することを目的とした。
関連論文リスト
- A Sentence Relation-Based Approach to Sanitizing Malicious Instructions [15.879266080043076]
現在の防衛措置は、しばしばLLMベースの検出器を使用して、そのようなコンテンツをフィルタリングする。
SONARは,自然言語推論のメトリクスを用いて注入されたコンテンツを識別・除去する,迅速な衛生化フレームワークである。
SONARは攻撃成功率をほぼゼロに減らし、確立された9つのベースライン防御を著しく上回った。
論文 参考訳(メタデータ) (2026-05-01T20:22:40Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment [97.55382322103986]
Hit-RAGは認知的ボトルネックを解決するために設計された多段階の優先順位調整フレームワークである。
本手法は,3つの異なる段階を通じて外部証拠の利用を体系的に改善する。
論文 参考訳(メタデータ) (2026-03-07T04:05:27Z) - Lost in the Noise: How Reasoning Models Fail with Contextual Distractors [57.31788955167306]
推論モデルとエージェントAIシステムの最近の進歩は、多様な外部情報への依存度を高めている。
NoisyBenchは、RAGの11のデータセット、推論、アライメント、ツール使用タスクに対して、モデルロバスト性を体系的に評価する包括的なベンチマークである。
評価の結果,文脈的障害に直面した場合,最先端モデルでは最大80%の破滅的な性能低下がみられた。
論文 参考訳(メタデータ) (2026-01-12T05:43:51Z) - InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized Rationales [14.655518998487237]
InstructRAGを提案する。そこでは、LMが自己合成的理性を通して認知過程を明示的に学習する。
インストラクションRAGは追加の監視を必要としないため、予測された回答の検証が容易になる。
実験によると、InstructRAGはトレーニング不要とトレーニング可能な両方のシナリオにおいて、既存のRAGメソッドを一貫して上回っている。
論文 参考訳(メタデータ) (2024-06-19T15:25:29Z) - Benchmarking the Robustness of LiDAR Semantic Segmentation Models [78.6597530416523]
本稿では,LiDARセマンティックセグメンテーションモデルのロバスト性を,様々な汚職の下で包括的に解析することを目的とする。
本稿では,悪天候,計測ノイズ,デバイス間不一致という3つのグループで16のドメイン外LiDAR破損を特徴とするSemanticKITTI-Cというベンチマークを提案する。
我々は、単純だが効果的な修正によってロバスト性を大幅に向上させるロバストLiDARセグメンテーションモデル(RLSeg)を設計する。
論文 参考訳(メタデータ) (2023-01-03T06:47:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。