論文の概要: From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation
- arxiv url: http://arxiv.org/abs/2608.23045v1
- Date: Mon, 24 Aug 2026 09:50:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.9968
- Title: From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation
- Title(参考訳): 慣性から客観性へ:騒音を除去したディープリサーチエージェントの改良
- Abstract要約: ディープリサーチタスクは、繰り返し発生する障害モードを露呈する: エージェントがクエリ、プラン、中間的な結論を生成すれば、後になって同じアクションの結果を判断すると、それはより客観的になる。
IBISベンチマークでは,モデルが先行動作の結果を評価しているかどうかを検証しながら,探索観測を制御している。
モデルが前回の検索ステップを所有するとさらに悪化し,自己権限の行動履歴がその後の判断を体系的に歪めてしまうことが判明した。
- 参考スコア(独自算出の注目度): 20.84056672956731
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Web search agents powered by Large Language Models (LLMs) show strong promise, but deep research tasks expose a recurring failure mode: once an agent has produced a query, plan, or intermediate conclusion, it becomes less objective when later judging the consequences of that same action. We term this phenomenon \textbf{inertia bias}. To make it measurable, we introduce the IBIS benchmark, which controls the search observations while varying whether the model is evaluating the outcome of its own prior action. We find that models are substantially worse when they ``own'' the preceding search step, showing that self-authored action history can systematically distort subsequent judgment. We further show that this bias propagates into two forms of system-level degradation: search noise at the worker level and contextual noise at the manager level. To address this problem, we propose NIS-Agent, which applies context isolation at the two decision points most vulnerable to inertia bias: webpage triage and final-answer validation. Across GAIA, WebWalkerQA, BrowseComp, and BrowseComp-zh, NIS-Agent achieves competitive performance while reducing token cost by 33\% compared to our baseline. We further train an 8B model to be intrinsically more resistant to inertia bias; under the same NIS-Agent framework, it attains average performance comparable to GPT-4o on deep research benchmarks.
- Abstract(参考訳): 大規模言語モデル(LLM)を利用したWeb検索エージェントは、強い約束を示すが、深い研究タスクは繰り返し発生する障害モードを露呈する。
この現象をtextbf{inertia bias} と呼ぶ。
IBISベンチマークでは,モデルが先行動作の結果を評価しているかどうかを検証しながら,探索観測を制御している。
先行する探索ステップを'own'すると,モデルが著しく悪化し,自己権限の行動履歴がその後の判断を体系的に歪めてしまうことが分かる。
さらに, このバイアスは, 作業者レベルでの探索ノイズと管理者レベルでの文脈ノイズという, システムレベルの劣化の2つの形態に伝播することを示した。
この問題に対処するために,Webページトリアージとファイナル・アンサー・バリデーションという,慣性バイアスに最も弱い2つの決定点にコンテキスト分離を適用したNIS-Agentを提案する。
GAIA, WebWalkerQA, BrowseComp, BrowseComp-zh全体では, NIS-Agentは, トークンコストをベースラインに比べて33倍削減しながら, 競争性能を実現している。
NIS-Agentフレームワークでは、ディープリサーチベンチマークにおいて、GPT-4oに匹敵する平均性能が得られる。
関連論文リスト
- WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents [53.426679066400844]
WeAgent-Harnessは、ネイティブテキストビジョンインタラクションと実行時リカバリをサポートするマルチモーダルエージェントハーネスである。
WeAgent-MMSearchは,データ構築,エージェントポストトレーニング,マルチモーダルロールアウトにまたがる統合システムである。
また、150タスクの人間認証ベンチマークであるVisTarget-Benchを紹介します。
論文 参考訳(メタデータ) (2026-08-28T08:28:43Z) - Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution [47.70578021328887]
大規模言語モデル(LLM)ベースのマルチエージェントシステムは、しばしば複雑な障害モードを示す。
AFANetは、ステップレベルの意味信号とエージェントレベルの関係を通して相互作用軌跡をモデル化する軽量なグラフベースのフレームワークである。
以上の結果から, エージェント障害の効果的な帰属は大きな推論を必要とせず, 軽量で構造化されたアプローチで高い性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2026-08-19T06:16:09Z) - Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection [80.15317858033534]
ForeAgentは、反復的な自己進化を伴うAI生成画像検出のためのエージェント法医学フレームワークである。
ForeAgentはChameleonベンチマークで最先端のパフォーマンスを達成し、精度は82.18%に達した。
ForeAgent は GPT-5 や GPT-5-mini と比較して、より一貫性があり、因果的な推論をもたらす。
論文 参考訳(メタデータ) (2026-06-25T02:59:33Z) - DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents [24.61813749877376]
Deepening Reasoning MMSearchAgentは、バッチ全体におけるロールアウトトラジェクトリ全体のメリット信号を導出する。
ガウスの区別された報酬は 動的に 相互作用耐性を校正するために使われる
FVQAテストでMMSearch-R1を8.4$%上回り、最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-04-21T09:28:34Z) - OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows [9.617220633655716]
textbfunderlineOmni-textbfunderlineModality textbfunderlineGeneration Agent (textbfOMG-Agent)について述べる。
論文 参考訳(メタデータ) (2026-02-04T02:25:40Z) - Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search [56.78490647843876]
エージェント検索は、大規模言語モデル(LLM)が推論とツールの使用をインターリーブできるようにすることによって、複雑な情報を探すための有望なパラダイムとして登場した。
本稿では,bfM-ASKを提案する。bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK。
論文 参考訳(メタデータ) (2026-01-08T08:13:27Z) - VAR: Visual Attention Reasoning via Structured Search and Backtracking [49.427842994857635]
構造化された検索としてグラウンドド推論をリキャストするフレームワークであるVisual Attention Reasoningを紹介する。
VARは、推論プロセスを2つの重要な段階に分解する。
我々は、我々の7BモデルであるVAR-7Bが、幻覚と安全性のベンチマークの包括的なスイートに新しい最先端を設定していることを示します。
論文 参考訳(メタデータ) (2025-10-21T13:18:44Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - How can we assess human-agent interactions? Case studies in software agent design [52.953425368394306]
我々は,人間とエージェントの相互作用の厳密な評価に向けて,二つの大きな一歩を踏み出した。
エージェント設計のより効率的な人間中心評価のためのフレームワークであるPULSEを提案する。
私たちは、オープンソースのソフトウェアエージェントOpenHandsを中心に構築された大規模なWebプラットフォームにフレームワークをデプロイします。
論文 参考訳(メタデータ) (2025-10-10T19:04:28Z) - Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them [23.986035712600657]
エージェント探索における効果的な推論行動パターンを研究するための推論駆動パイプラインを提案する。
我々は,情報検証,権限評価,適応探索,エラー回復の4つの有益な推論行動を特定する。
Llama3.2-3B と Qwen3-1.7B では, RL を用いたエージェントサーチモデルを直接訓練した場合と比較して, 行動プライミングが 35% 以上の利得を示す。
論文 参考訳(メタデータ) (2025-10-08T00:20:35Z) - AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search [58.98450205734779]
大規模言語モデル(LLM)エージェントは、多様なドメインにまたがる強力な機能を示している。
既存のエージェントサーチ手法には3つの大きな制限がある。
これらの課題に対処するための包括的なフレームワークを導入します。
論文 参考訳(メタデータ) (2025-06-06T12:07:23Z) - $C^3$-Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking [12.218102495632937]
エージェントの堅牢性を評価するためのオープンソースベンチマークをC3$-Benchで提示する。
具体的には,複雑なツール関係をナビゲートし,重要な隠蔽情報を処理し,動的決定経路を管理する,という3つの課題を設計する。
本質的に$C3$-Benchは、これらの課題を通じてモデル脆弱性を公開し、エージェントパフォーマンスの解釈可能性の研究を促進することを目的としている。
論文 参考訳(メタデータ) (2025-05-24T15:25:44Z) - Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty [21.96443267949563]
エージェント検索型Augmented Generation (RAG) システムは,動的かつ多段階の推論と情報検索を可能にし,Large Language Models (LLM) を強化する。
これらのシステムは、オーバーサーチ(冗長な情報を取得する)やアンダーサーチ(必要な情報を取得するのに失敗する)のような準最適探索行動を示すことが多い。
この研究は、これらの振る舞いを公式に定義し、定量化し、複数のQAデータセットとエージェントRAGシステムにまたがるそれらの頻度を明らかにする。
論文 参考訳(メタデータ) (2025-05-22T20:57:56Z) - Tree Search for Language Model Agents [73.97960454223164]
対話型Web環境での探索と多段階計画を行うために,LMエージェントの推論時探索アルゴリズムを提案する。
我々のアプローチは、実環境空間内で機能する最優先木探索の一形態である。
現実的なWebタスクにおいて有効性を示すLMエージェントのための最初の木探索アルゴリズムである。
論文 参考訳(メタデータ) (2024-07-01T17:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。