論文の概要: DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments
- arxiv url: http://arxiv.org/abs/2607.17291v1
- Date: Sun, 19 Jul 2026 15:20:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.42209
- Title: DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments
- Title(参考訳): DRNOISE: ミスリーディングエビデンス環境におけるディープリサーチエージェントのベンチマーク
- Authors: Jun Nie, Zhiqin Yang, Zhenheng Tang, Yonggang Zhang, Xiaowen Chu, Xinmei Tian, Bo Han,
- Abstract要約: 誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
- 参考スコア(独自算出の注目度): 51.049999642138
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep research agents increasingly operate over the open web, where relevant records coexist with redundant summaries, outdated reports, and misleading documents. Existing evaluations offer limited insight into whether agents preserve sound evidential standards when an ordinary-looking false document is deliberately seeded into a searchable environment and offers a direct shortcut to a conflicting answer. We introduce DRNOISE, a 100-task benchmark for answer recovery under misleading evidence. Each task has a unique gold answer supported by two corroborating indirect record chains; the paired noisy condition adds one plausible document that states a conflicting answer directly. The benchmark spans ten families of evidence operations. Across agents with strong clean-task performance, this single intervention causes 66-88 percentage-point accuracy drops. Trace analyses identify verification inertia as the dominant failure mode: agents often retrieve truthful records but stop before completing and reconciling the evidence chain, instead deferring to the answer-like document. Generic verification prompts reduce but do not close this gap. The setting is especially relevant to open-web deployment, where plausible falsehoods arrive through ordinary-looking pages rather than explicit attacks. Reliable deep research therefore requires more than retrieval and citation; it requires active reconciliation of direct claims with record-level evidence.
- Abstract(参考訳): ディープ・リサーチ・エージェントはオープンウェブ上でますます活動し、関連する記録は冗長な要約、時代遅れなレポート、誤解を招く文書と共存している。
既存の評価は、通常の偽文書が意図的に検索可能な環境にシードされ、矛盾する答えに直接的なショートカットが提供される場合に、エージェントが明らかな標準を守るかどうかについて限定的な洞察を与える。
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
ベンチマークは10種類のエビデンス操作にまたがる。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
追跡分析は、検証慣性が主流の障害モードであると同定する: エージェントはしばしば真偽のレコードを検索するが、エビデンスチェーンを完了して和解する前に停止し、代わりに回答のような文書に延期する。
ジェネリック検証は減少を促すが、このギャップを埋めない。
この設定は特にオープンなWebデプロイメントに関連している。
したがって、信頼性の高いディープリサーチは、検索と引用以上のものを必要とし、記録レベルの証拠と直接のクレームを積極的に和解させる必要がある。
関連論文リスト
- WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning [63.9071746889252]
長い文書に複雑な質問を答えるには、ソース自体が遠くの通路に自然に分散する証拠を統合する必要がある。
この情報源と内部の証拠の統合は、現実世界の長期文書分析の中心であるが、既存のベンチマークはそのほとんどを横取りしている。
WILDTRACEは, 自然発生の214個の長形音源に対する481個のタスクのベンチマークである。
論文 参考訳(メタデータ) (2026-07-10T12:09:21Z) - From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents [8.49451413641847]
研究生成が安価になるにつれて、監査可能性がボトルネックになる、と我々は主張する。
この観点からは,ディープリサーチエージェントの第一級設計および評価対象として,クレームレベルの監査性を提案する。
論文 参考訳(メタデータ) (2026-02-14T19:39:15Z) - PATHWAYS: Evaluating Investigation and Context Discovery in AI Web Agents [0.0]
PATHWAYSは250のマルチステップ決定タスクのベンチマークである。
Webベースのエージェントが、隠れたコンテキスト情報を発見し、正しく使用できるかをテストする。
論文 参考訳(メタデータ) (2026-02-05T06:24:23Z) - Orchestrating Specialized Agents for Trustworthy Enterprise RAG [8.772844442593975]
1パスの検索/書き込みパイプラインは、しばしば浅い要約を生成する。
本稿では,線形検索を反復的かつユーザによる調査に置き換えるエージェントフレームワークであるADOREを紹介する。
私たちのコントリビューションは、メモリロック合成、エビデンスカバレッジ誘導実行、セクションパック長文グラウンドティングの3つです。
論文 参考訳(メタデータ) (2026-01-26T08:48:41Z) - Collapse of Dense Retrievers: Short, Early, and Literal Biases Outranking Factual Evidence [56.09494651178128]
検索モデルは、Retrieval-Augmented Generation (RAG)のような情報検索(IR)アプリケーションで一般的に使用される。
我々は、Dragon+やContrieverのようなリトリーバーに対する、短いドキュメントの好みなどのバイアスの影響を定量化する。
私たちは大きな脆弱性を発見し、リトリバーが短いドキュメント、早い位置、繰り返しのエンティティ、リテラルマッチを好んで、答えの存在を無視しながら表示します。
論文 参考訳(メタデータ) (2025-03-06T23:23:13Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。