論文の概要: WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning
- arxiv url: http://arxiv.org/abs/2607.09328v1
- Date: Fri, 10 Jul 2026 12:09:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.836092
- Title: WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning
- Title(参考訳): WILDTRACE:Long-Context Reasoningにおける自然なエビデンストレイルのベンチマーク
- Authors: Zixin Chen, Peng Liu, Haobo Li, Rui Sheng, Jianhong Tu, Xiaodong Deng, Fei Huang, Kashun Shum, Dayiheng Liu, Huamin Qu,
- Abstract要約: 長い文書に複雑な質問を答えるには、ソース自体が遠くの通路に自然に分散する証拠を統合する必要がある。
この情報源と内部の証拠の統合は、現実世界の長期文書分析の中心であるが、既存のベンチマークはそのほとんどを横取りしている。
WILDTRACEは, 自然発生の214個の長形音源に対する481個のタスクのベンチマークである。
- 参考スコア(独自算出の注目度): 63.9071746889252
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Answering complex questions over long documents frequently requires integrating evidence that the source itself disperses naturally across distant passages. In an incident report, the operating condition, design flaw, and missed safety check that jointly explain a disaster may appear dozens of sections apart; in a novel, a character's true motive may surface only through scenes far removed from the moment it becomes relevant. This source-internal evidence integration is central to real-world long-document analysis, yet existing benchmarks largely sidestep it. Needle probes, planted facts, and reverse-engineered multi-hop chains embed evidence that may differ from the host text in distribution, placement, or register, making it unclear whether strong performance reflects genuine source reasoning or distributional artifacts. We introduce WILDTRACE, a benchmark of 481 tasks over 214 naturally occurring long-form sources such as technical incident reports and lesser-known literary narratives, where all evidence trails arise from the document's own causal, temporal, and narrative logic. Drawing on Pearl's causal hierarchy and prior multi-hop reasoning typologies, we define seven source-internal evidence geometries that characterize the distinct relational demands of analytical reading in long documents. A source-first construction pipeline mines candidate trails from document structure before writing questions; each item then undergoes multi-stage validation covering clue necessity, answer groundedness, rubric fidelity, contamination resistance and answerability. As models are increasingly entrusted with real-world high-stakes analytical tasks, this gap between accessing information and reasoning over naturally dispersed evidence emerges as a defining challenge for the next stage of long-context research.
- Abstract(参考訳): 長い文書に複雑な質問を答えるには、ソース自体が遠くの通路に自然に分散する証拠を統合する必要がある。
インシデントレポートでは、災害を共同で説明する操作条件、設計上の欠陥、ミスセーフティチェックが数十のセクションに分かれている可能性があるが、小説では、キャラクターの真の動機は、それが関係する瞬間から取り除かれたシーンを通してのみ現れる。
この情報源と内部の証拠の統合は、現実世界の長期文書分析の中心であるが、既存のベンチマークはそのほとんどを横取りしている。
針プローブ、植えられた事実、リバースエンジニアリングされたマルチホップチェーンは、分布、配置、レジスタのホストテキストと異なる証拠を埋め込んでおり、強い性能が真のソースの推論や分布のアーティファクトを反映しているかどうかは不明である。
WILDTRACEは、技術的事件報告やあまり知られていない文学的物語など、自然に発生する214以上の481のタスクのベンチマークであり、すべての証拠が文書の因果関係、時間的、物語論理から生じる。
パールの因果的階層と先行するマルチホップ推論の類型学に基づいて、長文における解析的読解の明確な関係要求を特徴付ける7つの情報源-内部的エビデンス・ジオメトリーを定めている。
ソースファースト構築パイプラインは、質問を書く前に文書構造から候補パスをマイニングし、各項目は、手掛かりの必要条件、答えの土台性、ルーリックな忠実性、汚染耐性、応答性を含む多段階の検証を行う。
モデルが現実世界の高度な分析タスクにますます信頼されているため、情報へのアクセスと自然に散在する証拠の推論のギャップは、長期研究の次の段階における決定的な課題として現れている。
関連論文リスト
- Building Agent Harnesses for Scientific Curation from Multimodal Sources [17.12384426105798]
我々はマルチモーダルソースからの科学的キュレーションを研究し、科学論文から構造化情報を抽出するエージェントハーネスであるBeaverを紹介した。
我々は,Beaverがゴールドレコメンデーション・アトリビュート・スコア(GRAS)で81.0に達することを示す。
論文 参考訳(メタデータ) (2026-06-19T00:36:34Z) - Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation [74.0621258662676]
レポート生成のためのマルチエージェントハーネスであるPtahを提案する。
Ptahは計画、研究、執筆段階を通じて、ユーザクエリからレンダリングされたWebレポートまでのライフサイクルを編成する。
検証エージェントがハーネスの受け入れ機能として機能し、ワークフロー全体を通して事実的接地、引用の忠実性、相互の整合性を強制する。
論文 参考訳(メタデータ) (2026-05-28T12:40:34Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research [73.58638285105971]
本稿では,AIエージェントが膨大なWebスケール情報を洞察に富むレポートに合成しなければならない複雑な課題であるtextbfopen-ended Deep Research (OEDR) に取り組む。
人間の研究プロセスをエミュレートする新しいデュアルエージェントフレームワークである textbfWebWeaver を紹介する。
私たちのフレームワークは、DeepResearch Bench、DeepConsult、DeepResearchGymなど、主要なOEDRベンチマークにまたがる最先端の新たなベンチマークを確立しています。
論文 参考訳(メタデータ) (2025-09-16T17:57:21Z) - Graph-based Retrieval for Claim Verification over Cross-Document
Evidence [0.6853165736531939]
グラフに基づくアプローチは、断片化された証拠を特定するのに役立つと推測する。
我々はこの仮説を、コーパス全体にわたって、上述したエンティティによってテキスト部分を相互接続する大きなグラフを構築して検証した。
実験により,グラフ構造を活用することは,クレームに関連する通路のごく一部を特定する上で有益であることが確認された。
論文 参考訳(メタデータ) (2021-09-13T14:54:26Z) - Topic-Aware Evidence Reasoning and Stance-Aware Aggregation for Fact
Verification [19.130541561303293]
本稿では,事実検証のための新たな話題認識型証拠推論とスタンス認識型アグリゲーションモデルを提案する。
2つのベンチマークデータセットで実施されたテストは、事実検証のためのいくつかの最先端アプローチよりも提案モデルの方が優れていることを示す。
論文 参考訳(メタデータ) (2021-06-02T14:33:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。