論文の概要: Revision-Aware Independent Agent Graphs for Dynamic Reasoning
- arxiv url: http://arxiv.org/abs/2610.01249v1
- Date: Thu, 01 Oct 2026 07:43:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.973269
- Title: Revision-Aware Independent Agent Graphs for Dynamic Reasoning
- Title(参考訳): 動的推論のためのリビジョン対応独立エージェントグラフ
- Abstract要約: イベントストリームがタスクバインディングを更新し、システムはそれを解決する前に各クエリ時に有効なドキュメントバージョンを選択する必要がある。
本稿では,タスク推論から決定論的時間分解を分離する多エージェントポリシーであるRevision-Aware Independent Agent Graph (RIAG)を紹介する。
- 参考スコア(独自算出の注目度): 2.975383238535746
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Conventional reasoning protocols present a fixed, preselected task, so they cannot test whether an agent propagates relevant updates, preserves unaffected work, or reconstructs a historical task binding. We therefore study \emph{dynamic task routing}, in which an event stream revises task bindings and a system must select the document version valid at each query time before solving it. To study this problem, we repurpose six widely used benchmarks: MMLU, MMLU-Pro, MedMCQA, MATH, GPQA, and HumanEval into 31{,}119 dynamic episodes comprising 373{,}428 temporally categorized queries. This setting exposes a central trade-off: recomputing after every event wastes work, whereas unguarded reuse returns stale conclusions. We introduce the Revision-Aware Independent Agent Graph (RIAG), a bounded multi-agent policy that separates deterministic temporal resolution from task reasoning. RIAG caches solutions by immutable document identity, starts each fresh task with two unexposed attempts, and conditionally invokes audit and repair, using at most four calls per document version. On this collection, homogeneous RIAG achieves 54.24\% joint routing-and-answer accuracy at 0.62 calls/query, compared with 32.22\% at 18.00 calls/query for the strongest comparison method; heterogeneous RIAG reaches 49.78\% at 0.63 calls/query.
- Abstract(参考訳): 従来の推論プロトコルは固定された事前選択されたタスクを提示するので、エージェントが関連する更新を伝播するか、影響を受けない作業を保存するか、過去のタスクバインディングを再構築するかを検査することはできない。
そこで、イベントストリームがタスクバインディングを更新し、システムはそれを解決する前に各クエリ時に有効なドキュメントバージョンを選択する必要がある。
本研究では,MMLU,MMLU-Pro,MedMCQA,MATH,GPQA,HumanEvalの6つのベンチマークを373{,}428の時間的分類クエリからなる31{,}119の動的エピソードに再利用した。
すべてのイベントが処理を無駄にした後で再計算するのに対して、保護されていない再利用は古い結論を返します。
本稿では,タスク推論から決定論的時間分解を分離する多エージェントポリシーであるRevision-Aware Independent Agent Graph (RIAG)を紹介する。
RIAGはイミュータブルなドキュメントIDによってソリューションをキャッシュし、2つの未公開の試行で各新しいタスクを起動し、条件付きで監査と修復を起動する。
このコレクションでは、同種RIAGは54.24\%の結合ルーティング/問合せ精度を0.62コール/問合せで達成し、最強比較法では32.22\%、最強比較法では18.00コール/問合せで達成し、異種RIAGは0.63コール/問合せで49.78\%に達する。
関連論文リスト
- RoutePrism: Tracing Construction Order Effects in Agent Memory [16.745093090677475]
RoutePrismは、2つの処理順序で同じソースプールから2回メモリを構築する。
再注文によって取り消されたレコードが実際にタスク関連証拠であったかどうかの4条件の介入テストが一致した。
論文 参考訳(メタデータ) (2026-09-28T02:37:57Z) - Iris: Climbing to the Search Frontier [21.066541702697112]
我々は35B-A3Bスケールと397B-A17Bスケールでトレーニングされた2つの検索エージェントであるIris-miniとIris-proを紹介する。
論文 参考訳(メタデータ) (2026-09-03T17:51:01Z) - EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy [50.665874114632]
我々は、完全な応答レベルの検証ワークフローを統一ポリシーとして制御することを学ぶ、エンドツーエンドのエージェント検証であるEAVerを紹介する。
EAVerはセマンティック関連クレームをグループ化し、信頼に基づいた直接検証やターゲット検索にルートし、コンパクトなインコンテキストメモで検索によって返される証拠を保持する。
論文 参考訳(メタデータ) (2026-09-02T21:00:35Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval [65.89247522243959]
VisDocAgentBenchは、静的検索とエージェント検索を比較したクローズドコーパスベンチマークである。
100の文書から2,375ページ、120のユニークなターゲットクエリが直接、一橋、二橋のエビデンス構造でバランスを取っている。
強力な遅延対話型ビジュアルレトリバーは、直接アイテムで97.50%のRecall@1に達するが、2ブリッジアイテムでは2.50%に達し、関連性がコーパスコンテキストに依存する場合のクエリ-ターゲットマッチングの限界を明らかにする。
論文 参考訳(メタデータ) (2026-08-18T15:23:06Z) - When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory [21.87512744606154]
エージェント制御されたサーチインターフェースであるReFindについて,セマンティックな構造をまったく構築しない。
会話アーカイブを変更せずに残し、行の粒度を辞書でインデックスし、一般的な反復的なキーワード検索ループと4つのチャットネイティブコントロールを組み合わせる。
最強のグラフおよびツリーベースのメモリシステムよりも高い平均精度(58.2)を達成した。
論文 参考訳(メタデータ) (2026-08-13T07:10:22Z) - AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning [52.23991730630292]
大規模言語モデルは、パラメトリックな知識から答えるのではなく、文書を推論するエージェントとして、ますます多くデプロイされている。
大規模な、散らかった職場ファイルの集合にスパース証拠を配置し、一貫性のない用語、単位、時間規則を調整し、答えを計算する。
私たちは、362の質問と9,664の認証ドキュメントと372Mのトークンの8つのドメインコレクションをペアリングするベンチマークであるAgoraを紹介します。
論文 参考訳(メタデータ) (2026-06-23T12:57:18Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - Query Resolution for Conversational Search with Limited Supervision [63.131221660019776]
本稿では,双方向トランスフォーマに基づくニューラルクエリ解決モデルQuReTeCを提案する。
我々はQuReTeCが最先端モデルより優れており、また、QuReTeCのトレーニングに必要な人為的なデータ量を大幅に削減するために、我々の遠隔監視手法が有効であることを示す。
論文 参考訳(メタデータ) (2020-05-24T11:37:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。