論文の概要: LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
- arxiv url: http://arxiv.org/abs/2607.28374v1
- Date: Thu, 30 Jul 2026 15:35:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.626232
- Title: LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
- Title(参考訳): LEDGERMIND: 構造的エビデンス・レジャーを用いたマルチモーダルエージェント推論
- Abstract要約: LedgerMindはプロビデンスに制約のあるエージェント推論エンジンである。
最終回答の精度が曖昧になる傾向にある4つの繰り返し発生する障害パターンをターゲットにしています。
答えの正確さと軌道レベルの忠実さの両方を改善する。
- 参考スコア(独自算出の注目度): 11.70343232168598
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal agents for visual question answering increasingly operate as multi-step trajectories that interleave perception, retrieval, and reasoning, yet evaluation still largely reduces to final-answer accuracy. This aggregate signal cannot tell whether a correct answer was reached through grounded evidence, language priors, or accidental error cancellation. We propose to treat a multimodal agent trajectory as a provenance-constrained state machine: tool outputs are normalized into a Structured Evidence Ledger that serves as the trajectory state, downstream reasoning and decision claims may cite only active ledger entries, grounding is checked at the entity and numeric level, and repair is realized as typed state transitions that cannot introduce content without tool-produced provenance. We instantiate this design as LedgerMind (Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger), augmented by a Three-Layer Grounding Protocol, an Adaptive Dual-Path Dispatcher that matches reasoning depth to question complexity, and an Event-Triggered Verification-and-Repair engine with a formal provenance non-amplification guarantee. We use LedgerMind to target four recurring failure patterns that final-answer accuracy tends to obscure: unsupported intermediate reasoning, citation-backed entity hallucination (Phantom Grounding), over-reasoning on simple queries, and repair-time amplification. Experiments across multiple multimodal reasoning benchmarks and backbone MLLMs show that LedgerMind improves both answer accuracy and trajectory-level faithfulness.
- Abstract(参考訳): 視覚的質問応答のためのマルチモーダルエージェントは、知覚、検索、推論をインターリーブする多段階トラジェクトリとしてますます機能するが、評価は最終回答精度に大きく低下する。
この集合信号は、根拠付けられた証拠、言語先行、偶然のエラーキャンセルによって正しい答えが到達したかどうかを判断できない。
ツール出力は、軌道状態として機能する構造化エビデンス・レジャーに正規化され、下流の推論と決定クレームは、アクティブな台帳エントリのみを引用し、実体と数値レベルでグラウンドがチェックされ、ツールが生成する前処理なしではコンテンツを導入できないタイプド状態遷移として、修復が実現される。
この設計をLedgerMind(Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger)、Three-Layer Grounding Protocol(リンク)、Aaptive Dual-Path Dispatcher(リンク)、Event-Triggered Verification-and-Repair engine(リンク)、フォーマルなプロファイナンス非増幅保証を備えた。
我々はLedgerMindを使って、ファイナル・アンサーの精度が不明瞭な4つの繰り返し発生する障害パターンをターゲットとしている: 中間推論、引用支援エンティティ幻覚(Phantom Grounding)、単純なクエリの過剰推論、そして修復時間増幅。
複数のマルチモーダル推論ベンチマークとバックボーンMLLMによる実験により、LedgerMindは応答精度と軌道レベルの忠実性の両方を改善していることが示された。
関連論文リスト
- GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification [17.595478415811687]
マルチモーダル分類は通常、すべてのモダリティが利用可能であると仮定するが、実世界の入力はしばしば不完全である。
不完全なマルチモーダル分類のための軽量な逆ファクトゲーティングフレームワークであるGAUGEを提案する。
GAUGEは、予測を意識したTaylorのエビデンススコアを通じて、すべてのユニットを参照表現に置き換える反ファクト効果をスコアする。
論文 参考訳(メタデータ) (2026-08-06T05:07:14Z) - AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows [0.0]
AuditWeaveは、AIアシストとデータ変換のステップを1つのハッシュチェーンの台帳に記録する軽量Pythonライブラリである。
本稿では,参照実装におけるオーバヘッド,拡張性,タンパー検出の正確さを設計し,評価する。
論文 参考訳(メタデータ) (2026-06-14T21:46:04Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation [4.723302382132762]
シリコングレードの正しさは、 (i) シミュレーション中心の評価の限られたカバレッジと信頼性、 (ii) 回帰と修復幻覚、 (iii) エージェントハンドオフ間で意図が再解釈される意味的ドリフトによってボトルネックが残っている。
エージェントの意図を整合させる設計契約を確立するマルチエージェントフレームワークであるVeri-Sureを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:10:23Z) - CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction [50.67483317563736]
本稿では,段階的に考察し,必要な情報を検索し,結果を生成し,自己評価を行い,結果を洗練するシステムを提案する。
CoT-Segは、思考の連鎖推論と自己補正を組み合わせることで、推論セグメンテーションを再考する、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-01-24T11:41:54Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。