論文の概要: Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents
- arxiv url: http://arxiv.org/abs/2605.31354v1
- Date: Fri, 29 May 2026 14:29:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.666399
- Title: Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents
- Title(参考訳): 資源拘束型視覚エージェントにおける共有状態協調の故障モードの診断
- Abstract要約: 雑音蓄積のレンズを用いて,弱い学習者との協調推論の失敗モードについて検討した。
本稿では,文書視覚的質問応答における情報の流れをトレースするために,読み書き検証ループを形式化する監査フレームワークであるCoSeeを紹介する。
ノイズ強化(Noss Reinforcement)、未解決のノートを証拠として再利用するPolicy Collapse(Policy Collapse)という2つの主要な障害モードを特定します。
- 参考スコア(独自算出の注目度): 2.5754366051855837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modular visual reasoning systems increasingly rely on shared working memory for multi-step collaboration, yet the failure dynamics of intermediate state evolution in low-capacity regimes remain underexplored. We study failure modes of collaborative reasoning with weak learners (4B--8B models) through the lens of noise accumulation. We introduce CoSee, an auditing framework that formalizes the read-write-verify loop to trace information flow in document visual question answering. Across multi-page, chart, and web-based benchmarks, we find a counter-intuitive degradation: naive shared workspaces often amplify hallucinations rather than resolve them. We identify two dominant failure modes: Noise Reinforcement, where ungrounded notes are reused as evidence, and Policy Collapse, where added context shifts the model toward under-specified, short-form answers. Using cost-accuracy Pareto frontiers, we show that increased compute can correlate negatively with performance without explicit verification. Our findings suggest that for resource-constrained agents, the bottleneck lies not in reasoning depth but in communication fidelity, providing trace-level diagnostics and a mechanistic baseline for reliable modular design.
- Abstract(参考訳): モジュール型視覚推論システムは、多段階協調のために共有ワーキングメモリにますます依存しているが、低容量のシステムにおける中間状態の進化の失敗のダイナミクスは未解明のままである。
雑音蓄積のレンズを用いて,弱い学習者(4B--8Bモデル)との協調推論の失敗モードについて検討した。
本稿では,文書視覚的質問応答における情報の流れをトレースするために,読み書き検証ループを形式化する監査フレームワークであるCoSeeを紹介する。
マルチページ、チャート、Webベースのベンチマークを通じて、私たちは直感に反する劣化を見つけます。
ノイズ強化(Noss Reinforcement)、未解決のノートを証拠として再利用するPolicy Collapse(Policy Collapse)という2つの主要な障害モードを特定します。
コスト-精度のParetoフロンティアを用いて、計算量の増加は明示的な検証なしに性能と負の相関関係を示す。
このことから,資源制約型エージェントでは,そのボトルネックは深度ではなく通信の忠実度に起因し,トレースレベルの診断と信頼性の高いモジュール設計のための機械的基盤となることが示唆された。
関連論文リスト
- The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context [22.202409807556517]
帰属盲点に対処するために,計算現実モニタリングを導入する。
CRMは、認知科学の現実監視フレームワークから適応した原則を運用する。
プレトレーニングされた露光が測定可能な内部軌道シグネチャを残すかどうかを検出する。
論文 参考訳(メタデータ) (2026-05-26T09:48:51Z) - Why Retrieval-Augmented Generation Fails: A Graph Perspective [40.34482080762174]
本稿では,検索された証拠が回答生成にどのように影響するかを検証した検索強化生成のモデル内研究について述べる。
属性-グラフトポロジ機能を用いたグラフベースの誤り検出フレームワークを開発した。
論文 参考訳(メタデータ) (2026-05-13T23:18:07Z) - Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision [11.159231524113764]
マルチモーダル大規模言語モデル(MLLM)の複雑な推論能力を高めるための重要なメカニズムとして強化学習(RL)が登場した。
本稿では,これらの構造的制約に対処する textbfGuided Verifier フレームワークを提案する。
我々は,マルチモーダル幻覚をターゲットとした特殊なデータ合成パイプラインを開発し,プロセスレベルの負の textbfCoRe データセットとtextbfCorrect-guide textbfReasoning トラジェクトリを構築し,ガイド付き検証器を訓練する。
論文 参考訳(メタデータ) (2026-02-04T07:38:42Z) - CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs [53.199517625701475]
CoGはDual-Process Theoryにインスパイアされたトレーニング不要のフレームワークで、直観と熟考の相互作用を模倣している。
CoGは精度と効率の両方において最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-16T07:27:40Z) - Lost in the Noise: How Reasoning Models Fail with Contextual Distractors [57.31788955167306]
推論モデルとエージェントAIシステムの最近の進歩は、多様な外部情報への依存度を高めている。
NoisyBenchは、RAGの11のデータセット、推論、アライメント、ツール使用タスクに対して、モデルロバスト性を体系的に評価する包括的なベンチマークである。
評価の結果,文脈的障害に直面した場合,最先端モデルでは最大80%の破滅的な性能低下がみられた。
論文 参考訳(メタデータ) (2026-01-12T05:43:51Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - Graphing the Truth: Structured Visualizations for Automated Hallucination Detection in LLMs [0.0]
本稿では,プロプライエタリな知識とモデル生成コンテンツをインタラクティブな視覚的知識グラフにまとめるフレームワークを提案する。
ユーザは不整合を診断し、弱い推論チェーンを特定し、修正フィードバックを提供する。
論文 参考訳(メタデータ) (2025-11-29T23:09:15Z) - When One Modality Sabotages the Others: A Diagnostic Lens on Multimodal Reasoning [22.39245479538899]
本報告では,高信頼な一元誤差が他の証拠をオーバーライドし,融合結果を誤認する診断障害モードであるモダリティ・サボタージュを導入する。
モデル非依存評価層は、各モダリティをエージェントとして扱い、候補ラベルと監査に用いる簡単な自己評価を生成する。
単純な融合機構はこれらの出力を集約し、コントリビュータ(正しい結果を支持するモダリティ)とサボツール(誤解を招くモダリティ)を露呈する。
論文 参考訳(メタデータ) (2025-11-04T18:20:13Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning [49.17801010041155]
MLLM(Multimodal large language model)は、テキスト、ビジョン、オーディオなどの多様な入力を統合することで推論を強化することを約束する。
しかし、追加のモダリティがパフォーマンスを損なうかどうかについての報告は相反する。
我々は、多モーダル推論を6つの相互作用パターンに分類し、事実がどのようにモダリティに分散され、論理的に組み合わせられるかを決定する。
論文 参考訳(メタデータ) (2025-09-28T08:46:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。