論文の概要: DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning
- arxiv url: http://arxiv.org/abs/2608.00540v1
- Date: Sat, 01 Aug 2026 08:54:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.76393
- Title: DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning
- Title(参考訳): DiffuseAgent-MI: 忠実な視覚的推論のための自己進化剤
- Authors: An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian,
- Abstract要約: DiffuseAgent-MIは、以前の自己進化剤よりも最大5.1ポイント精度を向上させる。
GeoQA、SciVis、VQA-v2、および社内のマルチモーダル推論セットでは、DiffuseAgent-MIは最大5.1ポイントの精度を向上させる。
- 参考スコア(独自算出の注目度): 24.745715007832953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-integrated vision-language agents have made remarkable progress on compositional and multi-step visual reasoning. Yet their outputs frequently exhibit unfaithfulness: the stated reasoning path diverges from the computation that actually produced the answer, undermining reliability in safety-critical applications. We present DiffuseAgent-MI, a self-evolving agent whose perceptual grounding is governed by a KL-minimal energy model over feature units, providing a distributional view of visual mechanistic interpretability. The agent learns an energy landscape that softly constrains generated samples to lie near the native prior conditioned on the chosen interpretable unit, closing the gap between the explanation and the internal representation. A verifier then supplies trajectory-level faithfulness rewards, and a repair branch re-conditions the energy when the verifier flags an unfaithful step. On GeoQA, SciVis, VQA-v2 and an in-house multimodal reasoning set, DiffuseAgent-MI improves accuracy by up to 5.1 points over prior self-evolving agents while more than doubling mutual-information faithfulness and human-interpretability agreement. Our analysis shows the energy term and the verifier are complementary: the former guarantees distributional faithfulness, the latter trajectory-level faithfulness, and only their combination closes both gaps.
- Abstract(参考訳): ツール統合視覚言語エージェントは、構成的および多段階の視覚的推論において顕著な進歩を遂げた。
しかし、それらのアウトプットは、しばしば不信感を呈する: 宣言された推論パスは、実際に答を生み出した計算から分岐し、安全クリティカルなアプリケーションにおける信頼性を損なう。
我々は,視覚力学的解釈可能性の分布ビューを提供する,機能単位上のKL最小エネルギーモデルにより知覚基底が支配される自己進化剤DiffuseAgent-MIを提案する。
エージェントは、選択された解釈可能なユニットに設定されたネイティブな事前条件の近傍に、生成したサンプルをソフトに拘束するエネルギー景観を学習し、説明と内部表現のギャップを閉じる。
そして、検証部は、軌道レベルの忠実度報酬を供給し、検証部は、不誠実なステップをフラグするときにエネルギーを再調整する。
GeoQA、SciVis、VQA-v2、および社内のマルチモーダル推論セットでは、DiffuseAgent-MIは、相互情報の忠実さと人間の解釈可能性の合意を2倍にし、従来の自己進化剤よりも最大5.1ポイント精度を向上させる。
我々の分析では、エネルギー項と検証器は相補的であり、前者は分布的忠実を保証し、後者の軌道レベル忠実を保証し、それらの組み合わせは両方のギャップを閉じる。
関連論文リスト
- Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection [80.15317858033534]
ForeAgentは、反復的な自己進化を伴うAI生成画像検出のためのエージェント法医学フレームワークである。
ForeAgentはChameleonベンチマークで最先端のパフォーマンスを達成し、精度は82.18%に達した。
ForeAgent は GPT-5 や GPT-5-mini と比較して、より一貫性があり、因果的な推論をもたらす。
論文 参考訳(メタデータ) (2026-06-25T02:59:33Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - AgentV-RL: Scaling Reward Modeling with Agentic Verifier [63.55502685076245]
試験時間スケーリング(TTS)によるLCM推論を強化する検証器が実証されている。
本稿では,報酬モデリングを多ターンツール拡張型検討プロセスに変換するフレームワークであるエージェント検証を提案する。
Agentic Verifier は並列およびシーケンシャルTS の両方で一貫した性能向上が得られることを示す。
論文 参考訳(メタデータ) (2026-04-17T12:27:36Z) - Beyond Fluency: Toward Reliable Trajectories in Agentic IR [0.0]
本論文は, 産業用エージェントシステムで観測された故障モードを合成する。
安全なデプロイメントには、エンドポイントの正確性を超えて、軌道の整合性と因果属性に移行する必要がある、と我々は主張する。
論文 参考訳(メタデータ) (2026-04-05T21:20:57Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation [4.723302382132762]
シリコングレードの正しさは、 (i) シミュレーション中心の評価の限られたカバレッジと信頼性、 (ii) 回帰と修復幻覚、 (iii) エージェントハンドオフ間で意図が再解釈される意味的ドリフトによってボトルネックが残っている。
エージェントの意図を整合させる設計契約を確立するマルチエージェントフレームワークであるVeri-Sureを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:10:23Z) - Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning [41.461840578204956]
大言語モデル(LLM)ベースのエージェントは、破滅的な忘れをせずに新しいタスクを学習する。
Agent-Diceは指向性コンセンサス評価に基づくパラメータ融合フレームワークである。
GUIエージェントとツール使用エージェントドメインの実験は、Agent-Diceが優れた連続学習性能を示すことを示した。
論文 参考訳(メタデータ) (2026-01-07T06:43:50Z) - Maximizing Information Gain in Partially Observable Environments via
Prediction Reward [64.24528565312463]
本稿では,深いRLエージェントに対する信念に基づく報酬の活用という課題に取り組む。
負のエントロピーと予測される予測報酬の正確な誤差を導出する。
この洞察は、予測報酬を用いたいくつかの分野の理論的動機を与える。
論文 参考訳(メタデータ) (2020-05-11T08:13:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。