論文の概要: Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression
- arxiv url: http://arxiv.org/abs/2608.08960v1
- Date: Sun, 09 Aug 2026 23:38:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.006122
- Title: Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression
- Title(参考訳): 読書は推論ではない:視覚テキスト圧縮におけるエージェントポリシーギャップのブリッジ
- Abstract要約: 多段階の言語モデルエージェントは、成長する相互作用履歴を繰り返し処理し、かなりのコンテキストコストをもたらす。
視覚-テキスト圧縮は、履歴を画像としてレンダリングすることでこれらのコストを削減するが、その結果、大きな能力ギャップが生じる。
ビジュアル・ヒストリー・エージェントは、行動選択、クエリの定式化、停止、エビデンスの使用において体系的なドリフトを示し、エージェントポリシーのギャップを明らかにしている。
- 参考スコア(独自算出の注目度): 26.345226427880306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-step language-model agents repeatedly process growing interaction histories, leading to substantial context costs. Vision--text compression reduces these costs by rendering history as images, but the resulting modality shift creates a marked capability gap. Through controlled evaluations of history recovery, matched-state decisions, and complete trajectories, we show that this gap cannot be explained by OCR quality alone. Visual-history agents exhibit systematic drift in action selection, query formulation, stopping, and evidence use, revealing an agentic policy gap. We introduce \textbf{CAPS}, a two-stage \textbf{C}ross-modal \textbf{A}gentic \textbf{P}olicy \textbf{S}elf-distillation framework that uses the same model's stronger text-history policy to supervise its visual-history counterpart. Offline trajectory self-distillation transfers successful text-policy behavior to visual-history inputs, while online policy self-distillation provides dense supervision on states visited by the visual-history policy during reinforcement learning. On SearchQA, CAPS improves over AgentOCR by 5.0\% and 3.4\% with 3B and 7B backbones, respectively. On full-history ALFWorld, the corresponding gains are 15.6\% and 14.5\%. Across settings, CAPS reduces average memory-context cost by up to 63.3\% and peak cost by up to 83.4\% relative to matched text-history policies. These results show that explicit cross-modal policy self-distillation can preserve agent capability under vision--text compression. Our code will be made publicly available in a future release.
- Abstract(参考訳): 多段階の言語モデルエージェントは、成長する相互作用履歴を繰り返し処理し、かなりのコンテキストコストをもたらす。
視覚-テキスト圧縮は、歴史を画像としてレンダリングすることでこれらのコストを削減しますが、結果としてモダリティシフトが顕著な能力ギャップを生み出します。
ヒストリカバリ,整合状態決定,完全軌道の制御による評価により,このギャップはOCRの品質だけでは説明できないことを示す。
ビジュアル・ヒストリー・エージェントは、行動選択、クエリの定式化、停止、エビデンスの使用において体系的なドリフトを示し、エージェントポリシーのギャップを明らかにしている。
我々は,同じモデルの強いテキスト履歴ポリシーを用いて,その視覚履歴を監督する2段階の \textbf{C}ross-modal \textbf{A}gentic \textbf{P}olicy \textbf{S}elf-distillation フレームワークである \textbf{CAPS} を紹介する。
オンライン政策の自己蒸留は、強化学習中の視覚的歴史政策が訪れた国家に密接な監督を与える。
SearchQAでは、CAPSはAgentOCRよりも5.0\%、そして3Bと7Bのバックボーンで3.4\%改善している。
フルヒストリー ALFWorld では、対応する利得は 15.6\% と 14.5\% である。
設定全体にわたって、CAPSは平均メモリコンテキストコストを63.3\%、ピークコストを83.4\%まで削減する。
これらの結果から,明示的なクロスモーダル・ポリシーの自己蒸留は,テキスト圧縮下でのエージェント能力を維持できることが示された。
私たちのコードは、将来のリリースで公開されます。
関連論文リスト
- TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents [54.88208747581851]
トレーニング不要のビジュアルトークンプルーニングは、このコストを削減することができるが、キャッシュ再利用には基本的な制約が伴う。
我々は,emphtextbfTrajectory-textbfrobust textbfAdmission と textbfCoverage-aware textbfEvidence ordering のためのトレーニング不要フレームワーク textbfmethod を提案する。
論文 参考訳(メタデータ) (2026-09-09T15:12:48Z) - When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents [33.60688117631484]
ロングホライゾンエージェントは、増大する相互作用履歴を境界付けられた作業コンテキストに圧縮するためにコンテキストマネージャを必要とする。
視覚レンダリング(VR)は、表現型コンテキストマネージャとして導入された。
そこで本研究では,メモリ操作を伴わない決定的レンダリングに基づく学習自由コンテキストマネージャVERAを提案する。
論文 参考訳(メタデータ) (2026-08-30T16:46:16Z) - Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents [16.82888862043366]
ツール・ユース・エージェントに蓄積した推論を解析するためのKullback-Leibler-Guidedフレームワークを提案する。
SPAREは、推論トークンの37.89-64.58%を除去しながら、プルーニング法の中で最も高い平均精度を達成する。
この良好な精度とコンテキストのトレードオフは、テキストによる優位性の低下が視覚的証拠への依存を回復し、自己生成言語による過度な条件付けを緩和することを示している。
論文 参考訳(メタデータ) (2026-08-24T08:29:17Z) - Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression [7.944386069136441]
Vision-Text Compression (VTC)は、長いテキストを画像にレンダリングし、視覚エンコーダ(ViT)を介してエンコードする。
ViTは言語意味論よりも視覚的属性(グリフ、フォントサイズ、レイアウト)をキャプチャし、描画イメージ表現をネイティブテキスト表現から分離させる。
我々は、モデル自身のテキストパス動作のみを監督として使用することで、このギャップを埋める自己教師付きアライメントフレームワークであるSPIRALを提案する。
論文 参考訳(メタデータ) (2026-08-03T12:08:56Z) - From Agent Failures to Text Policies: What Works and What Breaks [2.8890052855500143]
TextGradは、フィードバックからテキストを更新することで、言語モデルシステムを改善する。
一連のアクションの後にフィードバックが到着するので、エージェントにそれを適用するのは難しくなります。
我々は、有用な政策に従う能力と、その政策を経験から学ぶ能力とを分離して、この問題を研究する。
論文 参考訳(メタデータ) (2026-07-22T19:08:19Z) - ECHO: Prune to act, trace to learn with selective turn memory in agentic RL [9.429418772354397]
ECHOは、ソースインデックスによる再構築を通じて、履歴の崩壊とトレース可能な学習に対処する、選択的なターンメモリフレームワークである。
BrowseComp-Plusでは、ECHOの保持精度は43.4%に達し、GRPO(28.9%)とローリングサマーベースラインSUPO(36.1%)を上回っている。
論文 参考訳(メタデータ) (2026-06-30T13:29:58Z) - Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models [16.39553879497114]
SPprunerは主題中心のプログレッシブ・リダクション・パラダイムである。
人間の視覚知覚システムのtextitFocus-then-Contextメカニズムをエミュレートする。
視覚入力の高忠実度表現を保証するために、包括的視覚被写体スペクトルを掘削することができる。
論文 参考訳(メタデータ) (2026-05-20T09:37:53Z) - Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents [23.436701309802533]
マルチモーダル・ディープ・サーチは、テキストや視覚的コンテキストの進化に対して、検索、ツールの使用、視覚的推論をチェーンすることで、オープンワールドの問題を解決するためにエージェントを必要とする。
既存のツール利用ハーネスは、検索、ブラウジング、変換によって返される画像を一時的な出力として扱うため、中間的な視覚的証拠は後続のツールでは再消費できない。
本稿では,画像バンク参照プロトコルを中心としたビジュアルネイティブエージェントを導入し,ツールが返却したすべてのイメージをアドレス可能な参照として登録する。
On-policy Data Evolution (ODE)はクローズドループデータジェネレータを実行する。
論文 参考訳(メタデータ) (2026-05-11T16:49:36Z) - AgentOCR: Reimagining Agent History via Optical Self-Compression [25.87457777208574]
本稿では,視覚トークンの優れた情報密度を利用するフレームワークであるAgentOCRを紹介する。
履歴をハッシュ可能なセグメントに分解し、ビジュアルキャッシュを維持することで、AgentOCRは冗長な再レンダリングを取り除く。
以上の結果から,AgentOCRは95%以上のテキストベースのエージェント性能を保ちながら,トークン消費量を大幅に削減していることがわかった。
論文 参考訳(メタデータ) (2026-01-08T10:10:20Z) - SCOPE: Prompt Evolution for Enhancing Agent Effectiveness [53.75986399936395]
大規模言語モデル(LLM)エージェントは、大規模で動的なコンテキストを生成する環境にますますデプロイされている。
エージェントはこのコンテキストにアクセスできますが、静的なプロンプトには効果的に管理するメカニズムがありません。
textbfSCOPE (Self-evolving Context Optimization via Prompt Evolution) を導入する。
本稿では,戦術的特異性(即時誤りの解消)と戦略的汎用性(長期原則の進化)のバランスをとるデュアルストリーム機構を提案する。
論文 参考訳(メタデータ) (2025-12-17T12:25:05Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - AgentFold: Long-Horizon Web Agents with Proactive Context Management [98.54523771369018]
LLM ベースの Web エージェントは情報検索を大いに約束するが,その有効性はコンテキスト管理における基本的なトレードオフによって妨げられる。
本稿では,プロアクティブなコンテキスト管理を中心としたエージェントパラダイムであるAgentFoldを紹介する。
単純な微調整により,BrowseCompでは36.2%,BrowseComp-ZHでは47.3%を達成した。
論文 参考訳(メタデータ) (2025-10-28T17:51:50Z) - VOGUE: Guiding Exploration with Visual Uncertainty Improves Multimodal Reasoning [62.09195763860549]
検証可能な報酬(RLVR)による強化学習は、大きな言語モデル(LLM)の推論を改善するが、探索に苦労する。
出力(テキスト)から入力(視覚)空間へ探索をシフトする新しい手法である$textbfVOGUE(Visual Uncertainty Guided Exploration)を紹介した。
本研究は,視覚入力の本質的不確実性における基盤探索が,マルチモーダル推論を改善するための効果的な戦略であることを示す。
論文 参考訳(メタデータ) (2025-10-01T20:32:08Z) - VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought [51.43082554363725]
textbfVLM-R$3$ (textbfVisual textbfLanguage textbfModel with textbfRegion textbfRecognition and textbfReasoning) はMLLMに付加的な視覚的証拠が必要な場合にエフェクトを決定する機能を提供するフレームワークである。
MathVista、ScienceQA、その他のベンチマークの実験は、VLM-R$3$が新しいものを設定することを示している
論文 参考訳(メタデータ) (2025-05-22T03:50:13Z) - Activation-aware Probe-Query: Effective Key-Value Retrieval for Long-Context LLMs Inference [56.71209737306054]
我々は,プローブ-textbfQuery を動的に決定し,関連する textbfKV ペアを推論するために利用する,トレーニングフリーの textbfActivation-aware アプローチである textbfActQKV を提案する。
Long-Bench と $infty$ Benchmarks の実験では、競合する推論品質とリソース効率を備えた最先端のパフォーマンスが実証されている。
論文 参考訳(メタデータ) (2025-02-19T08:50:44Z) - Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios [69.00444996464662]
RIV-CoT(Retrieval-based Interleaved Visual Chain-of-Thought法)を提案する。
実験の結果, RIV-CoTの解答精度は3.1%向上し, バニラCoTの解答精度は4.6%向上した。
論文 参考訳(メタデータ) (2025-01-08T18:31:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。