論文の概要: Visual Orchestration Tax in Agentic VLM Pipelines: Auditing and Certifying Visual Evidence Reuse
- arxiv url: http://arxiv.org/abs/2610.08170v1
- Date: Tue, 06 Oct 2026 11:25:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.961035
- Title: Visual Orchestration Tax in Agentic VLM Pipelines: Auditing and Certifying Visual Evidence Reuse
- Title(参考訳): エージェントVLMパイプラインにおける視覚的オーケストレーション税 : 視覚的エビデンス再利用の監査と認定
- Abstract要約: エージェントVLMパイプラインは、複数の専門エージェントやツールを介して、同じ静的な視覚的証拠を渡す傾向にある。
エージェントVLMパイプラインにおける視覚的エビデンス再利用のための計測・認証フレームワークを開発した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic VLM pipelines increasingly pass the same static visual evidence through multiple specialist agents and tools. This design creates an orchestration-level redundancy mode: semantically unchanged images are repeatedly reconstructed as image-conditioned requests at the VLM API boundary. We call this phenomenon visual orchestration tax and develop a measurement-to-certification framework for visual evidence reuse in agentic VLM pipelines. The audit side defines $\mathrm{M1}_{\mathrm{trace}}$ to count raw visual-evidence touches and M2 to measure structural touch redundancy, with query-level distributions, bootstrap confidence intervals, and paired quality tests. Across SeeingEye and MAMMQA on chart, document, general-VQA, and multi-modal-QA tasks, audits reveal 66.8-75.6% visual-evidence touch redundancy, and every audited query exceeds the predefined gate. The certification side introduces SharedVisCache, a contract-aware evidence reuse hook keyed by image content, preprocessing fingerprint, and encoder assumptions. On SeeingEye, contract validation certifies 75.0-75.5% repeated touches as reusable while preserving 350/350 output strings and $Δ\mathrm{M5}{=}0$. At the physical layer, certified hits reduce $F_{\mathrm{vision}}$ from 800 to 200 in ChartQA-200 trace replay and from 200 to 50 inside live SeeingEye translator-stage physical integration, preserving 800/800 replay strings and 200/200 integrated call outputs. The results position visual reuse as a measurable, behavior-preserving property of agent orchestration and define an agent-layer contract that makes backend prefix or token reuse semantically interpretable.
- Abstract(参考訳): エージェントVLMパイプラインは、複数の専門エージェントやツールを介して、同じ静的な視覚的証拠を渡す傾向にある。
セマンティックに変化のないイメージは、VLM APIバウンダリでイメージコンディショニングされた要求として繰り返し再構築される。
我々はこの現象を視覚的オーケストレーション税と呼び、エージェントVLMパイプラインにおける視覚的エビデンス再利用のための計測・認証フレームワークを開発した。
監査側は$\mathrm{M1}_{\mathrm{trace}}$を定義し、生のビジュアルエビデンスタッチをカウントし、M2を使って構造的なタッチの冗長性を計測する。
SeeingEyeとMAMMQAのチャート、ドキュメント、一般的なVQA、マルチモーダルQAタスクの監査では、視覚的証拠のタッチ冗長性が66.8-75.6%を示し、全ての監査されたクエリは事前に定義されたゲートを超えている。
認証側はSharedVisCacheを導入している。これは、画像コンテンツ、前処理指紋、エンコーダの仮定によってキーされる、コントラクト対応のエビデンス再利用フックである。
SeeingEyeでは,350/350の出力文字列と$Δ\mathrm{M5}{=}0$を保存しながら,75.0-75.5%の繰り返しタッチを再利用可能なものとして認証する。
物理層では、ChartQA-200トレースリプレイで$F_{\mathrm{vision}}$800から200、ライブのSeeeingEyeトランスレータ-ステージ物理統合で200/800リプレイ文字列と200/200統合コールアウトプットが保存される。
その結果、視覚的再利用はエージェントオーケストレーションの計測可能な振る舞い保存プロパティとして位置づけられ、バックエンドのプレフィックスやトークンの再利用を意味論的に解釈可能なエージェント層契約を定義する。
関連論文リスト
- VLM-in-Sandbox: Visual Workspaces for Agentic Visual Reasoning [22.255203187331677]
VLM-in-Sandbox(VLM-in-Sandbox)は、制御されたコンピュータ環境におけるエージェント型マルチモーダル推論のためのトレーニングフリーフレームワークである。
Visual Workspaceは生成したアーティファクトをイメージ台帳に登録し、境界付けられたアクティブなビジュアルコンテキストを維持し、モデルが後続の検査のために選択したエビデンスを明示的に促進する。
論文 参考訳(メタデータ) (2026-09-21T09:52:48Z) - AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes [38.37599802008238]
商用LLM APIは特定の基盤モデルを宣伝するが、提供されたバックボーンは静かに代用され、定量化され、あるいはラップされることがある。
既存の監査はすべて、テキスト出力チャネルからバックボーンアイデンティティを決定する。
本稿では,AgentProv(AgentProv)について紹介する。
論文 参考訳(メタデータ) (2026-08-30T08:22:12Z) - VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval [65.89247522243959]
VisDocAgentBenchは、静的検索とエージェント検索を比較したクローズドコーパスベンチマークである。
100の文書から2,375ページ、120のユニークなターゲットクエリが直接、一橋、二橋のエビデンス構造でバランスを取っている。
強力な遅延対話型ビジュアルレトリバーは、直接アイテムで97.50%のRecall@1に達するが、2ブリッジアイテムでは2.50%に達し、関連性がコーパスコンテキストに依存する場合のクエリ-ターゲットマッチングの限界を明らかにする。
論文 参考訳(メタデータ) (2026-08-18T15:23:06Z) - Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering [9.737607721974664]
ビジョン-言語モデル(VLM)はモデルサプライチェーンを通じてますます展開される。
本稿では,VLMサプライチェーンにアーキテクチャバックドアを埋め込むことで,悪意のあるプロバイダがこの信頼境界を活用できることを示す。
論文 参考訳(メタデータ) (2026-07-28T09:12:11Z) - Mining Workflow Graphs for Black-Box Boundary Testing of Conversational LLM Agents [2.9512821350868754]
我々は、ステートフル境界を発見し、強調するブラックボックステスティングフレームワークであるAgentEvalを提案する。
盲目的にプロンプトする代わりに、AgentEvalはこのグラフの構造を使って特定のガードと前提条件をテストターゲットとして列挙する。
我々はAgentEvalを、エージェントの基盤となるソースコードにアクセス可能な特権付きホワイトボックス監査者に対してベンチマークします。
論文 参考訳(メタデータ) (2026-07-08T00:11:41Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - TraceScope: Interactive URL Triage via Decoupled Checklist Adjudication [14.375064108289115]
私たちは、このワークフローを大規模に運用する、分離されたトリアージパイプラインであるTraceScopeを紹介します。
サンドボックス操作エージェントは、オブザーバ効果を防止し、安全性を確保するため、ページ動作を誘発する視覚的モチベーションによってガイドされた実際のGUIブラウザを駆動する。
MITRE ATT&CKチェックリストを検証するために要求の証拠を照会し、妥協の指標(IOC)を抽出した監査可読レポートを生成する。
我々の評価によると、TraceScopeは現実世界のシナリオでも優れた性能を示し、最先端の防御が特定できない高度なフィッシングの試みをうまく検出する。
論文 参考訳(メタデータ) (2026-04-23T16:31:42Z) - GUI-360$^\circ$: A Comprehensive Dataset and Benchmark for Computer-Using Agents [59.107657859025586]
GUI-360$circ$は、コンピュータ利用エージェント(CUA)を進化させるために設計された大規模で包括的なデータセットとベンチマークスイートである。
リリースされたコーパスには、人気のあるWindowsオフィスアプリケーションにおける数千のトラジェクトリにわたる1.2万以上の実行されたアクションステップが含まれている。
このデータセットは、3つの標準タスク、GUIグラウンド、スクリーン解析、アクション予測、ハイブリッドGUI+APIアクションスペースをサポートする。
論文 参考訳(メタデータ) (2025-11-06T12:19:02Z) - VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval [56.12310817934239]
クロスモーダルな埋め込みは概念の袋として振る舞うが、ポーズや視点のような構造的な視覚的関係が不足している。
この制限を緩和するT2I検索のための新しいパラダイムであるVisualize-then-Retrieve (VisRet)を提案する。
VisRetは、T2I検索をテキスト間類似性マッチングとして再キャストする、モーダル間の類似性マッチングとベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2025-05-26T17:59:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。