論文の概要: Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference
- arxiv url: http://arxiv.org/abs/2608.00077v2
- Date: Tue, 04 Aug 2026 10:46:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.411391
- Title: Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference
- Title(参考訳): OCR-Critical MLLM推論のための視覚的トーケンプルーニングにおける空間的異常の検証
- Abstract要約: ビジュアルトーケンプルーニングは、一定保持予算における応答品質によって判断される。
私たちはこの盲点を、幾何学的トークン・オリジンの証明によってカップルが行動に答えるエビデンスリスク監査にします。
目的検証ポイントがタスク汎用圧縮を含まないことを示す。
- 参考スコア(独自算出の注目度): 22.335515110971475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual-token pruning is usually judged by answer quality at a fixed retention budget. For text-rich multimodal large language models (MLLMs), this protocol can miss a distinct failure: an answer remains correct even when no retained token is locally traceable to the small OCR region that supports it. We turn this blind spot into an evidence-risk audit that couples answer behavior with geometric token-origin provenance, interventions, and realized cost; transparent training-free selectors isolate controlled operating points. On locked image-disjoint confirmation, Qwen Target at 30% retention has observed accuracy 0.786 versus 0.783 for Full (paired image-cluster difference +0.003, 95% CI [-0.014, +0.020]), yet same-budget Target, Random, and Grid retain sharply different positive-support coverage: 0.620, 0.270, and 0.318. Across Qwen3-VL-8B, LLaVA-1.5-7B, and InternVL3.5-8B, matched controls, interventions, detector tests, and external methods reveal model-specific quality-risk-traceability frontiers that accuracy alone does not expose. Materialized prefixes yield up to 4.32x batch-prefill speedup and 76.4% lower incremental peak memory; full-validation TextVQA and DocVQA further show that favorable target-verification points do not imply task-general compression. Visual-token pruning should therefore report surviving spatial provenance and realized cost alongside quality and compression.
- Abstract(参考訳): ビジュアルトーケンプルーニングは、通常、一定の保留予算での回答品質によって判断される。
テキストに富んだマルチモーダル言語モデル(MLLM)では、このプロトコルは明確な失敗を見逃す可能性がある。
我々はこの盲点を、幾何学的トークンオリジンの証明、介入、そして実現したコストで、カップルが行動に答えるエビデンスリスク監査に変え、透明なトレーニングなしセレクタが制御された操作ポイントを分離する。
ロックされた画像の不一致確認では、30%の保持率でQwen Targetが精度0.786対0.783(paired image-cluster difference +0.003, 95% CI [-0.014, +0.020])であるのに対して、同じ予算のTarget、Random、Gridは0.620、0.270、0.318の鮮明な正の支持範囲を維持している。
Qwen3-VL-8B、LLaVA-1.5-7B、InternVL3.5-8Bは、制御、介入、検出器テスト、および外部メソッドと一致し、精度のみを露呈しないモデル固有の品質リスクトレーサビリティフロンティアを明らかにする。
物質化されたプレフィックスは、最大4.32倍のバッチプリフィルスピードアップと76.4%のインクリメンタルピークメモリをもたらす。
したがって、視覚的プラニングは、生存する空間的逸脱を報告し、品質と圧縮と共にコストを低減すべきである。
関連論文リスト
- RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs [50.93650157115467]
本稿では,ロール指向の地域的エビデンスアロケーションとして視覚トークンプルーニングをキャストする,トレーニングフリーのフレームワークであるRoRAを紹介する。
整合した予算の下では、RoRAはLLaVAやQwen-VLファミリで、トレーニングなしの強力なベースラインを一貫して上回っている。
66.7%のプルーニング比で、RoRAはトークンの選択に0.7msしか必要とせず、エンドツーエンドの推論時間を24.6%削減する。
論文 参考訳(メタデータ) (2026-08-07T10:39:47Z) - ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs [37.20525993006875]
本稿では,エビデンスアロケーションとしてプルーニングをキャストするトレーニングフリーフレームワークET-Pruneを紹介する。
これはデコーダ側の部分的なクエリキーブロックから、質問条件のエビデンスを導き出す。
テキストのような空間領域を保護し、証拠の不確実性と密度をサンプル固有のトークンフロアに変換する。
論文 参考訳(メタデータ) (2026-08-03T09:42:34Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction [2.1997815944423516]
ExtractConfはクロスドメインでフィールドに依存しない信頼性エンジンである。
同じ文書の2つの構造的に異なる読影において、信頼度を推定する。
0.928ROC AUCを達成し、logprob-meanよりも選択的な予測リスクを70%削減する。
論文 参考訳(メタデータ) (2026-06-23T10:58:08Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Between the Layers Lies the Truth: Uncertainty Estimation in LLMs Using Intra-Layer Local Information Scores [36.86032736109853]
大きな言語モデル(LLM)は、しばしば自信を持って間違っているため、確実な不確実性推定(UE)が不可欠である。
本稿では,1つのフォワードパスを用いて内部表現における層間パターンをスコアリングする,コンパクトでインスタンスごとのUE手法を提案する。
論文 参考訳(メタデータ) (2026-03-17T08:35:14Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations [19.488236277427358]
視覚言語モデル(VLM)は、しばしばチェーン・オブ・シント(CoT)の説明を生み出す。
胸部X線視覚質問応答(VQA)の臨床的基盤として,制御されたテキストと画像修正を用いてCoT忠実度を探索するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T09:28:22Z) - vAttention: Verified Sparse Attention [100.98210818821688]
vAttentionは、ユーザが指定した$(epsilon, delta)$の近似精度保証(thus, confirmed)を備えた実用的なスパースアテンションメカニズムである。
vAttentionはデータセット間のスパースアテンションの質を大幅に改善することを示す。
モデルの品質を損なうことなく高速なデコードを実現するために、推論シナリオにデプロイすることができる。
論文 参考訳(メタデータ) (2025-10-07T08:46:08Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。