論文の概要: Visual Jev: Accurate and Efficient Decisions from Shared Visual Context
- arxiv url: http://arxiv.org/abs/2609.25845v1
- Date: Tue, 22 Sep 2026 08:12:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.281804
- Title: Visual Jev: Accurate and Efficient Decisions from Shared Visual Context
- Title(参考訳): Visual Jev: 共有されたビジュアルコンテキストからの正確で効率的な決定
- Abstract要約: Visual Jevはイメージと公開コンテキストを一度エンコードし、独立した質問サフィックスをバッチとして実行し、バックボーンの言語モデルヘッドから候補確率を読み取る。
4つのベンチマークで、回答監督後トレーニングは70.6%から76.1%に上昇する。
一致した型付きヘッド制御は、言語モデルヘッドの読み出しに対して一貫した精度の優位性を提供しない。
- 参考スコア(独自算出の注目度): 12.758717256689424
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Many vision applications ask several independent, forced-choice questions about the same image. Visual Jev encodes the image and public context once, executes isolated question suffixes as a batch, and reads candidate probabilities from the backbone's language-model head. Across four benchmarks, answer-supervised post-training raises equal-weight macro accuracy from 70.6% to 76.1%, with the gain concentrated on the two task families represented in training. At N=32 questions per image, shared batched execution is 8.9x faster in warm amortized time than independent serial execution and remains 3.4x faster than an already-batched baseline that recomputes the prefix, at the cost of higher peak memory. A matched typed-head control offers no consistent accuracy advantage over the language-model-head readout. The supported design is therefore simple: adapt the backbone for quality, retain the existing readout, and share execution for efficiency.
- Abstract(参考訳): 多くの視覚アプリケーションは、同じ画像についていくつかの独立した強制選択の質問をする。
Visual Jevはイメージと公開コンテキストを一度エンコードし、独立した質問サフィックスをバッチとして実行し、バックボーンの言語モデルヘッドから候補確率を読み取る。
4つのベンチマークで、回答監督後トレーニングでは、同等のマクロ精度が70.6%から76.1%に上昇し、トレーニングで表される2つのタスクファミリーに集中している。
イメージ毎のN=32質問では、共有バッチ実行は、独立シリアル実行よりも温められた時間で8.9倍高速で、プレフィックスを再コンパイルするベースラインよりも3.4倍高速であり、高いピークメモリを犠牲にしている。
一致した型付きヘッド制御は、言語モデルヘッドの読み出しに対して一貫した精度の優位性を提供しない。
サポートされた設計はシンプルで、品質にバックボーンを適応し、既存の読み出しを保ち、実行を効率よく共有する。
関連論文リスト
- When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning [73.56343820592399]
本稿では,視覚的タスクセマンティックス(VTS, Visualized Task Semantics)について紹介する。
6つのMLLMと4つのベンチマークで、24のモデルとタスクのペアの精度は平均17.8ポイント低下した。
本稿では,質問領域を型付きセマンティクスと整合させ,そのクリーンな表現をマスクビューから復元するプロンプト領域グラウンドを提案する。
論文 参考訳(メタデータ) (2026-08-05T11:46:15Z) - Stepwise Token Selection for Efficient Multimodal Large Language Models [0.7233065479782755]
本稿では,情報トークンを反復的に選択し,事前に選択したトークンに対して各決定を条件付けし,いつ停止するかを動的に決定するポインタスタイルの選択機構を提案する。
視覚トークンの88.9%を除去するアグレッシブプルーニングでは、初期精度の94.6%を保ち、プリフィル遅延の1.88倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-14T23:50:08Z) - A Self Consistency Based Reranking for Narrative Question Answering [0.2864713389096699]
本稿では,物語質問応答のための自己整合性に基づく格付けフレームワークを提案する。
提案手法は,各ストーリー・クエスト・ペアに対して複数の候補回答を生成し,セマンティック・コンセンサスに基づいて最終回答を選択する。
本研究では,FLAN-T5 (Base and Small) とPegasus-Largeを含む複数のモデルを用いて,NarrativeQAデータセットに対する提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-06-14T10:52:05Z) - Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models [68.48918176385105]
本稿では,質問トークンからテキストや視覚的証拠への注目を収集するマルチモーダル検索ヘッド検出手法を提案する。
マルチモーダル検索ヘッドはスパースであり,本質的であり,因果的に重要であることを示す。
これらの頭部は、視覚的にリッチな文書のランク付けに利用することもできる。
論文 参考訳(メタデータ) (2026-05-26T16:24:29Z) - dVoting: Fast Voting for dLLMs [71.572316901001]
拡散大言語モデル(dLLMs)は自己回帰モデリングを超えた新しいパラダイムである。
dLLMは任意の位置で任意のトークンを並列に生成できるため、並列テストタイムスケーリングには大きな可能性がある。
トレーニングなしで推論能力を高める高速投票手法であるdVotingを導入する。
論文 参考訳(メタデータ) (2026-02-12T16:35:05Z) - Learning Adaptive Parallel Reasoning with Language Models [70.1745752819628]
本稿では,適応並列推論(Adaptive Parallel Reasoning, APR)を提案する。
APRは、spawn()とjoin()操作を使用して適応的なマルチスレッド推論を可能にすることで、既存の推論メソッドを一般化する。
鍵となる革新は、親と子の両方の推論スレッドを最適化して、事前に定義された推論構造を必要とせずにタスクの成功率を高める、エンドツーエンドの強化学習戦略である。
論文 参考訳(メタデータ) (2025-04-21T22:29:02Z) - Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models [59.05769810380928]
Rephrase, Augment and Reason (RepARe) は勾配のないフレームワークで、基礎となる視覚言語モデルを用いて画像に関する詳細な情報を抽出する。
その結果、VQAv2では3.85%(絶対)、A-OKVQAでは6.41%、VizWizでは7.94%の増加が見られた。
論文 参考訳(メタデータ) (2023-10-09T16:57:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。