論文の概要: AMBER: Multi-View Adaptive Budget Allocation for Listwise Vision-Language Reranking
- arxiv url: http://arxiv.org/abs/2610.02831v1
- Date: Fri, 02 Oct 2026 05:23:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.22846
- Title: AMBER: Multi-View Adaptive Budget Allocation for Listwise Vision-Language Reranking
- Title(参考訳): AMBER:多視点適応型予算配分
- Abstract要約: 既存のマルチコール戦略は固定スケジュールに依存しており、不定型候補ペアと簡単なクエリによる高価なVLM呼び出しを無駄にしている。
本稿では,オンラインのマルチビューリグレードフレームワークであるAdaptive Multi-view Budgeted Elo Re rank (AMBER)を提案する。
AMBERは、断片化されたリストワイズVLM出力をローカルトーナメントとして扱い、連続Eloアップデートを使用して、軽量なグローバルランキング状態を維持する。
- 参考スコア(独自算出の注目度): 39.860570770730824
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) are powerful listwise rerankers for multimodal retrieval, but high inference costs restrict them to evaluating small local candidate views. Existing multi-call strategies rely on fixed schedules, wasting expensive VLM calls on uninformative candidate pairs and easy queries. To address this, we propose Adaptive Multi-view Budgeted Elo Reranking (AMBER), an online, budgeted multi-view reranking framework that dynamically optimizes global resource allocation. AMBER treats fragmented listwise VLM outputs as local tournaments, using continuous Elo updates to maintain a lightweight global ranking state. Building on this, it allocates computation at two levels: dynamically constructing candidate views with high score ambiguity, and scheduling queries to maximize expected information gain. We show that each Elo update corresponds to a stochastic gradient ascent step on the Bradley-Terry log-likelihood, and provide a submodular information-theoretic motivation for the query-level allocation strategy. Experiments on CIRR, CIRCO, and PhotoBench demonstrate that AMBER achieves the strongest overall performance among the compared multi-call VLM reranking methods under comparable VLM-call budgets, while remaining effective in lower-budget settings. Our code is publicly available at https://github.com/wnlfc/AMBER.
- Abstract(参考訳): 視覚言語モデル(VLM)は、マルチモーダル検索のための強力なリストワイズリランカーであるが、高い推論コストは、小さなローカルな候補ビューを評価することを制限する。
既存のマルチコール戦略は固定スケジュールに依存しており、非形式的候補ペアと簡単なクエリによる高価なVLM呼び出しを無駄にしている。
そこで本稿では,グローバルリソース割り当てを動的に最適化する,オンラインで予算のかかるマルチビューリグレードフレームワークであるAdaptive Multi-view Budgeted Elo Re rank (AMBER)を提案する。
AMBERは、断片化されたリストワイズVLM出力をローカルトーナメントとして扱い、連続Eloアップデートを使用して、軽量なグローバルランキング状態を維持する。
これに基づいて、高いスコアのあいまいさで候補ビューを動的に構築し、期待される情報ゲインを最大化するためのクエリをスケジューリングする。
それぞれのElo更新はBradley-Terryのログライクな部分における確率的勾配上昇ステップに対応し、クエリレベルのアロケーション戦略に対するサブモジュール情報理論のモチベーションを提供する。
CIRR, CIRCO, および PhotoBench の実験では, AMBER は低予算設定でも有効でありながら, 比較したマルチコール VLM で比較した手法の中で, 最強の総合的な性能を達成している。
私たちのコードはhttps://github.com/wnlfc/AMBER.comで公開されています。
関連論文リスト
- PRISMR: Overcoming Parse Collapse in Multimodal Listwise Ranking via Parameterized Representation Internalization [49.659739762240655]
LMM(Large Multimodal Models)を用いたジェネレーティブ・リストワイド・ランキングは,グローバル・リストのコンテキストを単一の前方通過で捉えることを目的としている。
自動回帰デコーダは、無音で候補を省略し、早期に終了することで、流動的で不完全なランク付けを発生させる。
PRISMRは、一貫したコンテキスト内リスト処理をパラメトリックな構造条件に置き換えるフレームワークである。
論文 参考訳(メタデータ) (2026-06-11T06:09:51Z) - Budget-Aware Routing for Long Clinical Text [8.474809035213118]
大きな言語モデルの大きな課題は、クエリ毎のトークンコストとデプロイメント全体のコストです。
文書単位のサブセットが厳格なトークン予算の下で選択される、予算付きコンテキスト選択について検討する。
関連性,カバレッジ,多様性のバランスをとるモノトンサブモジュラー目的のtextbfRCD を提案する。
論文 参考訳(メタデータ) (2026-05-01T01:34:53Z) - Agentic AI for Human Resources: LLM-Driven Candidate Assessment [4.271562161453985]
本稿では,Large Language Models (LLMs) を用いて,採用における候補評価を自動化するモジュール型・解釈可能なフレームワークを提案する。
このシステムは、ジョブ記述、CV、面接書、人事フィードバックなど様々なソースを統合し、専門家の判断を反映した構造化された評価レポートを生成する。
このフレームワークは、詳細なアセスメントレポート、候補比較、および、透明で監査可能で、実際の雇用に適したランク付けされたレコメンデーションを出力する。
論文 参考訳(メタデータ) (2026-03-17T21:32:08Z) - Benchmarking Retrieval-Augmented Generation in Multi-Modal Contexts [56.7225771305861]
本稿では,マルチモーダル大規模言語モデルの有効性を評価するためのベンチマークであるMulti-Modal Retrieval-Augmented Generation (M$2$RAG)を紹介する。
このベンチマークは、イメージキャプション、マルチモーダル質問応答、マルチモーダル事実検証、イメージリランクの4つのタスクで構成されている。
MLLMのコンテキスト利用能力を高めるため,マルチモーダル検索型インストラクションチューニング(MM-RAIT)も導入する。
論文 参考訳(メタデータ) (2025-02-24T16:25:25Z) - From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning [102.18178065928426]
効率的なビジュアルインストラクションファインタニング(EVIT)は、最小の計算オーバーヘッドで下流タスクにマルチモーダル大言語モデル(MLLM)を適用することを目指している。
本稿では,Dual Low-Rank Adaptation (Dual-LoRA)を提案する。
論文 参考訳(メタデータ) (2024-11-19T11:03:09Z) - Self-Calibrated Listwise Reranking with Large Language Models [137.6557607279876]
大規模言語モデル (LLM) はシーケンシャル・ツー・シーケンス・アプローチによってタスクのランク付けに使用されている。
この階調のパラダイムは、より大きな候補集合を反復的に扱うためにスライディングウインドウ戦略を必要とする。
そこで本稿では,LLMを用いた自己校正リストのランク付け手法を提案する。
論文 参考訳(メタデータ) (2024-11-07T10:31:31Z) - EcoRank: Budget-Constrained Text Re-ranking Using Large Language Models [6.109188517569139]
我々は予算が与えられた業績を最大化する方法について研究する。
本稿では,テキストの再ランク付けを行うための予算制約付き手法を提案する。
論文 参考訳(メタデータ) (2024-02-16T18:03:42Z) - LVLM-eHub: A Comprehensive Evaluation Benchmark for Large
Vision-Language Models [55.304181390027274]
本稿では,LVLM評価ハブ(LVLM-eHub)の構築により,一般公開された大規模マルチモーダルモデルの包括的評価を行う。
我々のLVLM-eHubは、InstructBLIPやMiniGPT-4などの代表的LVLMから成り、定量的能力評価とオンラインアリーナプラットフォームによって徹底的に評価されている。
この研究は、いくつかの革新的な発見を明らかにしている。まず、インストラクタBLIPのような膨大なドメイン内データを持つ命令調整型LVLMは、多くの既存のタスクを過度にオーバーフィットさせ、オープンワールドのシナリオでは一般化が不十分である。
論文 参考訳(メタデータ) (2023-06-15T16:39:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。