論文の概要: Learning to Zoom Efficiently with a Contrastive Curriculum
- arxiv url: http://arxiv.org/abs/2609.03206v1
- Date: Wed, 02 Sep 2026 22:43:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.866241
- Title: Learning to Zoom Efficiently with a Contrastive Curriculum
- Title(参考訳): 対照的なカリキュラムで効率よくズームする学習
- Authors: Falko Helm, Iryna Gurevych,
- Abstract要約: ズームインツールを使用することは、現代の視覚エージェントの重要な基礎となる部分である。
本稿では,MLLMにおける学習ツールの使用に対して,ラベルの追加やウォームスタートSFTを必要とせずに,新たな本質的な報奨を提案する。
私たちのアプローチは競争力があり、効率的です。
- 参考スコア(独自算出の注目度): 52.710726359379265
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Using a zoom-in tool is an important foundational part of modern visual agents, because it allows to efficiently handle tasks involving high-resolution images. Most previous methods need an extensive warm-start supervised fine-tuning phase for teaching models zoom-in. We show that this is not necessary by proposing a new intrinsic reward for learning tool use in MLLMs without the need for additional labels or warm-start SFT. Our InfoNCE-style reward uses a curriculum of increasingly hard negative tool calls as a contrastive training signal. Empirical experiments on $V^*$, HRBench and MME-RealWorld show that our approach is competitive while being more efficient. When used as a drop-in replacement for SFT, we even outperform all baselines. To directly measure the zoom-in ability of models, we further introduce the scalable synthetic Muffin&Chihuahua (M&C) dataset. Each image consists of a grid with every cell either showing a muffin or chihuahua. Leveraging the M&C dataset's unique region of interest labels, we find that recall is the metric that most strongly correlates the zoom-in region with final task performance. Our model and code for reproduction is publicly available under https://github.com/UKPLab/emnlp2026-zoom-in
- Abstract(参考訳): ズームインツールを使用することは、高解像度画像を含むタスクを効率的に処理できるため、現代の視覚エージェントの重要な基礎となる部分である。
これまでのほとんどの手法では、ズームインのモデルを教えるために、広範囲なウォームスタート制御された微調整フェーズが必要である。
MLLMにおける学習ツールの使用に対して,追加ラベルやウォームスタートSFTを必要とせずに,新たな本質的な報奨を提案することは不要である。
私たちのInfoNCEスタイルの報酬は、ますます厳しいネガティブなツールコールのカリキュラムを、対照的なトレーニング信号として使用しています。
V^*$, HRBench, MME-RealWorldの実証実験により, 我々のアプローチはより効率的でありながら競争力があることが示された。
SFTのドロップイン代替として使われる場合、すべてのベースラインよりも優れています。
モデルのズームイン能力を直接測定するために、スケーラブルな合成Muffin&Chihuahua(M&C)データセットを導入する。
各画像は格子で構成され、各セルはマフィンまたはチワワを示す。
M&Cデータセットのユニークな関心ラベル領域を活用すると、リコールがズームイン領域と最終タスクのパフォーマンスを最も強く関連付ける指標であることが分かる。
我々の再生モデルはhttps://github.com/UKPLab/emnlp2026-zoom-inで公開されている。
関連論文リスト
- GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery [69.05066425853326]
シンキング・ウィズ・イメージ」パラダイムは、マルチモーダルな大規模言語モデル(MLLM)がズームインツールを使って視覚的なシーンを積極的に探索することを可能にする。
これは超高分解能(UHR)リモートセンシングVQAにおいて必須であり、タスク関連キューは疎小である。
筆者らは,(1)冷間開始型SFTデータセット, UHR-CoZ(UHR-CoZ)を多種多様なズームレジームをカバーするトレーニングフレームワークであるGeoEyes,(2)エージェント強化学習手法であるAdaZoom-GRPOを提案する。
論文 参考訳(メタデータ) (2026-02-15T15:50:55Z) - Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception [43.08943307183693]
Region-to-Image Distillationは、推論時ツールからトレーニング時プリミティブへのズームを変換する。
我々は,複数のきめ細かい知覚ベンチマークにおいて,モデルが先行する性能を実現することを示す。
論文 参考訳(メタデータ) (2026-02-12T12:00:35Z) - Pink: Unveiling the Power of Referential Comprehension for Multi-modal
LLMs [49.88461345825586]
本稿では,MLLMの微細な画像理解能力を高めるための新しい枠組みを提案する。
本稿では,既存のデータセットのアノテーションを活用して,命令チューニングデータセットを低コストで構築する手法を提案する。
本研究では,Qwen-VLよりも5.2%精度が向上し,Kosmos-2の精度が24.7%向上したことを示す。
論文 参考訳(メタデータ) (2023-10-01T05:53:15Z) - Noise Self-Regression: A New Learning Paradigm to Enhance Low-Light Images Without Task-Related Data [86.68013790656762]
タスク関連のデータにアクセスせずにノイズ自己回帰(NoiSER)を提案する。
NoiSERは品質向上に非常に競争力があるが、モデルのサイズははるかに小さく、トレーニングや推論のコストもはるかに低い。
論文 参考訳(メタデータ) (2022-11-09T06:18:18Z) - MAGNeto: An Efficient Deep Learning Method for the Extractive Tags
Summarization Problem [0.0]
抽出タグ要約(ETS)と呼ばれる新しい画像アノテーションタスクについて検討する。
ゴールは、画像とその対応するタグに横たわるコンテキストから重要なタグを抽出することである。
提案手法は,畳み込み層や自己注意層など,広く使用されているブロックで構成されている。
論文 参考訳(メタデータ) (2020-11-09T11:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。