論文の概要: Dynamic Resolution Routing for Efficient Egocentric Grounding
- arxiv url: http://arxiv.org/abs/2608.01638v1
- Date: Mon, 03 Aug 2026 03:19:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.310452
- Title: Dynamic Resolution Routing for Efficient Egocentric Grounding
- Title(参考訳): 効率的な偏心接地のための動的分解能ルーティング
- Abstract要約: Egocentric visual groundingは、小さなオブジェクトをローカライズするために高解像度の入力を必要とする。
トークン還元に基づく現在の効率的な戦略は、対象中心空間証拠の選択には信頼性が低い。
動的解像度ルーティングによる画素空間の効率最適化を実現するフレームワークであるSmartResを提案する。
- 参考スコア(独自算出の注目度): 49.12322020698182
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric visual grounding requires high-resolution inputs to localize small objects. However, scaling Multimodal Large Language Models to this domain is constrained by the excessive cost of visual token processing. We identify that current efficient strategies based on token reduction are unreliable for selecting object-centric spatial evidence. To overcome this, we propose SmartRes, a framework that performs efficiency optimization in the pixel space via dynamic resolution routing. SmartRes first encodes a low-resolution view for global context and uses a lightweight router to activate high-resolution patches in object-centric regions and constructs an order-preserving visual sequence. To further enable robust routing under severe foreground-background imbalance, we introduce a margin-regularized routing objective that increases foreground-background logit separation and improves foreground recall. Experiments on Ego4D and EgoIntention show that SmartRes reduces visual tokens by up to 67% while retaining 86.4% of full-resolution performance, and achieves up to 1.66X faster inference than state-of-the-art token reduction methods with higher accuracy. Furthermore, strong performance on small object grounding indicates the effectiveness of SmartRes towards egocentric applications. Code will be publicly available.
- Abstract(参考訳): Egocentric visual groundingは、小さなオブジェクトをローカライズするために高解像度の入力を必要とする。
しかし、マルチモーダル大言語モデルをこの領域に拡張することは、視覚トークン処理の過剰なコストによって制約される。
トークン削減に基づく現在の効率的な戦略は,対象中心空間証拠の選択には信頼性が低い。
これを解決するために,動的解像度ルーティングによる画素空間の効率最適化を行うSmartResを提案する。
SmartResはまず、グローバルなコンテキストに対する低解像度のビューをエンコードし、軽量ルータを使用してオブジェクト中心領域の高解像度パッチを活性化し、順序を保つビジュアルシーケンスを構築する。
厳密な前景不均衡下でのロバストなルーティングを可能にするため,前景のロジット分離を増大させ,前景のリコールを改善する辺縁規則化されたルーティング目的を導入する。
Ego4DとEgoIntentionの実験によると、SmartResは86.4%のフル解像度性能を維持しながら、視覚トークンを最大67%削減し、最先端のトークン削減方法よりも1.66倍高速な推論を実現している。
さらに、小さなオブジェクトグラウンドでの強力なパフォーマンスは、egocentricアプリケーションに対するSmartResの有効性を示している。
コードは公開されます。
関連論文リスト
- EchoSR: Efficient Context Harnessing for Lightweight Image Super-Resolution [22.100613250016366]
EchoSRは、軽量画像超解像のための効率的なコンテキスト調和フレームワークである。
マルチスケールの受容場モデリングと階層型コンテキスト融合を統一する。
複数のベンチマークで最先端の軽量超解像法を一貫して上回る。
論文 参考訳(メタデータ) (2026-05-17T14:20:27Z) - Higher Resolution, Better Generalization: Unlocking Visual Scaling in Deep Reinforcement Learning [2.731398851340082]
観察分解能は政策学習にとって重要ではあるが見過ごされがちな変数であることを示す。
我々は、広く使われているImpalaエンコーダをグローバル平均プールに置き換える。
ビジュアルスケーリングにより、ImpoolaはImpalaよりも28パーセントパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-11T13:23:58Z) - AdaSpot: Spend Resolution Where It Matters for Precise Event Spotting [59.31340724915079]
イベントスポッティングは、スポーツ分析、ロボティクス、自律システムにおけるアプリケーションにとって重要なタスクである。
bfAdaSpotは厳格な評価基準の下で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-25T16:24:48Z) - PocketSR: The Super-Resolution Expert in Your Pocket Mobiles [69.26751136689533]
リアルワールド・イメージ・スーパーレゾリューション (RealSR) は、携帯電話が捉えたような、Wild内の画像の視覚的品質を高めることを目的としている。
大規模な生成モデルを利用する既存の手法は印象的な結果を示しているが、計算コストとレイテンシが高いため、エッジ配置には実用的ではない。
超軽量単一ステップモデルであるPocketSRを導入し,高忠実度を維持しつつ生成モデリング機能をRealSRにもたらす。
論文 参考訳(メタデータ) (2025-10-03T13:56:18Z) - Breaking Complexity Barriers: High-Resolution Image Restoration with Rank Enhanced Linear Attention [54.42902794496325]
ソフトマックスアテンションの変種である線形アテンションは、グローバルコンテキストモデリングにおける約束を示す。
軽量な奥行き畳み込みを統合することで特徴表現を充実させる簡易かつ効果的な方法であるRランク拡張線形アテンション(RELA)を提案する。
本稿では,RELA をベースとした画像復元変換器 LAformer を提案する。
論文 参考訳(メタデータ) (2025-05-22T02:57:23Z) - Striving for Faster and Better: A One-Layer Architecture with Auto Re-parameterization for Low-Light Image Enhancement [50.93686436282772]
我々は、視覚的品質と計算効率の両方から、画像エンハンサーの限界を掘り下げることを目指している。
タスク要求を再考することにより、視覚的品質と計算効率がモデル学習と構造設計に対応する、明示的な接続を構築する。
最終的には、単一の畳み込み層のみを使用して、優れた視覚的品質を維持しながら、効率的な低照度画像強調を実現する。
論文 参考訳(メタデータ) (2025-02-27T08:20:03Z) - Lightweight Stepless Super-Resolution of Remote Sensing Images via
Saliency-Aware Dynamic Routing Strategy [15.587621728422414]
深層学習アルゴリズムは、リモートセンシング画像(RSI)超解像(SR)の性能を大幅に改善した
しかし、ネットワークの深さとパラメータの増大は、計算とストレージに大きな負担をもたらす。
本稿では、RSIの軽量でステップレスなSRを実現するために、SalDRN(Saliency-aware dynamic routing network)を提案する。
論文 参考訳(メタデータ) (2022-10-14T07:49:03Z) - Asymmetric CNN for image super-resolution [102.96131810686231]
深層畳み込みニューラルネットワーク(CNN)は、過去5年間で低レベルビジョンに広く適用されています。
画像超解像のための非対称ブロック(AB)、mem?ory拡張ブロック(MEB)、高周波数特徴強調ブロック(HFFEB)からなる非対称CNN(ACNet)を提案する。
我々のACNetは、ブラインドノイズの単一画像超解像(SISR)、ブラインドSISR、ブラインドSISRを効果的に処理できる。
論文 参考訳(メタデータ) (2021-03-25T07:10:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。