論文の概要: ROI-Gated SAHI: Content-Adaptive Slicing-Based Inference for Efficient Object Detection
- arxiv url: http://arxiv.org/abs/2608.23923v1
- Date: Tue, 25 Aug 2026 00:02:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.667357
- Title: ROI-Gated SAHI: Content-Adaptive Slicing-Based Inference for Efficient Object Detection
- Title(参考訳): ROI-Gated SAHI:効率的な物体検出のためのコンテンツ適応スライシングに基づく推論
- Abstract要約: Region-of-interest (ROI)-Gated SAHIは、フォアグラウンド領域をローカライズし、スライスされたリファインメントを情報領域に制限するための軽量なプロポーザを導入する推論時フレームワークである。
ROIゲーティングはスパースシーンにおいて最も有益であり、ロバストな平均行動にポリシーベースのルーティングを必要とすることを示す。
- 参考スコア(独自算出の注目度): 0.7139735602624268
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Slicing-Aided Hyper Inference (SAHI) improves small object detection in high-resolution images but often spends substantial compute on background tiles. We propose region-of-interest (ROI)-Gated SAHI, an inference-time framework that introduces a lightweight proposer to localize foreground regions and restrict sliced refinement to informative areas. We evaluate the framework in two settings. On the COCO128 full split dataset comprising 128 images, static ROI-gating is slower on average than Full SAHI, achieving a speed ratio of 0.88, and yields a lower mAP@0.5 of 0.6602 compared with 0.7569 for Full SAHI. A simple adaptive routing policy with $τ=$ 0.4 educes the mean latency, achieving a slight gain of 1.02$\times$ over Full SAHI. On a three-image sparse-to-dense case study, ROI-gating achieves speedups ranging from 0.96$\times$ to 6.90$\times$ with a mean speedup of 3.41$\times$. These results show that ROI-gating is most beneficial in sparse scenes and requires policy-based routing for robust average behavior.
- Abstract(参考訳): Slicing-Aided Hyper Inference (SAHI)は、高解像度画像における小さな物体の検出を改善するが、しばしば背景タイルにかなりの計算を費やす。
本研究では,フォアグラウンド地域をローカライズし,情報領域にスライスされたリファインメントを限定する軽量なプロポーザを導入した推論時フレームワークである,ROI(Regional-of-interest)-Gated SAHIを提案する。
フレームワークを2つの設定で評価する。
128枚の画像からなるCOCO128全分割データセットにおいて、静的ROIゲーティングはフルSAHIよりも平均的に遅く、速度比0.88となり、フルSAHIの0.7569に比べて低いmAP@0.5の0.6602が得られる。
τ=$ 0.4 の単純な適応ルーティングポリシーは平均遅延を誘導し、完全な SAHI よりも 1.02$\times$ をわずかに増加させる。
3次元のスパース・ツー・デンスケーススタディでは、ROIゲーティングは0.96$\times$から6.90$\times$までのスピードアップを達成し、平均スピードアップは3.41$\times$である。
これらの結果は、ROIゲーティングがスパースシーンにおいて最も有益であることを示し、ロバストな平均行動にポリシーベースのルーティングを必要とすることを示している。
関連論文リスト
- RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs [50.93650157115467]
本稿では,ロール指向の地域的エビデンスアロケーションとして視覚トークンプルーニングをキャストする,トレーニングフリーのフレームワークであるRoRAを紹介する。
整合した予算の下では、RoRAはLLaVAやQwen-VLファミリで、トレーニングなしの強力なベースラインを一貫して上回っている。
66.7%のプルーニング比で、RoRAはトークンの選択に0.7msしか必要とせず、エンドツーエンドの推論時間を24.6%削減する。
論文 参考訳(メタデータ) (2026-08-07T10:39:47Z) - From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs [8.393016378205752]
我々は、マッピングとプランニングは単一の表現を中心に共同設計されるべきであると主張する:符号付き距離関数(SDF)。
タンデムでは、距離情報を利用して最大衝突のない球を成長させる検索ベースのプランナーであるBubble$star$を開発する。
計算制約の厳密な条件下で室内環境をリアルタイムでナビゲートし,四角形回路上でのOREN-Bubble$star$アプローチを実演する。
論文 参考訳(メタデータ) (2026-07-21T17:18:46Z) - DualTCN: A Physics-Constrained Temporal Convolutional Network for 2 Time-Domain Marine CSEM Inversion [1.2031796234206138]
DualTCNは、時間領域の海洋電磁制御源(MCSEM)過渡データを反転させるための最初のディープラーニングフレームワークである。
このフレームワークは、4つのアースモデルパラメータを回帰し、微分可能なソフトステップデコーダを用いてプロファイルを再構成する。
このフレームワークは、カリキュラムベースの振幅増大によるノイズに対する高い堅牢性を示し、平均$barR2$ 0.858 at $pm2%$ランダム振幅誤差を維持している。
論文 参考訳(メタデータ) (2026-05-06T14:58:17Z) - $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization [6.908972852063454]
時間的行動の局所化は、正確な境界検出と計算効率の両方を必要とする。
我々は、境界距離回帰(BDR)と適応時間制限(ATR)という2つの補完的なイノベーションを通じてこの問題に対処する。
THUMOS14では、ActionFormer++ (55.7% mAP@0.7 at 235G) よりも36%少ないFLOPを用いて、151GのFLOPで56.5% mAP@0.7を達成する。
論文 参考訳(メタデータ) (2025-11-06T00:41:54Z) - Identity-Link IRT for Label-Free LLM Evaluation: Preserving Additivity in TVD-MI Scores [3.959606869996232]
本報告では,TVD-MIの2次試行平均値が,非線形リンク関数を使わずに項目応答理論(IRT)に適合する付加的構造で中心確率スコアを得ることを示す。
Giniエントロピーからこのクリップ付き線形評価を導出し、境界飽和を扱うボックス制約最小二乗の定式化を導出する。
論文 参考訳(メタデータ) (2025-10-16T17:59:25Z) - TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs [67.55973229034319]
本稿では,マルチモーダルな大規模言語モデル(MLLM)をビデオ時間的グラウンド処理に適応させることの有効性向上を目的とした,新しい強化微調整フレームワークであるTempSamp-R1を紹介する。
我々は、TempSamp-R1がGRPOベースのベースラインより優れており、ベンチマークデータセット上で新しい最先端のパフォーマンスを確立していることを示す。
論文 参考訳(メタデータ) (2025-09-22T17:30:15Z) - Speedy MASt3R [68.47052557089631]
MASt3Rは、DUSt3Rを活用して高速な相互マッチング方式を導入することで、画像マッチングを3Dタスクとして再定義する。
高速MASt3Rは、精度を犠牲にすることなく、推論時間(画像ペアあたり198msから91ms)を54%削減する。
この進歩により、リアルタイムな3D理解が可能になり、複合現実ナビゲーションや大規模3Dシーン再構築といったアプリケーションに恩恵をもたらす。
論文 参考訳(メタデータ) (2025-03-13T03:56:22Z) - Patch-Level Contrasting without Patch Correspondence for Accurate and
Dense Contrastive Representation Learning [79.43940012723539]
ADCLRは、正確で高密度な視覚表現を学習するための自己教師型学習フレームワークである。
提案手法は, コントラッシブな手法のための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2023-06-23T07:38:09Z) - Learned Two-Plane Perspective Prior based Image Resampling for Efficient
Object Detection [20.886999159134138]
リアルタイムの効率的な認識は、自律的なナビゲーションと都市規模のセンシングに不可欠である。
本研究では,3次元シーンの粗い形状を取り入れた学習可能な幾何学誘導先行手法を提案する。
提案手法は,4.1 $AP_S$ または +39% で検出率を向上し,また,4.3 $sAP_S$ または +63% で検出性能を向上する。
論文 参考訳(メタデータ) (2023-03-25T00:43:44Z) - AdaGDA: Faster Adaptive Gradient Descent Ascent Methods for Minimax
Optimization [104.96004056928474]
本稿では,非コンケーブ最小値問題に対する高速適応勾配降下法を提案する。
我々は,本手法が,ミニバッチサイズが$O(kappa2.5epsilon-3)$のより低いサンプル複雑性に達することを示す。
論文 参考訳(メタデータ) (2021-06-30T14:47:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。