論文の概要: HOIBlender: Blending Lightweight Detection with Vision-Language Priors for Efficient Human-Object Interaction Detection
- arxiv url: http://arxiv.org/abs/2609.23431v2
- Date: Tue, 29 Sep 2026 10:04:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.504394
- Title: HOIBlender: Blending Lightweight Detection with Vision-Language Priors for Efficient Human-Object Interaction Detection
- Title(参考訳): HOIBlender:効率的な人-物間相互作用検出のためのビジョンランゲージ前処理による曲げ軽量検出
- Abstract要約: 我々は、そのコア設計原理にちなんで命名された効率的なHOI検出器である textbfHOIBlender を提示する。
検出器で座った視覚トークン、空間的対象物推論、BLIP-2セマンティクスを1つの軽量デコードパイプライン内でブレンドする。
HICO-DETではSOV-STG-VLAとHybrid-SOV-VLAを一貫して上回り、わずか9ドルのトレーニングエポックで44.49ドルのデフォルトフルmAPを達成した。
- 参考スコア(独自算出の注目度): 7.426769461233192
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-object interaction (HOI) detection requires grounding an interacting human-object pair and recognizing the verb that links them, often under severe long-tail supervision. Recent methods improve accuracy with stronger detectors and vision-language priors, but many still stack heavy transformer encoders, intricate denoising schedules, or post-hoc semantic calibration on top of the detector. We present \textbf{HOIBlender}, an efficient HOI detector named after its core design principle: blending detector-grounded visual tokens, spatial subject-object reasoning, and BLIP-2 semantic priors inside one lightweight decoding pipeline. HOIBlender builds on an RF-DETR/LW-DETR-style foundation with a DINOv2 backbone and selects top-$K$ image-conditioned tokens directly from the multi-scale projector as subject and object candidates, removing the dedicated encoder stage retained by prior HOI methods. A dual-stage decoder first stabilizes human-object geometry and then performs verb and HOI classification through progressive BLIP-2 prior fusion, with classifier weights initialized from BLIP-2 text embeddings for long-tail categories. Grouped-query training further enriches optimization without increasing inference cost. Across three model scales (Nano, Small, 2XL), HOIBlender consistently outperforms SOV-STG-VLA and Hybrid-SOV-VLA on HICO-DET, reaching $44.49$ Default Full mAP in only $9$ training epochs while maintaining competitive latency and parameter budgets. These results show that lightweight detection, structured spatial-semantic decoding, and deeply integrated vision-language priors can be blended into a single efficient HOI pipeline.
- Abstract(参考訳): 人間と物体の相互作用(Human-object Interaction、HOI)の検出には、相互作用する人間と物体のペアを接地し、それらとリンクする動詞を認識する必要がある。
近年の手法では、より強力な検出器とビジョン言語による事前の精度向上が図られているが、多くの部分はまだ重いトランスフォーマーエンコーダを積み重ねており、複雑なデノナイジングスケジュールや、検出器の上のポストホックセマンティックキャリブレーションを積み重ねている。
本稿では,その設計原理から命名された効率的なHOI検出器であるtextbf{HOIBlender}について述べる。
HOIBlenderはRF-DETR/LW-DETRスタイルの基盤をDINOv2バックボーンで構築し、マルチスケールプロジェクタから直接トップ$K$の画像条件付きトークンを選択する。
二段復号器は、まず人オブジェクト形状を安定化し、次にプログレッシブBLIP-2プリフュージョンにより動詞とHOI分類を行い、長尾カテゴリのBLIP-2テキスト埋め込みから初期化する。
グループクエリのトレーニングは、推論コストを増大させることなく最適化をさらに強化する。
3つのモデルスケール(Nano、Small、2XL)にわたって、HOIBlenderはHICO-DETでSOV-STG-VLAとHybrid-SOV-VLAを一貫して上回り、競争の遅延とパラメータ予算を維持しながら、わずか9ドルのトレーニング期間で44.49ドルのフルmAPを達成した。
これらの結果から, 軽量検出, 構造化空間意味復号化, 深く統合された視覚言語先行処理を, 単一効率なHOIパイプラインにブレンドできることが示唆された。
関連論文リスト
- FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales [65.4821703903285]
FLOROは、小さなが高度に多様なリモートセンシングコーパスから転送可能な表現を学習するために設計されたマルチモーダル基礎モデルである。
FLOROは、Sentinel-1、Sentinel-2、SkySAT画像、標高、UAV由来のデータとの不均一な組み合わせによるマスク付きオートエンコーディングを用いて事前訓練される。
我々は、シーン分類、セグメンテーション、回帰タスクにまたがる凍結エンコーダプロトコルを用いて、PANGAEAベンチマーク上でFLOROを評価した。
論文 参考訳(メタデータ) (2026-05-27T08:55:54Z) - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。
既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。
DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:44:26Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision [0.08699280339422537]
CLIP-Joint-Detectは,エンドツーエンドのジョイントトレーニングを通じて,CLIPスタイルのコントラスト的視覚言語指導を統合するフレームワークである。
軽量並列ヘッドは、CLIP埋め込み空間に領域やグリッドを投影し、InfoNCEの対照的な損失と補助的なクロスエントロピー項を通じて学習可能なクラス固有のテキスト埋め込みと整列する。
我々は、Faster R-CNNを用いたPascal VOC 2007+2012と、最新のYOLO検出器(YOLOv11)を用いた大規模MS 2017ベンチマークでこれを検証した。
論文 参考訳(メタデータ) (2025-12-28T15:21:20Z) - Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction Detection [29.24483392547041]
オープン・ボキャブラリ・ヒューマン・オブジェクト・インタラクション(HOI)検出は、画像に対するすべての人間、動詞、オブジェクト>三つ子を検知する難しいタスクである。
既存のアプローチは通常、大きなビジョンランゲージモデル(VLM)によって生成される出力機能に依存している。
オープン語彙HOI検出のためのバイラテラル協調フレームワーク(BC-HOI)を提案する。
論文 参考訳(メタデータ) (2025-07-09T03:16:39Z) - Efficient Decoder-free Object Detection with Transformers [75.00499377197475]
視覚変換器(ViT)は、物体検出アプローチのランドスケープを変化させている。
本稿では,デコーダフリー完全トランス(DFFT)オブジェクト検出器を提案する。
DFFT_SMALLは、トレーニングおよび推論段階で高い効率を達成する。
論文 参考訳(メタデータ) (2022-06-14T13:22:19Z) - Disentangle Your Dense Object Detector [82.22771433419727]
深層学習に基づく高密度物体検出器はここ数年で大きな成功を収め、ビデオ理解などのマルチメディアアプリケーションにも応用されてきた。
しかし、現在の高密度検出器の訓練パイプラインは、保持できない多くの接続に妥協されている。
そこで本研究では, 簡易かつ効果的な遠心分離機構を設計し, 現在の最先端検出器に統合するDED(Disentangled Dense Object Detector)を提案する。
論文 参考訳(メタデータ) (2021-07-07T00:52:16Z) - SADet: Learning An Efficient and Accurate Pedestrian Detector [68.66857832440897]
本稿では,一段検出器の検出パイプラインに対する一連の最適化手法を提案する。
効率的な歩行者検出のための単発アンカーベース検出器(SADet)を形成する。
構造的には単純だが、VGA解像度の画像に対して最先端の結果と20ドルFPSのリアルタイム速度を示す。
論文 参考訳(メタデータ) (2020-07-26T12:32:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。