論文の概要: Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos
- arxiv url: http://arxiv.org/abs/2607.10797v1
- Date: Sun, 12 Jul 2026 15:09:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.542321
- Title: Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos
- Title(参考訳): 映像からの複雑な集合行動理解のための構成文脈微調整視覚言語モデル
- Abstract要約: 我々は、構成文脈ファインチューニング(CCFT)を用いて、視覚言語モデル(VLM)をこの困難な領域に適用する。
CCFTは、アセンブリアクションをセマンティック要素(Verb、Object、Tool)と微調整のVLMに分解して、テンプレート化された質問応答ペアを使用して各アクション要素を認識する。
既存のアセンブリビデオデータセットからHA-ViD-VQAとIKEA-ASM-VQAデータセットを作成する。
- 参考スコア(独自算出の注目度): 11.617428552650027
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Assembly action understanding is a key enabler for effective human-robot collaborative assembly, yet it remains challenging due to subtle motions and fine-grained hand-object interactions. We adapt vision-language models (VLMs) to this challenging domain with Compositional Context Fine-Tuning (CCFT), a method that decomposes assembly actions into semantic elements (Verb, Object, Tool) and fine-tunes VLMs to recognize each action element using templated question-answering pairs. This approach ensures near-deterministic outputs. To enable efficient and effective multi-task learning under limited data, a Layer-Partitioned Alternating Training (LP-AT) method is presented, which assigns distinct model layers to recognize specific action elements through element-specific low-rank adapters. LP-AT alternates weight updates across element-specific adapters, reducing cross-task interference while enabling per-adapter hyperparameter optimization. Furthermore, we create HA-ViD-VQA and IKEA-ASM-VQA datasets from existing assembly video datasets. Extensive experiments on these datasets demonstrate that our method consistently outperforms strong action recognition baselines while providing interpretable element-level predictions that can support diverse downstream applications.
- Abstract(参考訳): 組み立て動作理解は、効果的な人間とロボットの協調組み立てのための重要な実現法であるが、微妙な動きと細かな手と物体の相互作用のため、依然として困難である。
組立動作を意味要素(Verb, Object, Tool)と微調整VLMに分解し,テンプレート化された質問応答ペアを用いて各アクション要素を認識する手法であるCCFTを用いて,視覚言語モデル(VLM)をこの困難な領域に適用する。
このアプローチは、ほぼ決定論的出力を保証する。
限られたデータの下で効率よく効果的なマルチタスク学習を実現するために、要素固有の低ランクアダプタを通して特定のアクション要素を認識するために異なるモデル層を割り当てる層分割交代訓練(LP-AT)法が提案されている。
LP-ATは、要素固有のアダプタ間で重み更新を交互に行い、アダプタごとのハイパーパラメータ最適化を可能にしながら、クロスタスクの干渉を減らす。
さらに、既存のアセンブリビデオデータセットからHA-ViD-VQAとIKEA-ASM-VQAデータセットを作成する。
これらのデータセットに対する大規模な実験により、我々の手法は、多様な下流アプリケーションをサポートすることができる解釈可能な要素レベルの予測を提供しながら、強い行動認識ベースラインを一貫して上回ることを示した。
関連論文リスト
- PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation [58.1914505657064]
本稿では,クラスレベルのセマンティクスと空間コンテキスト間の知識干渉の課題を軽減するために,単純な並列コストアグリゲーション(PCA-Seg)パラダイムを提案する。
8つのベンチマークの実験では、PCA-Segの各並列ブロックは0.35万のパラメータしか追加せず、最先端のOSPS性能を実現している。
論文 参考訳(メタデータ) (2026-03-18T09:26:43Z) - Group Relative Augmentation for Data Efficient Action Detection [11.169883977958454]
アクション検出にVLM(Big Video-Language Models)を適応させるには、いくつかの例が課題となっている。
パラメータ係数チューニング(LoRA)と新たな学習可能な内部特徴拡張を組み合わせた効率的な適応戦略を提案する。
複雑なマルチラベル・マルチパーソン動作検出データセットに対して,本手法の有効性を示す。
論文 参考訳(メタデータ) (2025-07-28T21:46:05Z) - LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching [25.883546163390957]
大規模言語モデル(LLM)が生成する行動関連外部知識を組み込むことにより,CLIPをきめ細かな行動レベル理解に役立てる。
本稿では,行動認識に基づく視覚的特徴を集約し,識別的・行動的視覚的表現を確立するための知識を付加する適応的相互作用モジュールを提案する。
論文 参考訳(メタデータ) (2025-06-30T03:49:08Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - Hierarchical Context Transformer for Multi-level Semantic Scene Understanding [37.35498412336018]
マルチレベルセマンティックシーン理解(MSSU)として設定されたタスクを表現することを提案する。
本研究では,新しい階層型コンテキスト変換器 (HCT) ネットワークを提案する。
我々の白内障データセットと一般に利用可能なPSI-AVAデータセットを用いた実験により,本手法の優れた性能が示された。
論文 参考訳(メタデータ) (2025-02-21T03:36:16Z) - Pilot: Building the Federated Multimodal Instruction Tuning Framework [79.56362403673354]
本フレームワークは、視覚エンコーダとLCMのコネクタに「アダプタのアダプタ」の2つの段階を統合する。
ステージ1では視覚情報からタスク固有の特徴とクライアント固有の特徴を抽出する。
ステージ2では、クロスタスクインタラクションを実行するために、クロスタスクMixture-of-Adapters(CT-MoA)モジュールを構築します。
論文 参考訳(メタデータ) (2025-01-23T07:49:24Z) - Spatial-Temporal Multi-level Association for Video Object Segmentation [89.32226483171047]
本稿では,参照フレーム,テストフレーム,オブジェクト特徴を相互に関連付ける空間的・時間的多レベルアソシエーションを提案する。
具体的には,空間的・時間的多段階特徴関連モジュールを構築し,より優れた目標認識特徴を学習する。
論文 参考訳(メタデータ) (2024-04-09T12:44:34Z) - RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation [53.4319652364256]
本稿では,ビデオオブジェクトのセグメンテーションを参照するためのSAMの可能性を探るRefSAMモデルを提案する。
提案手法は,Cross-RValModalを用いることで,モダリティ学習を向上させるためにオリジナルのSAMモデルに適応する。
我々は、言語と視覚の特徴を効果的に調整し、融合させるために、パラメータ効率のチューニング戦略を採用している。
論文 参考訳(メタデータ) (2023-07-03T13:21:58Z) - SOC: Semantic-Assisted Object Cluster for Referring Video Object
Segmentation [35.063881868130075]
本稿では,映像レベルの視覚言語的アライメントを高めることによって,映像オブジェクトセグメンテーション(RVOS)について述べる。
本稿では,映像コンテンツとテキストガイダンスを集約したセマンティック支援オブジェクトクラスタ(SOC)を提案する。
我々は、人気のあるRVOSベンチマークで広範な実験を行い、我々の手法は、すべてのベンチマークにおける最先端の競合よりも顕著なマージンで優れています。
論文 参考訳(メタデータ) (2023-05-26T15:13:44Z) - Scalable Video Object Segmentation with Identification Mechanism [125.4229430216776]
本稿では,半教師付きビデオオブジェクト(VOS)のスケーラブルで効果的なマルチオブジェクトモデリングを実現する上での課題について検討する。
AOT(Associating Objects with Transformers)とAOST(Associating Objects with Scalable Transformers)の2つの革新的なアプローチを提案する。
当社のアプローチは最先端の競合に勝って,6つのベンチマークすべてにおいて,例外的な効率性とスケーラビリティを一貫して示しています。
論文 参考訳(メタデータ) (2022-03-22T03:33:27Z) - Learning Modality Interaction for Temporal Sentence Localization and
Event Captioning in Videos [76.21297023629589]
そこで本稿では,ビデオの各対のモダリティの相補的情報をよりよく活用するために,ペアワイズなモダリティ相互作用を学習するための新しい手法を提案する。
提案手法は,4つの標準ベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2020-07-28T12:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。