論文の概要: Hierarchy-Aware Fine-Tuning of Vision-Language Models
- arxiv url: http://arxiv.org/abs/2512.21529v1
- Date: Thu, 25 Dec 2025 06:44:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-29 20:48:41.851134
- Title: Hierarchy-Aware Fine-Tuning of Vision-Language Models
- Title(参考訳): 階層型視覚言語モデルの微調整
- Abstract要約: 視覚言語モデルは、大規模な画像テキスト事前学習を通じて強力なマルチモーダル表現を学習する。
標準的アプローチはラベルをフラットなカテゴリとして扱い、完全な微調整を必要とする。
構造的一貫性を保ちつつ,いくつかのパラメータを更新する,効率的な階層型微調整フレームワークを提案する。
- 参考スコア(独自算出の注目度): 18.244518940229202
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) learn powerful multimodal representations through large-scale image-text pretraining, but adapting them to hierarchical classification is underexplored. Standard approaches treat labels as flat categories and require full fine-tuning, which is expensive and produces inconsistent predictions across taxonomy levels. We propose an efficient hierarchy-aware fine-tuning framework that updates a few parameters while enforcing structural consistency. We combine two objectives: Tree-Path KL Divergence (TP-KL) aligns predictions along the ground-truth label path for vertical coherence, while Hierarchy-Sibling Smoothed Cross-Entropy (HiSCE) encourages consistent predictions among sibling classes. Both losses work in the VLM's shared embedding space and integrate with lightweight LoRA adaptation. Experiments across multiple benchmarks show consistent improvements in Full-Path Accuracy and Tree-based Inconsistency Error with minimal parameter overhead. Our approach provides an efficient strategy for adapting VLMs to structured taxonomies.
- Abstract(参考訳): 視覚言語モデル(VLM)は、大規模な画像テキスト事前学習を通じて強力なマルチモーダル表現を学習するが、それらを階層的分類に適応させることは過小評価される。
標準的アプローチは、ラベルをフラットなカテゴリとして扱い、完全な微調整を必要とする。
構造的一貫性を保ちつつ,いくつかのパラメータを更新する,効率的な階層型微調整フレームワークを提案する。
ツリーパスKLディバージェンス(TP-KL)は,垂直コヒーレンス(垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス,垂直コヒーレンス)に沿って予測を整列する。
どちらもVLMの共有埋め込みスペースで動作し、軽量のLoRAアダプティブと統合されている。
複数のベンチマークの実験では、パラメータのオーバーヘッドを最小限に抑えたフルパス精度とツリーベースの不整合エラーが一貫した改善を示している。
我々のアプローチは、VLMを構造化分類に適応するための効率的な戦略を提供する。
関連論文リスト
- Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models [47.868429337792314]
大規模なマルチモーダルモデル(LMM)は、しばしば分類学的な知識が欠如しており、階層的視覚認識(HVR)の一貫性が低い。
LMMにおける階層整合性を改善するシンプルなプラグアンドプレイ正規化器である階層表現正規化(HiR2$)を提案する。
HiR2$は、様々なLMMと微調整方法の分類構造を効果的にキャプチャする。
論文 参考訳(メタデータ) (2026-07-03T03:16:41Z) - Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification [50.20892407648858]
マルチモーダルコントラスト学習は、画像とテキストカテゴリを整列させることで、ゼロショットの視覚的分類を可能にした。
既存の手法は、しばしば分類学レベルで矛盾する予測を生成する。
本稿では,各分類レベルが適切な最適化を受けることを保証するグループバランス設計を提案する。
我々は、BioCLIPに基づいてTreeOfLife-10Mでモデルをトレーニングし、複数の階層分類ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-06-20T02:12:05Z) - Online Continual Learning with Dynamic Label Hierarchies [72.33335166136045]
粒度をまたいで重大度が進化する新しい問題設定であるDHOCLを導入し,各サンプルは単一階層レベルでの監視を行う。
i) 混合粒度の部分的監視は、塑性を制約し、階層間のセマンティック一貫性を損なう、進化するパスワイド階層上のポイントワイド信号のみを提供する。
本稿では,相補的分類を適応的に組み合わせ,学習可能な階層型プロトタイプによって正規化し,素早い適応,階層的整合性,構造的知識の統合を可能にするHALOを提案する。
論文 参考訳(メタデータ) (2026-05-12T08:20:23Z) - Hierarchically Robust Zero-shot Vision-language Models [74.79155369056639]
VLM(Vision-Language Models)はゼロショット分類を行うことができるが、敵攻撃の影響を受けやすい。
既存のアプローチは、固定されたテキスト埋め込みをイメージ埋め込みと整合させ、自然なパフォーマンスと堅牢性を犠牲にする。
本稿では,階層的な埋め込みと画像・テキスト・モダリティの対角的ロバストなアライメントに基づく,新しい逆方向の微調整フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-20T21:42:14Z) - MAPLE: Multi-Path Adaptive Propagation with Level-Aware Embeddings for Hierarchical Multi-Label Image Classification [2.165423459607678]
MAPLE(Multi-Path Adaptive Propagation with Level-Aware Embeddings)は、グラフ対応のテキスト記述から階層的セマンティック初期化を統合するフレームワークである。
我々はMAPLEが地球観測のための階層的意味論(EO)を効果的かつ効率的にモデル化していることを示す。
CORINEアラインなリモートセンシングデータセット(AID, DFC-15, MLRSNet)の評価は、数ショットで最大で42%改善している。
論文 参考訳(メタデータ) (2026-03-31T14:23:11Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Learning Consistent Taxonomic Classification through Hierarchical Reasoning [61.372270953201955]
分類学分類における葉レベル精度と階層的整合性を改善するための2段階階層型推論フレームワークを提案する。
我々のフレームワークはQwen2.5-VL-7Bモデルで実装され、葉レベルと階層的整合性の両方で元の72Bを10%以上上回っている。
論文 参考訳(メタデータ) (2026-01-21T03:00:00Z) - Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds [49.95082206008502]
ツリーを横断するアライメントは、画像とテキストのモダリティの両方に対してツリーのような階層的な特徴を構築し、調整する手法である。
本稿では,中間トランスフォーマー層からの視覚的クラストークンにクロスアテンション機構を適用した意味認識型視覚特徴抽出フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-31T11:32:15Z) - Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models [4.935224714809964]
階層的アライメント(Hierarchical Alignment)は、モデルレイヤの異なる機能ブロックにターゲットDPOを適用する新しい手法である。
具体的には、局所的な層(ローカル・アライン)の整列は文法的な流感を高める。
グローバル層(Global-Align)の整合性は、仮説として事実整合性を改善するが、論理的コヒーレンスを強化するための最も効果的な戦略であることを証明している。
論文 参考訳(メタデータ) (2025-10-14T00:58:34Z) - Hierarchical Adaptive networks with Task vectors for Test-Time Adaptation [3.3834108313265916]
タスクベクトルを用いた階層型適応ネットワーク(Hi-Vec)を提案する。
Hi-Vecは、既存のメソッドが様々な複雑さのシフトに適応できるようにする。
挑戦的なシナリオや複数のターゲットデータセットにおいて、Hi-Vecの性能を厳格に評価する。
論文 参考訳(メタデータ) (2025-08-11T21:55:53Z) - GLiClass: Generalist Lightweight Model for Sequence Classification Tasks [49.2639069781367]
本稿では,シーケンス分類タスクにGLiNERアーキテクチャを適用する新しい手法であるGLiClassを提案する。
提案手法は,ゼロショットおよび少数ショット学習シナリオに必要な柔軟性を維持しつつ,埋め込み方式に匹敵する高い精度と効率を実現する。
論文 参考訳(メタデータ) (2025-08-11T06:22:25Z) - HieraRS: A Hierarchical Segmentation Paradigm for Remote Sensing Enabling Multi-Granularity Interpretation and Cross-Domain Transfer [5.2379726950251655]
HieraRSは、多粒度予測を可能にする新しい階層的解釈パラダイムである。
不均一な木構造階層を持つクロスドメインタスクへのLCLUモデルの効率的な転送をサポートする。
論文 参考訳(メタデータ) (2025-07-11T16:44:01Z) - TreeLoRA: Efficient Continual Learning via Layer-Wise LoRAs Guided by a Hierarchical Gradient-Similarity Tree [52.44403214958304]
本稿では階層的な勾配の類似性を利用して階層型アダプタを構築する新しい手法であるTreeLoRAを紹介する。
タスク類似度推定の計算負担を軽減するために,より低い信頼度境界に基づくアルゴリズムを開発するために,バンド手法を用いる。
視覚変換器 (ViTs) と大規模言語モデル (LLMs) の両方を用いた実験により, 提案手法の有効性と有効性を示す。
論文 参考訳(メタデータ) (2025-06-12T05:25:35Z) - Enforcing Consistency and Fairness in Multi-level Hierarchical Classification with a Mask-based Output Layer [25.819440955594736]
分類を強制し、一貫性、公正性、正確な一致を含む目的を最適化するために設計された公正でモデルに依存しないレイヤを導入します。
評価の結果,提案した層は予測の公平性を向上するだけでなく,分類を強制し,一貫した予測と優れた性能をもたらすことが示された。
論文 参考訳(メタデータ) (2025-03-19T06:30:04Z) - Learning and Evaluating Hierarchical Feature Representations [3.770103075126785]
我々は、直交部分空間の階層的構成(Hier-COS)という新しい枠組みを提案する。
Hier-COSは、与えられた分類木の構造と整合した設計により、深い特徴埋め込みをベクトル空間にマッピングすることを学ぶ。
Hier-COSはすべてのデータセットにまたがって最先端の階層的パフォーマンスを実現し,同時に1つのケースを除いてトップ1の精度を上回ります。
論文 参考訳(メタデータ) (2025-03-10T20:59:41Z) - ProTeCt: Prompt Tuning for Taxonomic Open Set Classification [59.59442518849203]
分類学的オープンセット(TOS)設定では、ほとんどショット適応法はうまくいきません。
本稿では,モデル予測の階層的一貫性を校正する即時チューニング手法を提案する。
次に,階層整合性のための新しいPrompt Tuning(ProTeCt)手法を提案し,ラベル集合の粒度を分類する。
論文 参考訳(メタデータ) (2023-06-04T02:55:25Z) - Weakly-supervised Action Localization via Hierarchical Mining [76.00021423700497]
弱教師付きアクションローカライゼーションは、ビデオレベルの分類ラベルだけで、与えられたビデオ内のアクションインスタンスを時間的にローカライズし、分類することを目的としている。
ビデオレベルおよびスニペットレベルでの階層的マイニング戦略,すなわち階層的監視と階層的一貫性マイニングを提案する。
我々は、HiM-NetがTHUMOS14とActivityNet1.3データセットの既存の手法よりも、階層的に監督と一貫性をマイニングすることで、大きなマージンを持つことを示す。
論文 参考訳(メタデータ) (2022-06-22T12:19:09Z) - Tree-structured Attention with Hierarchical Accumulation [103.47584968330325]
階層的累積」は解析木構造を一定時間複雑度で自己注意に符号化する。
提案手法は,4つの IWSLT 翻訳タスクと WMT'14 翻訳タスクにおいて,SOTA 法より優れている。
論文 参考訳(メタデータ) (2020-02-19T08:17:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。