論文の概要: Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning
- arxiv url: http://arxiv.org/abs/2606.15765v1
- Date: Sun, 14 Jun 2026 11:55:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.830757
- Title: Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning
- Title(参考訳): マルチタスク学習のための視覚基礎モデルのタスク指示型因果ルーティング
- Abstract要約: 視覚基礎モデル(VFM)は、幅広い視覚的タスクにおいて強い堅牢性と伝達性を示す。
TIGER(Task-Guided Expert Routing)は、マルチタスクの高密度予測のために複数の異種VFMを協調するフレームワークである。
我々は、TIGERをNYUD-v2とPascal Contextの2つのマルチタスク密度予測ベンチマークで評価し、最近のマルチタスク学習ベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 28.310784933552444
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision foundation models (VFMs) have demonstrated strong robustness and transferability across a wide range of visual tasks. However, each model typically encodes strong inductive biases shaped by its pre-training objective and data domain, resulting in fragmented yet complementary visual knowledge. As a result, a single model often struggles to capture the diverse visual representations required across multiple dense prediction tasks. To address this limitation, we propose TIGER (Task-Instruction-Guided Expert Routing), a framework that coordinates multiple heterogeneous VFMs for multi-task dense prediction. Instead of naively aggregating expert features, TIGER leverages natural-language task instructions to guide a routing network that assigns token-level expert weights conditioned on task semantics, enabling adaptive integration of complementary expert features. TIGER further introduces a counterfactual loss that aligns routing decisions with each expert's causal contribution by measuring prediction changes when experts are excluded, encouraging more reliable and interpretable routing. We evaluate TIGER on two multi-task dense prediction benchmarks, NYUD-v2 and Pascal Context, where it consistently outperforms recent multi-task learning baselines while keeping all VFMs frozen. These results demonstrate that combining instruction-guided expert routing with counterfactual causal alignment enables effective coordination of heterogeneous vision foundation models.
- Abstract(参考訳): 視覚基礎モデル(VFM)は、幅広い視覚的タスクにおいて強い堅牢性と伝達性を示す。
しかしながら、各モデルは、訓練前の目的とデータドメインによって形成された強い帰納バイアスを符号化し、断片化されたが相補的な視覚的知識をもたらす。
結果として、単一のモデルは、複数の密集した予測タスクで要求される多様な視覚的表現を捉えるのに苦労することが多い。
この制限に対処するため,マルチタスク高密度予測のために多種多様なVFMを協調するTIGER(Task-Instruction-Guided Expert Routing)を提案する。
TIGERは、専門家の機能をナビゲートする代わりに、自然言語のタスク命令を利用して、タスクセマンティクスで条件付けられたトークンレベルの専門家の重み付けを割り当てるルーティングネットワークを誘導し、補完的な専門家機能の適応的な統合を可能にする。
さらに、TIGERは、専門家が除外された場合の予測変化を測定し、より信頼性が高く解釈可能なルーティングを促進することで、各専門家の因果貢献とルーティング決定を整合させる反ファクト的損失も導入している。
我々は、TIGERをNYUD-v2とPascal Contextの2つのマルチタスク密度予測ベンチマークで評価し、最新のマルチタスク学習ベースラインを常に上回りながら、すべてのVFMを凍結し続ける。
これらの結果は、命令誘導型エキスパートルーティングと反ファクト因果アライメントを組み合わせることで、異種視覚基盤モデルの効果的な協調を可能にすることを示す。
関連論文リスト
- ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning [16.21619173438734]
MLLM(Multimodal Large Language Models)は、命令チューニングによって高いパフォーマンスを達成するが、現実のデプロイメントでは、新たな視覚言語機能を取得する必要がある。
近年の手法では、画像-テキスト類似性ルーティングのMixture of LoRA Expertsのようなスパースアーキテクチャが採用されている。
プロトタイプ誘導適応チューニングフレームワークProtoAdaを提案する。
論文 参考訳(メタデータ) (2026-06-01T17:59:13Z) - Multi-Domain Learning with Global Expert Mapping [102.62297074508147]
Mixture-of-Experts (MoE)モデルは、入力を専門分野(専門家)にルーティングすることでスケーラブルなソリューションを提供する。
本稿では,学習ルータをグローバルスケジューラに置き換えるプランナー・コンパイラフレームワークであるGEMを提案する。
我々のプランナーは線形プログラミングの緩和に基づいて、データセットを専門家に分数的に割り当てる一方、コンパイラはこのソフトプランを決定論的でキャパシティを意識したマッピングに変換するために階層的なラウンドリングを適用する。
実験の結果、GEM-DINOはUODBベンチマークで最先端のパフォーマンスを達成し、表現不足のデータセットに顕著な利益をもたらし、タスク干渉をわずかに解決していることがわかった。
論文 参考訳(メタデータ) (2026-04-20T21:09:34Z) - Multi-Task Dense Prediction Fine-Tuning with Mixture of Fine-Grained Experts [22.936728143586443]
密集予測のためのマルチタスク学習(MTL)は有望な結果を示しているが、タスク固有の特殊化と共有表現のバランスをとる上ではまだ課題に直面している。
3つの重要なイノベーションとファインチューニングを組み合わせることで、MoEベースのMTLモデルを探索する、ファイングラインド・ミックス・オブ・エキスパートアーキテクチャを導入する。
論文 参考訳(メタデータ) (2025-07-25T08:59:30Z) - Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization [7.776434991976473]
マルチタスク学習(MTL)は、複数のタスクの同時トレーニングを含む。
本稿では,高密度視覚タスクに特化して設計された高度MTLモデルを提案する。
論文 参考訳(メタデータ) (2024-12-04T10:05:47Z) - ULTRA-DP: Unifying Graph Pre-training with Multi-task Graph Dual Prompt [67.8934749027315]
本稿では,タスク識別と位置識別をGNNに注入する,グラフハイブリッド事前学習のための統合フレームワークを提案する。
また,約$k$-nearest隣人のグループに基づいた,新しい事前学習パラダイムを提案する。
論文 参考訳(メタデータ) (2023-10-23T12:11:13Z) - Exploiting Modality-Specific Features For Multi-Modal Manipulation
Detection And Grounding [54.49214267905562]
マルチモーダルな操作検出とグラウンド処理のためのトランスフォーマーベースのフレームワークを構築する。
本フレームワークは,マルチモーダルアライメントの能力を維持しながら,モダリティ特有の特徴を同時に探求する。
本稿では,グローバルな文脈的キューを各モーダル内に適応的に集約する暗黙的操作クエリ(IMQ)を提案する。
論文 参考訳(メタデータ) (2023-09-22T06:55:41Z) - ComPtr: Towards Diverse Bi-source Dense Prediction Tasks via A Simple yet General Complementary Transformer [71.82644727907146]
多様な双方向の高密度予測タスクに対して,$underlineComP$lementary $underlinetr$ansformer, $textbfComPtr$を提案する。
ComPtrは異なる入力を等しく扱い、変換器上にシーケンス・ツー・シーケンスの形で効率的な密な相互作用モデルを構築する。
論文 参考訳(メタデータ) (2023-07-23T15:17:45Z) - MulT: An End-to-End Multitask Learning Transformer [66.52419626048115]
我々はMulTと呼ばれるエンドツーエンドのマルチタスク学習トランスフォーマフレームワークを提案し、複数のハイレベル視覚タスクを同時に学習する。
本フレームワークは,入力画像を共有表現にエンコードし,タスク固有のトランスフォーマーベースのデコーダヘッドを用いて各視覚タスクの予測を行う。
論文 参考訳(メタデータ) (2022-05-17T13:03:18Z) - Cross-Task Consistency Learning Framework for Multi-Task Learning [9.991706230252708]
2タスクMTL問題に対する新しい学習フレームワークを提案する。
サイクル一貫性損失とコントラスト学習に着想を得た2つの新たな損失項を定義する。
理論的には、どちらの損失もモデルをより効率的に学習する助けとなり、直進予測と整合する点において、クロスタスクの整合性損失がより良いことを証明している。
論文 参考訳(メタデータ) (2021-11-28T11:55:19Z) - Multi-Task Learning for Dense Prediction Tasks: A Survey [87.66280582034838]
マルチタスク学習(MTL)技術は、性能、計算、メモリフットプリントに関する有望な結果を示している。
我々は、コンピュータビジョンにおけるMLLのための最先端のディープラーニングアプローチについて、よく理解された視点を提供する。
論文 参考訳(メタデータ) (2020-04-28T09:15:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。