論文の概要: MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification
- arxiv url: http://arxiv.org/abs/2608.13463v1
- Date: Thu, 13 Aug 2026 16:45:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.609042
- Title: MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification
- Title(参考訳): ロバストなクロスデータセット画像分類のためのMLLM制御不均一アンサンブル
- Authors: Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck,
- Abstract要約: ARMDIL は LLM を用いたマルチドメイン画像分類のための適応ルータである。
私たちのアンサンブルでは、畳み込みニューラルネットワーク(ResNet)、自己言語表現学習者(SSL)、視覚制御モデル(VLM)が採用されています。
経験的評価は、異なる視覚領域にわたる各アーキテクチャの異なる機能と脆弱性を照らします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern image classification models excel when trained on single task-specific datasets but often struggle to generalize across domains and difficulty levels. We propose ARMDIL, an Adaptive Router for Multi-Domain Image classification with LLMs. ARMDIL is an ensemble that uses a multimodal large language model (MLLM) agent to dynamically route each image to the most suitable vision backbone. Our diverse ensemble employs convolutional neural networks (ResNets), self-supervised representation learners (SSL), and vision-language models (VLMs), each trained on a unified label space constructed from multiple image datasets with differing distributions and characteristics. Empirical evaluations illuminate the distinct capabilities and vulnerabilities of each architecture across disparate visual domains. Crucially, we show that ARMDIL effectively navigates these trade-offs, performing competitively with specialized training-based routers. Furthermore, it drastically improves adaptability by allowing new information to be integrated via simple prompt modifications, while enhancing interpretability through natural language reasoning traces. These advances in cross-dataset image classification pave the way for more reliable general-purpose vision systems such as AI assistants and autonomous robots.
- Abstract(参考訳): 現代の画像分類モデルは、単一のタスク固有のデータセットでトレーニングされた時に優れているが、ドメインと難易度をまたいだ一般化に苦慮することが多い。
LLMを用いたマルチドメイン画像分類のための適応ルータARMDILを提案する。
ARMDILはマルチモーダル大言語モデル(MLLM)エージェントを使用して、各画像を最も適切な視覚バックボーンに動的にルーティングするアンサンブルである。
我々の多様なアンサンブルは、畳み込みニューラルネットワーク(ResNet)、自己教師付き表現学習者(SSL)、ビジョン言語モデル(VLM)を用いており、それぞれ異なる分布と特徴を持つ複数の画像データセットから構築された統一ラベル空間で訓練されている。
経験的評価は、異なる視覚領域にわたる各アーキテクチャの異なる機能と脆弱性を照らします。
重要なことは、ARMDILがこれらのトレードオフを効果的にナビゲートし、特別なトレーニングベースのルータと競合することを示す。
さらに、自然言語の推論トレースによる解釈性を高めながら、簡単なプロンプト修正によって新しい情報を統合できるようにすることで、適応性を大幅に向上する。
これらのクロスデータセット画像分類の進歩は、AIアシスタントや自律ロボットのようなより信頼性の高い汎用視覚システムへの道を開く。
関連論文リスト
- More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe [52.210953881548996]
遠隔センシングベンチマークに挑戦することで,視覚言語モデルが競争力や最先端のパフォーマンスを達成可能であることを示す。
我々のモデルは、テキストで直接答えるか、セグメント化とグラウンド化のためにローカライズツールを呼び出すことができる単一の言語ポリシーを使用する。
提案手法は,高分解能,マルチテンポラル,マルチモーダル,マルチビュータスクを含む,幅広いベンチマークの競合性を実現する。
論文 参考訳(メタデータ) (2026-07-17T13:25:44Z) - Co-Training Vision Language Models for Remote Sensing Multi-task Learning [68.15604397741753]
視覚言語モデル(VLM)は、RS画像理解、グラウンド化、超高解像度(UHR)画像推論において有望な結果を得た。
本稿では,RSMTLのための簡易かつ柔軟なVLMベースラインであるRSCoVLMを提案する。
本稿では、RS画像に固有の多様な画像スケールに対処する、統一された動的解像度戦略を提案する。
論文 参考訳(メタデータ) (2025-11-26T10:55:07Z) - RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts [17.76606110070648]
複数の粒度にまたがる包括的視覚理解のための統一型エンドツーエンドRS VLMであるRSUniVLMを提案する。
RSUniVLMは、変更検出や変更キャプションのインスタンスを含む、マルチイメージ解析において効果的に機能する。
また、RSと一般ドメインの両方の既存のデータセットに基づいて、大規模なRS命令追従データセットを構築した。
論文 参考訳(メタデータ) (2024-12-07T15:11:21Z) - Multilingual Vision-Language Pre-training for the Remote Sensing Domain [4.118895088882213]
コントラスト言語-画像事前学習(CLIP)に基づく手法は、現在、リモートセンシングデータを含む視覚・言語タスクをサポートするために広く使われている。
本研究は,多言語CLIPモデルの微調整を探求する,リモートセンシング領域のための新しいビジョン・アンド・ランゲージモデルを提案する。
提案したモデルでは,Remote Sensing Multilingual CLIP (RS-M-CLIP) と名づけた。
論文 参考訳(メタデータ) (2024-10-30T18:13:11Z) - TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning [54.033346088090674]
TWIST と SCOUT は,事前学習したMLLM に視覚的接地能力を持たせるフレームワークである。
モデルを効果的に微調整するために,SCOUTと呼ばれる高品質な合成データセットを生成する。
このデータセットは、ステップバイステップのマルチモーダル推論プロセスを記述する、豊富な監視信号を提供する。
論文 参考訳(メタデータ) (2024-10-14T13:35:47Z) - MMEarth: Exploring Multi-Modal Pretext Tasks For Geospatial Representation Learning [9.540487697801531]
MMEarthは、グローバルスケールでの多様なマルチモーダル事前トレーニングデータセットである。
光衛星画像の汎用表現を学習するために,MP-MAE(Multi-Pretext Masked Autoencoder)アプローチを提案する。
論文 参考訳(メタデータ) (2024-05-04T23:16:48Z) - Jack of All Tasks, Master of Many: Designing General-purpose Coarse-to-Fine Vision-Language Model [83.85856356798531]
VistaLLMは、粗くきめ細かな視覚言語タスクに対処する視覚システムである。
2値分割マスクをシーケンスとして表現するために、勾配対応の適応サンプリング技術を採用している。
また、新しいタスクであるAttCoSegを導入し、複数の入力画像に対してモデルの推論とグラウンド化能力を高める。
論文 参考訳(メタデータ) (2023-12-19T18:53:01Z) - An Efficient General-Purpose Modular Vision Model via Multi-Task
Heterogeneous Training [79.78201886156513]
本稿では、複数の視覚タスクを実行でき、他の下流タスクに効率的に適応できるモデルを提案する。
提案手法は,単一タスク状態モデルに匹敵する結果を達成し,下流タスクの強力な一般化を実証する。
論文 参考訳(メタデータ) (2023-06-29T17:59:57Z) - ASIF: Coupled Data Turns Unimodal Models to Multimodal Without Training [29.240131406803794]
単一のドメインエンコーダとより少ない画像テキストペアを用いて、トレーニングを一切行わずに共通空間を作成することができることを示す。
私たちのモデルにはユニークな特性があり、特に注目すべきは、新しいバージョンをデプロイして、更新されたトレーニングサンプルを数秒で実行できることです。
論文 参考訳(メタデータ) (2022-10-04T16:56:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。