論文の概要: Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
- arxiv url: http://arxiv.org/abs/2606.26891v1
- Date: Thu, 25 Jun 2026 11:24:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.256123
- Title: Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
- Title(参考訳): 最適輸送セマンティックフローによるブリッジングビジョンと言語概念
- Authors: Chenyang Zhang, Anqi Dong, Guangming Zhu, Nuoye Xiong, Siyuan Wang, Lin Mei, Liang Zhang,
- Abstract要約: 概念ボトルネックモデル(CBM)は、人間の解釈可能な概念を通して予測することで透明な推論を約束する。
既存の視覚言語CBMは、事前に整列されたエンコーダやグローバルコサインの類似性に依存することが多い。
最適輸送フロー概念ボトルネックモデル(OTF-CBM)を提案する。
- 参考スコア(独自算出の注目度): 16.961028982058732
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Concept Bottleneck Models (CBMs) promise transparent reasoning by predicting through human-interpretable concepts, yet their effectiveness fundamentally depends on how well visual and textual representations are aligned or matched. Existing vision-language CBMs often rely on pre-aligned encoders or global cosine similarity, which obscures fine-grained concept localization and fails to reflect true semantic geometry. In this work, we rethink concept alignment as a dynamic cross-modal transport process instead of static projection and propose the Optimal Transport Flow Concept Bottleneck Model (OTF-CBM). It first learns a data-driven semantic cost via Inverse Optimal Transport to measure cross-modal distances, and then performs unbalanced optimal-transport-based flow matching to model semantic transitions between visual patches and textual concepts. With velocity-based concept activation, OTF-CBM captures interpretable geometric relations without ODE integration. Experiments further show that OTF-CBM achieves superior classification accuracy and concept faithfulness, offering a new geometric and dynamical perspective for interpretable cross-modal reasoning.
- Abstract(参考訳): 概念ボトルネックモデル(CBM)は、人間の解釈可能な概念を通して予測することで透明な推論を約束するが、その効果は視覚的およびテキスト的表現の整合性や整合性に大きく依存する。
既存の視覚言語CBMは、しばしば事前に整列されたエンコーダや大域的コサイン類似性に依存しており、これはきめ細かい概念のローカライゼーションを曖昧にし、真の意味幾何学を反映しない。
本研究では,静的射影ではなく動的クロスモーダル輸送プロセスとして概念アライメントを再考し,OTF-CBM(Optimal Transport Flow Concept Bottleneck Model)を提案する。
Inverse Optimal Transportを通じてデータ駆動型セマンティックコストを学習し、クロスモーダル距離を測定し、次に不均衡な最適なトランスポートベースのフローマッチングを実行し、視覚パッチとテキストの概念間のセマンティックトランジションをモデル化する。
速度に基づく概念アクティベーションにより、OTF-CBMはODE統合なしで解釈可能な幾何学的関係をキャプチャする。
さらに実験により、OTF-CBMはより優れた分類精度と概念忠実性を達成し、解釈可能なクロスモーダル推論のための新しい幾何学的および動的視点を提供することが示された。
関連論文リスト
- Concept-wise Attention for Fine-grained Concept Bottleneck Models [8.484128495313607]
CoAt-CBM(Concept-wise Attention for Fine-fine Concept Bottleneck Models)は、画像の微粒化と高い解釈性を実現する新しいフレームワークである。
CoAt-CBMは学習可能な概念的視覚的クエリを用いて、微粒な概念的視覚的埋め込みを適応的に取得し、そこから概念スコアベクトルを生成する。
論文 参考訳(メタデータ) (2026-04-17T06:43:30Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - Rethinking Concept Bottleneck Models: From Pitfalls to Solutions [53.84388497227224]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の理解可能な概念の基底予測である。
CBM-Suiteはこれらの課題に対処するための方法論的なフレームワークである。
論文 参考訳(メタデータ) (2026-03-05T19:37:49Z) - Towards more holistic interpretability: A lightweight disentangled Concept Bottleneck Model [5.700536552863068]
概念ボトルネックモデル(CBM)は、人間の理解可能な概念を中間表現として予測することにより、解釈可能性を高める。
本稿では,視覚的特徴を意味論的に意味のある構成要素に自動的に分類する軽量なDECBMを提案する。
3つの多様なデータセットの実験により、LCDBMはより高い概念とクラス精度を達成し、解釈可能性と分類性能の両方において従来のCBMよりも優れていたことが示されている。
論文 参考訳(メタデータ) (2025-10-17T15:59:30Z) - Interpretable Reward Modeling with Active Concept Bottlenecks [54.00085739303773]
本稿では,解釈可能な嗜好学習を可能にする報酬モデリングフレームワークであるConcept Bottleneck Reward Models (CB-RM)を紹介する。
不透明報酬関数に依存する標準的なRLHF法とは異なり、CB-RMは報酬予測を人間の解釈可能な概念に分解する。
我々は,最も情報性の高い概念ラベルを動的に取得する能動的学習戦略を定式化する。
論文 参考訳(メタデータ) (2025-07-07T06:26:04Z) - Discovering Fine-Grained Visual-Concept Relations by Disentangled Optimal Transport Concept Bottleneck Models [16.617257464664572]
概念ボトルネックモデル(CBM)は、入力画像と出力予測の間の中間概念空間を探索することにより、意思決定プロセスを透過化しようとする。
既存のCBMは、画像全体と概念の間の粗い粒度の関係を学習するだけで、局所的な画像情報を考慮しない。
本稿では,局所的なイメージパッチと概念間の微粒な視覚概念関係を探索するDistangled Optimal Transport CBMフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-12T03:31:57Z) - Improving Intervention Efficacy via Concept Realignment in Concept Bottleneck Models [57.86303579812877]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の理解可能な概念に基づいて、解釈可能なモデル決定を可能にする画像分類である。
既存のアプローチは、強いパフォーマンスを達成するために、画像ごとに多数の人間の介入を必要とすることが多い。
本稿では,概念関係を利用した学習型概念認識介入モジュールについて紹介する。
論文 参考訳(メタデータ) (2024-05-02T17:59:01Z) - Incremental Residual Concept Bottleneck Models [29.388549499546556]
Concept Bottleneck Models (CBM) は、ディープニューラルネットワークによって抽出されたブラックボックスの視覚表現を、解釈可能な概念のセットにマッピングする。
本稿では,概念完全性の課題を解決するために,インクリメンタル・Residual Concept Bottleneck Model (Res-CBM)を提案する。
提案手法は,任意のCBMの性能向上を目的としたポストホック処理法として,ユーザ定義の概念バンクに適用できる。
論文 参考訳(メタデータ) (2024-04-13T12:02:19Z) - Modeling Temporal Concept Receptive Field Dynamically for Untrimmed
Video Analysis [105.06166692486674]
本稿では,概念に基づくイベント表現の時間的概念受容分野について考察する。
時間的動的畳み込み(TDC)を導入し、概念に基づくイベント分析をより柔軟にする。
異なる係数は、入力ビデオに応じて適切な時間的概念受容フィールドサイズを生成することができる。
論文 参考訳(メタデータ) (2021-11-23T04:59:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。