論文の概要: Language-Conditioned Visual Grounding with CLIP Multilingual
- arxiv url: http://arxiv.org/abs/2605.09060v1
- Date: Sat, 09 May 2026 17:06:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.048987
- Title: Language-Conditioned Visual Grounding with CLIP Multilingual
- Title(参考訳): CLIP多言語を用いた言語記述型ビジュアルグラウンドディング
- Abstract要約: 言語間の相違は、視覚エンコーダ、テキストブランチ、またはそれらの相互作用から生じる可能性がある。
この曖昧さを高密度多言語CLIPプローブを用いて解決し、視覚エンコーダを13言語で同一に保持する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual vision-language models exhibit systematic performance gaps across languages, but the mechanism remains ambiguous: cross-language divergence could arise from the visual encoder, the text branch, or their interaction. We resolve this ambiguity through a dense multilingual CLIP probe in which the visual encoder is held identical across thirteen typologically diverse languages and only the XLM-RoBERTa text branch varies. We evaluate two CLIP architectures spanning a 7x visual-encoder scale gap (XLM-R base + ViT-B/32, ~87M visual parameters; XLM-R large + ViT-H/14, ~632M) on 11 concepts and 210 images, and quantify cross-language agreement via cluster-mask IoU, top-percentile IoU, and Spearman rank correlation against an English reference (n=2,310 paired observations per language). Three findings emerge. First, low-resource languages (Arabic, Basque, Luxembourgish) incur a structural penalty at both backbone scales (Wilcoxon HR>LR p<10^-300; cluster-mask IoU gap +0.114 at base, +0.143 at large), isolating the deficit to the text branch. Second, scaling the encoder 7x widens the gap for structural failure cases (Basque Δ=-0.056, Luxembourgish Δ=-0.076) while improving Arabic (Δ=+0.033), separating corpus-coverage from tokeniser-fertility failures. Third, peak similarity is preserved across languages (mean ratio 0.94 at large scale) while cluster-mask IoU drops sharply, identifying spatial misalignment, not signal collapse, as the dominant failure mode. At 3.4-3.9 Wh per 1,000 queries, dense-CLIP grounding is competitive with high-throughput inference budgets, positioning it as a practical substrate for energy-aware multilingual deployment.
- Abstract(参考訳): 多言語視覚言語モデルは、言語間での体系的なパフォーマンスギャップを示すが、そのメカニズムはあいまいである: 言語間の分岐は、視覚エンコーダ、テキストブランチ、またはそれらの相互作用から生じる可能性がある。
この曖昧さを高密度多言語CLIPプローブを用いて解決し、13言語で視覚エンコーダを同一に保持し、XLM-RoBERTaテキストブランチのみを変化させる。
XLM-R base + ViT-B/32, ~87M visual parameters; XLM-R large + ViT-H/14, ~632M) を11のコンセプトと210のイメージに分散した2つのCLIPアーキテクチャを評価し、クラスタマスクIoU、トップパーセンタイルIoU、スピアマンランク相関(n=2,310ペア化された言語毎の観測)を用いてクロスランゲージアライアンスを定量化する。
3つの発見がある。
まず、低リソース言語(アラビア語、バスク語、ルクセンブルク語)は、両方のバックボーンスケール(Wilcoxon HR>LR p<10^-300; cluster-mask IoU gap +0.114, +0.143)で構造的ペナルティを生じさせ、その欠陥をテキストブランチに分離する。
第二に、エンコーダ7xのスケーリングは、構造的故障事例(バスクΔ=-0.056、ルクセンブルクΔ=-0.076)のギャップを広げ、アラビア(Δ=+0.033)を改善し、トークンス・フェティリティ故障からコーパス・カバーを分離する。
第3に、ピーク類似性は言語間で保持され(大規模では平均比0.94)、クラスタマスクIoUは急降下し、信号の崩壊ではなく空間的不一致を支配的障害モードとして識別する。
1000クエリあたり3.4-3.9Whの高密度CLIP基底は、高スループットの推論予算と競合し、エネルギーを意識した多言語展開のための実用的な基盤として位置づけられている。
関連論文リスト
- Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning [80.05116806217397]
大言語モデル(LLM)のアンラーニングは、汎用性を保ちながら、目標とする知識を抑えることを目的としている。
CLLPU(Cross-Lingual and Language-Bound Protocol for LLM Unlearning)は,この問題を2つの設定で定式化する多言語ベンチマークである。
目標とする知識がすべての言語で抑制されるべき共通目標の忘れ、言語条件の忘れ、抑圧は指定された言語に限定されるべきである。
論文 参考訳(メタデータ) (2026-09-05T08:26:15Z) - Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix [0.0]
我々は,Gumbel-softmaxベースの離散シンボルボトルネックの故障を防止するための3つの制約セットを特徴付ける。
3つのエンコーダアーキテクチャで79-100%のセマンティックバインディングを実現し,32種すべてにゼロシンボル崩壊を示す。
論文 参考訳(メタデータ) (2026-07-09T09:55:17Z) - Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation [0.0]
ニューラルネットワーク翻訳におけるクロスアテンションパターンは、多言語モデルが言語構造をどのように整合させるかを研究するために広く用いられている。
NLLB-200(600M)のクロスアテンション解析における系統的アーティファクトについて報告する。
我々はこれらの「注意の流し込み」と呼び、LSMからNMTの交差注意への発見を延長し、位置バイアスよりも語彙設計に根ざした因果メカニズムを同定する。
論文 参考訳(メタデータ) (2026-05-02T03:59:00Z) - MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes [0.0]
本稿では,CHiPSAL 2026共有タスクに対して,サブタスクAとサブタスクBの両方に対処するシステムを提案する。
視覚符号化のためのCLIPと多言語テキスト表現のためのBGE-M3を組み合わせたハイブリッド・モーダル・アテンション融合アーキテクチャを提案する。
テキストのみのベースラインであるSubtask Aの5.9%のF1マクロ改善を実現した。
論文 参考訳(メタデータ) (2026-04-13T07:37:14Z) - Bilingual Text-to-Motion Generation: A New Benchmark and Baselines [52.71312720094036]
LLMアノテーションと厳密な手動修正によって構築されたバイリンガルテキスト・モーション・ベンチマークであるBiHumanML3Dを紹介する。
また,CLA(Cross-Lingual Alignment)を用いたバイリンガルモーション拡散合成(BiMD)を提案する。
CLA を用いた BiMD は 0.045 対 0.169 対 R@3 対 80.8% の FID を達成し、単言語拡散モデルと BiHumanML3D の翻訳ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-03-26T08:48:27Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs [47.944645462877894]
Referring Expression (REC) は、自然言語の記述に基づいてオブジェクトを画像にローカライズするモデルを必要とする。
この研究は2つの主要な貢献を通じて多言語RECに対処する。
10言語にまたがる統合多言語データセットを構築し、機械翻訳と文脈に基づく翻訳拡張により、既存の12のRECベンチマークを体系的に拡張する。
得られたデータセットは、177,620の画像にまたがる800万の多言語参照表現と、336,882の注釈付きオブジェクトで構成されている。
論文 参考訳(メタデータ) (2025-11-14T15:54:34Z) - Milco: Learned Sparse Retrieval Across Languages via a Multilingual Connector [25.65114670027799]
Learned Sparse Retrieval (LSR) は、2エンコーダの効率と語彙マッチングの透明性を組み合わせている。
MILCOは、異なる言語からのクエリやドキュメントを共通の英語語彙空間にマッピングするLSRアーキテクチャである。
論文 参考訳(メタデータ) (2025-10-01T08:58:25Z) - On the Off-Target Problem of Zero-Shot Multilingual Neural Machine
Translation [104.85258654917297]
識別対象言語信号の符号化に失敗すると、オフターゲットとなり、語彙距離が近くなることが判明した。
多言語語彙構築のための言語認識語彙共有(LAVS)を提案する。
我々は11言語で多言語機械翻訳ベンチマーク実験を行った。
論文 参考訳(メタデータ) (2023-05-18T12:43:31Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。