論文の概要: A Systematic Comparison of Multilingual Interpretability Methods Reveals Anisotropy-Driven Failures
- arxiv url: http://arxiv.org/abs/2609.04819v1
- Date: Fri, 04 Sep 2026 07:16:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.957952
- Title: A Systematic Comparison of Multilingual Interpretability Methods Reveals Anisotropy-Driven Failures
- Title(参考訳): 異方性駆動型故障を解く多言語解釈可能性手法の体系的比較
- Abstract要約: CKA,ANC,トークン単位のGMM支配率,ILOの4つの共有指標を5つのファミリーの21のベースモデルで比較した。
これらのモデルにおいて、これらの指標は言語間共有の定量化において異なることが判明した。
ILOと言語間移動の相関のみがモデルサイズ、家族、タスクごとの変化の制御を継続する。
- 参考スコア(独自算出の注目度): 4.919385975609114
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual language models develop shared cross-lingual representations, and various interpretability methods claim to quantify this sharing. These methods have been developed largely in isolation, and when they disagree, it is unclear whether the disagreement reflects a property of the model or an artifact of the measurement. We compare four sharing metrics (CKA, ANC, GMM dominance per token, and ILO) across 21 base models from five families (125M-14B parameters) and correlate each with cross-lingual transfer on five downstream tasks. We find that the metrics differ in their quantification of cross-lingual sharing in these models and suggest that the disagreement traces to anisotropy, the tendency of representations to cluster in a narrow cone of the embedding space. Only ILO's correlation with cross-lingual transfer (Spearman's $ρ= 0.90$) survives controls for model size, family, and per-task variation. We therefore recommend ILO as the primary sharing metric, to be reported alongside anisotropy diagnostics.
- Abstract(参考訳): 多言語言語モデルでは、共通言語間表現が開発され、様々な解釈可能性法がこの共有の定量化を主張する。
これらの手法は, 主に孤立して開発されており, 相違点がモデルの性質や測定の成果物に反映しているかどうかは不明である。
我々は、5つのファミリー(125M-14Bパラメータ)から21のベースモデル(CKA, ANC, GMM/トークン/トークン/トークン/トークン/トークン/トークン/トークン/トークン/ILO)を比較し、それぞれを5つの下流タスクの言語間移動と相関する。
これらのモデルでは, 異方性(異方性), 埋め込み空間の狭い円錐内において, 表現の傾向など, 異方性(異方性)に起因し, 異方性(異方性)に起因していることを示す。
ILOと言語間移動(Spearmanの$ρ= 0.90$)との相関のみがモデルサイズ、家族、タスクごとのバリエーションの制御を継続する。
そこで本研究では,異方性診断とともに報告すべき主要な共有指標としてILOを推奨する。
関連論文リスト
- MIMO: Multilingual Information Retrieval via Monolingual Objectives [22.085658351797765]
既存の埋め込みモデルは、主に多言語検索に最適化されている。
Miloは、ハイパフォーマンスな教師モデルの安定した英語意味空間をアンカーとして使用する2段階のフレームワークである。
Miloは既存の言語間のトレーニングベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-29T11:34:15Z) - Semantic Convergence: Investigating Shared Representations Across Scaled LLMs [4.172347145536457]
大きな言語モデルは、サイズの違いにもかかわらず、世界全体を広く類似した解釈可能な特徴に彫り込み、クロスモデル解釈の基盤として普遍性を補強する。
予備実験では、単一トークンからマルチトークン部分空間への解析を拡張し、意味論的に類似した部分空間が言語モデルと同様に相互作用することを示す。
論文 参考訳(メタデータ) (2025-07-21T07:09:32Z) - Multi-Scale Manifold Alignment for Interpreting Large Language Models: A Unified Information-Geometric Framework [4.935224714809964]
我々は,LLM表現を局所的,中間的,大域的多様体に分解する情報幾何学的フレームワークであるマルチスケールマニフォールドアライメント(MSMA)を提案する。
我々は一貫した階層パターンを観察し、MSMAが複数の推定値の下でアライメントの指標を改善することを発見した。
異なるスケールでの制御された介入は、語彙の多様性、文構造、談話のコヒーレンスに区別され、アーキテクチャに依存した効果をもたらす。
論文 参考訳(メタデータ) (2025-05-24T10:25:58Z) - Scaling Laws for Multilingual Neural Machine Translation [45.620062316968976]
モデルサイズの増加がモデル性能に与える影響について検討し,スケーリング行動におけるトレーニング混合物組成の役割について検討した。
学習混合物中の個々の言語ペアの重み付けの変化は,スケーリング法則の乗法的要因にのみ影響することがわかった。
我々は、どんな言語重み付けでも訓練された多言語モデルの性能を予測するために、我々の観測を活用している。
論文 参考訳(メタデータ) (2023-02-19T18:43:24Z) - A Multi-level Supervised Contrastive Learning Framework for Low-Resource
Natural Language Inference [54.678516076366506]
自然言語推論(NLI)は、自然言語理解において、ますます重要な課題である。
本稿では,低リソースな自然言語推論のためのマルチSCLという,マルチレベルの教師付きコントラスト学習フレームワークを提案する。
論文 参考訳(メタデータ) (2022-05-31T05:54:18Z) - A Variational Hierarchical Model for Neural Cross-Lingual Summarization [85.44969140204026]
言語間の要約(英: cross-lingual summarization)とは、ある言語の文書を別の言語の要約に変換することである。
CLSに関する既存の研究は主にパイプライン手法の利用やエンドツーエンドモデルの共同トレーニングに重点を置いている。
条件付き変分自動エンコーダに基づくCLSタスクの階層モデルを提案する。
論文 参考訳(メタデータ) (2022-03-08T02:46:11Z) - Uncertainty-Aware Balancing for Multilingual and Multi-Domain Neural
Machine Translation Training [58.72619374790418]
MultiUATはモデルの不確実性に基づいてトレーニングデータの使用量を動的に調整する。
クロスドメイン転送を解析し、静的および類似性に基づく手法の欠如を示す。
論文 参考訳(メタデータ) (2021-09-06T08:30:33Z) - Interpretable Multi-dataset Evaluation for Named Entity Recognition [110.64368106131062]
本稿では,名前付きエンティティ認識(NER)タスクに対する一般的な評価手法を提案する。
提案手法は,モデルとデータセットの違いと,それらの間の相互作用を解釈することを可能にする。
分析ツールを利用可能にすることで、将来の研究者が同様の分析を実行し、この分野の進歩を促進することができる。
論文 参考訳(メタデータ) (2020-11-13T10:53:27Z) - On the Limitations of Cross-lingual Encoders as Exposed by
Reference-Free Machine Translation Evaluation [55.02832094101173]
クロスランガルエンコーダの評価は通常、教師付き下流タスクにおけるゼロショットのクロスランガル転送または教師なしのクロスランガル類似性によって行われる。
本稿では、ソーステキストと(低品質な)システム翻訳を直接比較するMT(Reference-free Machine Translation)の評価について述べる。
事前学習したM-BERTとLASERで得られた最先端の言語間セマンティック表現に基づいて,様々なメトリクスを体系的に検討する。
参照なしMT評価において,セマンティックエンコーダとしての性能は低く,その2つの重要な限界を同定する。
論文 参考訳(メタデータ) (2020-05-03T22:10:23Z) - The Secret is in the Spectra: Predicting Cross-lingual Task Performance
with Spectral Similarity Measures [83.53361353172261]
本稿では,モノリンガル埋め込み空間の類似性とタスク性能の相関性に着目した大規模研究を行う。
2つの埋め込み空間間のいくつかの同型測度を導入し、それぞれのスペクトルの関連統計に基づく。
このようなスペクトル同型尺度から得られた言語類似度スコアは、異なる言語間タスクで観測された性能と強く関連していることを実証的に示す。
論文 参考訳(メタデータ) (2020-01-30T00:09:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。