論文の概要: Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs
- arxiv url: http://arxiv.org/abs/2608.14896v1
- Date: Fri, 14 Aug 2026 21:04:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.1222
- Title: Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs
- Title(参考訳): 小言語モデルにおける解釈可能な言語間アライメント:日英両言語LLMにおける文化的・実践的推論の提案
- Authors: Florian Braun,
- Abstract要約: 表面流速から4つの現象を分離する最小ペアのベンチマークであるJ-PragEval-v0を紹介する。
線形プローブと教師による対数確率評価を組み合わせて、TinySwallow-1.5B内のどのコントラストがライブであるかを問う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models work well on English and behave in poorly understood ways on languages typologically far from it. Japanese is a clean example, where evaluation still leans on translation quality and JGLUE-style benchmarks, which roll lexical, syntactic and pragmatic competence into a single score. The phenomena on which general-purpose models fail Japanese users are pragmatic: honorifics, in-group and out-group reference, context-sensitive politeness, zero anaphora. I introduce J-PragEval-v0, a minimal-pair benchmark isolating four such phenomena from surface fluency, and combine it with linear probes and teacher-forced log-probability evaluation to ask where inside TinySwallow-1.5B (28 layers, hidden size 1536) the corresponding contrasts live. The four features split three ways. Honorific register sits cleanly in the residual stream: 0.96 balanced accuracy at layer 15, and the model flips its preferred continuation with the scenario on 93 percent of items. Implicit subject and in-group reference are not linearly decodable at the final prompt token (0.48 and 0.38), yet flip rates are 0.77 and 0.79, so the contrast is worked out during generation rather than stored at the prompt. Indirect refusal is the negative case: 0.95 probe accuracy collapsing to a 0.43 flip rate under length-normalised teacher forcing, because the current minimal pairs conflate politeness with continuation length. I also specify Pragmatic Representation Steering, a parameter-free inference-time method that edits residual-stream activations along the class-mean-difference directions probing identifies. Feasibility is argued indirectly rather than demonstrated: the contrastive activation addition baseline, the same geometry the method would inject, recovers probe accuracy within one to two points of logistic regression wherever a linear signal exists. Scaling to Llama-3.1-Swallow-8B is the next step.
- Abstract(参考訳): 大規模な言語モデルは英語でうまく機能し、その語源から遠く離れた言語でよく理解されていない方法で振る舞う。
日本語は、まだ翻訳品質とJGLUEスタイルのベンチマークに頼っているクリーンな例であり、語彙的、構文的、実践的な能力を1つのスコアにロールする。
汎用モデルが日本人ユーザを失敗させる現象は, 敬意, グループ内, グループ外参照, 文脈に敏感な丁寧さ, アナフォラがゼロである。
J-PragEval-v0は、表面流速から4つの現象を分離する最小ペアのベンチマークで、線形プローブと教師による対数確率評価を組み合わせて、TinySwallow-1.5Bの内部(28層、隠蔽サイズ1536)のコントラストがどこにあるのかを問う。
4つの特徴は3つに分かれた。
残差ストリームには、0.96のバランスの取れた精度が15層にあり、そのモデルが93%のアイテムのシナリオで好まれる継続を反転させる。
暗黙の被写体と非群参照は最終プロンプトトークン(0.48と0.38)では線形にデオードできないが、フリップレートは0.77と0.79なので、プロンプトに格納されるのではなく、世代間でコントラストが処理される。
間接的拒絶は負の場合である: 0.95 プローブ精度は、教師の強制力で 0.43 のフリップレートに崩壊する。
Pragmatic Representation Steeringはパラメータフリーな推論時メソッドで、クラス平均差方向を探索する残ストリームのアクティベーションを編集する。
対照的なアクティベーション加算ベースライン(この手法が注入するのと同じ幾何学)は、線形信号が存在する場合の対数回帰の1点から2点以内のプローブ精度を回復する。
Llama-3.1-Swallow-8Bへのスケーリングが次のステップである。
関連論文リスト
- TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance [8.657685524975246]
そこで本研究では,250個の固定知識プローブによって抽出された隠れ状態の語彙予測値のトップ$kをベースとした無訓練指紋を提案する。
文書化された関係を持つ9家系(0.6B--32B)のオープンウェイトモデル32種について評価を行った。
論文 参考訳(メタデータ) (2026-08-08T13:56:39Z) - OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment [0.9821874476902969]
逆ペアによる方向バイアスを検出するOptimismBenchを導入する。
ポストトレーニングではバイアスの兆候が示され、異なる家族の反対のシフトが示される。
モデル毎の指向性監査のために,10言語で3,870項目をリリースしています。
論文 参考訳(メタデータ) (2026-07-29T14:38:55Z) - Multilingual Embedding Probes Fail to Generalize Across Learner Corpora [0.17188280334580197]
我々は,9つのコーパスと7つの言語にわたる学習者テキストからCEFR習熟度を予測するために,隠れ状態のアクティベーションに関するプローブを訓練する。
分布評価では、プローブは強い性能を達成し、表面ベースラインを大幅に上回る。
クロスコーパス評価では、全てのプローブタイプとモデルサイズで性能が崩壊する。
これらの結果から,現在の多言語埋め込みは言語一般の習熟度を直接符号化するものではないことが示唆された。
論文 参考訳(メタデータ) (2026-04-08T13:47:54Z) - Bilingual Text-to-Motion Generation: A New Benchmark and Baselines [52.71312720094036]
LLMアノテーションと厳密な手動修正によって構築されたバイリンガルテキスト・モーション・ベンチマークであるBiHumanML3Dを紹介する。
また,CLA(Cross-Lingual Alignment)を用いたバイリンガルモーション拡散合成(BiMD)を提案する。
CLA を用いた BiMD は 0.045 対 0.169 対 R@3 対 80.8% の FID を達成し、単言語拡散モデルと BiHumanML3D の翻訳ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-03-26T08:48:27Z) - Cross-Lingual Stability of LLM Judges Under Controlled Generation: Evidence from Finno-Ugric Languages [0.22009842278462158]
大規模言語モデル(LLM)の言語間評価は、典型的には、真のモデルの性能差と測定不安定性の2つの要因を混同する。
対象言語が異なる場合に生成条件を一定に保って評価信頼性を評価する。
本研究は, 形態学的に豊かな言語における談話レベルの評価には, ゼロショット・ジャッジ・トランスファーが信頼できないことを示唆している。
論文 参考訳(メタデータ) (2026-02-02T16:27:32Z) - Narrowing the Gap between Zero- and Few-shot Machine Translation by
Matching Styles [53.92189950211852]
大規模言語モデルは、文脈内学習を用いたゼロショットと少数ショットの例を用いて、機械翻訳に一般化する能力を示した。
本稿では,このギャップに寄与する要因について検討し,対象コーパスの書字スタイルを一致させることで,このギャップをほとんど(約70%)閉鎖できることを示す。
論文 参考訳(メタデータ) (2023-11-04T03:18:45Z) - Unlikelihood Tuning on Negative Samples Amazingly Improves Zero-Shot
Translation [79.96416609433724]
Zero-shot Translation (ZST)は、トレーニングデータにおいて、目に見えない言語ペア間の翻訳を目的としている。
推論中にゼロショット言語マッピングをガイドする一般的な方法は、ソースとターゲット言語IDを意図的に挿入することである。
近年の研究では、言語IDが時折ZSTタスクのナビゲートに失敗し、ターゲット外問題に悩まされることが示されている。
論文 参考訳(メタデータ) (2023-09-28T17:02:36Z) - On the Usefulness of Embeddings, Clusters and Strings for Text Generator
Evaluation [86.19634542434711]
Mauveは、弦上の2つの確率分布間の情報理論のばらつきを測定する。
我々は,Mauveが誤った理由で正しいことを示し,新たに提案された分岐はハイパフォーマンスには必要ないことを示した。
テキストの構文的およびコヒーレンスレベルの特徴を符号化することで、表面的な特徴を無視しながら、文字列分布に対するクラスタベースの代替品は、単に最先端の言語ジェネレータを評価するのに良いかもしれない、と結論付けています。
論文 参考訳(メタデータ) (2022-05-31T17:58:49Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z) - SimCSE: Simple Contrastive Learning of Sentence Embeddings [10.33373737281907]
本稿では,埋め込み学習フレームワークであるSimCSEについて述べる。
まず、教師なしのアプローチを記述し、入力文を取り、それ自身を対照目的に予測する。
次に,nliデータセットからの注釈付きペアを「補足」ペアを正として,「矛盾」ペアをハード負として対比学習に組み込む。
論文 参考訳(メタデータ) (2021-04-18T11:27:08Z) - AmericasNLI: Evaluating Zero-shot Natural Language Understanding of
Pretrained Multilingual Models in Truly Low-resource Languages [75.08199398141744]
我々は、XNLI(Conneau et al)の拡張である AmericasNLI を提示する。
は、アメリカ大陸の10の原住民の言語である。
XLM-Rで実験を行い、複数のゼロショットおよび翻訳ベースのアプローチをテストします。
XLM-Rのゼロショット性能は全10言語で低調であり、平均性能は38.62%である。
論文 参考訳(メタデータ) (2021-04-18T05:32:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。