論文の概要: Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs
- arxiv url: http://arxiv.org/abs/2607.19243v1
- Date: Tue, 21 Jul 2026 16:15:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.486774
- Title: Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs
- Title(参考訳): LLMにおける言語間整合性の推論時間ステアリング
- Authors: Alexander Manev,
- Abstract要約: 大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
- 参考スコア(独自算出の注目度): 51.56484100374058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although Large Language Models (LLMs) demonstrate remarkable multilingual fluency, their internal knowledge representations remain disproportionately biased toward high-resource languages. This leads to cross-lingual factual inconsistency, where they shift their empirical answer distributions based solely on the prompt language. We investigate whether these biases can be mitigated at inference time, forcing an English-prompted model to answer as if it were queried in target languages (German, Spanish, Bulgarian), and evaluate four intervention strategies: zero-shot contextual steering (persona prompting), internal representation manipulation via Contrastive Activation Addition (CAA), and lightweight weight modification via Direct Preference Optimization (DPO) trained on benchmark-derived factual data as well as conceptual generalization data. To assess alignment, we curate a multilingual factual dataset alongside a novel generalization benchmark comprising culturally rooted queries to determine whether factual interventions transfer to broader target-centric preferences. Experiments on Gemma 3 12B Instruct reveal persona prompting to be the strongest overall intervention, balancing efficacy, safety, and out-of-domain generalization. While CAA yields sharp inconsistency benchmark shifts, it is configuration-sensitive and risks knowledge degradation. DPO-based adapters offer permanent, yet narrower and less transferable gains. These findings suggest that cross-lingual inconsistency is at least partly a selection problem, and that simple contextual interventions may outperform more invasive methods for robust, transferable alignment.
- Abstract(参考訳): 大規模言語モデル (LLM) は多言語流布を顕著に示すが、その内部知識表現はハイリソース言語に偏っている。
これにより、言語間の事実矛盾が生じ、即興言語のみに基づいて経験的な回答分布をシフトする。
我々は,これらのバイアスを推論時に緩和し,対象言語(ドイツ語,スペイン語,ブルガリア語)で問合せされたように英文モデルに応答させ,ゼロショット・コンテクスト・ステアリング(ペルソナ・プロセッシング),コントラスト・アクティベーション・アダクション(CAA)による内部表現操作,およびベンチマーク由来の事実データおよび概念一般化データに基づいてトレーニングされた軽量な重み修正の4つの介入戦略を評価する。
アライメントを評価するために、文化的に根付いたクエリからなる新しい一般化ベンチマークとともに、多言語事実データセットをキュレートし、実際の介入がより広範なターゲット中心の嗜好に移行するかどうかを判定する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
CAAは急激な不整合ベンチマークシフトをもたらすが、構成に敏感であり、知識劣化のリスクがある。
DPOベースのアダプタは、永続的で、より狭く、転送しにくいゲインを提供する。
これらの結果は、言語間不整合は少なくとも部分的には選択の問題であり、単純な文脈介入は、堅牢で移動可能なアライメントのためのより侵襲的な手法よりも優れていることを示唆している。
関連論文リスト
- STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning [80.78140312980484]
我々はSTRIDEと呼ばれる言語駆動の段階的軌道リダイレクトを提案する。
我々は、結果に基づく報酬のみを使用して生成器と生成検証器を共同で訓練し、外部アノテーションを除去する。
様々な推論ベンチマークの実験では、STRIDEが最先端のベースラインを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-05-13T11:04:31Z) - Multilingual Refusal Alignment for Safer Large Language Models [53.64286756804503]
単言語アライメントが言語横断的に伝達されるか,トレーニング中に言語一貫性が保たれるか,一般的な知識能力とのトレードオフが生じるかを検討する。
RefusEUは、12のヨーロッパ言語をカバーする新しい拒絶アライメントデータセットであり、現在の最先端モデルを評価するための専用のテストセットを含む。
制御された直接選好最適化(DPO)実験は、2つの重要な洞察を提供する: 英語でのみモデルを整列することは、同じハーネスカテゴリであっても、言語間安全を保証するには不十分である。
論文 参考訳(メタデータ) (2026-04-24T09:29:14Z) - Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation [58.01855677487771]
本研究では,多言語大言語モデル (MLLM) が,プロンプトの言語変化に伴う不整合性を示すことを示す。
コンセンサス駆動型アライメントフレームワークであるC-3POを提案する。
C-3POは、非整合モデルよりも0.10ポイントの$_S$を絶対的に増加させ、強力なプロンプトと表現のステアリングベースラインを上回る。
論文 参考訳(メタデータ) (2026-04-02T14:04:06Z) - Translation or Recitation? Calibrating Evaluation Scores for Machine Translation of Extremely Low-Resource Languages [39.985923582735936]
FREDの難易度はF(F)、Retrieval Proxy(R)、Pre-training Exposure(E)、Corpus Diversity(D)を含む。
これらの測定結果から、結果のばらつきの大部分は、モデル能力よりも、列車とテストの重複と事前訓練による露光によって説明されていることが分かる。
論文 参考訳(メタデータ) (2026-03-26T09:20:17Z) - Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck [37.780081880731096]
大規模言語モデル(LLM)は多言語評価の標準となっているが、厳密な体系的翻訳バイアスを示す。
このバイアスは (i) 英語との潜在多様体アライメントと (ii) 言語間予測可能性との急激な相関に起因している。
このバイアスを軽減するために、我々は、最小限に十分な判断クリティカルな表現を学習する堅牢な微調整フレームワークであるDIBJudgeを提案する。
論文 参考訳(メタデータ) (2026-03-11T02:55:29Z) - BiasLab: A Multilingual, Dual-Framing Framework for Robust Measurement of Output-Level Bias in Large Language Models [3.643198597030366]
本稿では,出力レベル(外部)バイアスの定量化を目的とした,オープンソースのモデルに依存しない評価フレームワークであるBiasLabを紹介する。
この枠組みは、人口統計学、文化学、政治学、地政学などの様々なバイアス軸の評価をサポートする。
論文 参考訳(メタデータ) (2026-01-11T11:07:46Z) - Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation [49.2073409243885]
大規模言語モデル(LLM)は、英語の対物生成に優れ、多言語習熟度を示す。
対象言語における直接生成された反事実と6言語間の英訳によって導出されるものの両方について自動評価を行う。
言語間で生成した偽物に一貫して現れる4つの主要なエラーを識別し分類する。
論文 参考訳(メタデータ) (2026-01-01T08:53:49Z) - LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs [73.27182315028021]
LANPOは、フィードバックの役割をきれいに分離するフレームワークである。
我々の研究は、歴史体験をLLM RLループに統合する堅牢な方法を提供し、より効果的でデータ効率のよい学習エージェントを作成します。
論文 参考訳(メタデータ) (2025-10-18T15:51:19Z) - CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment [23.1730341293796]
音声に基づく認知障害評価のための大規模言語モデルの言語間およびサイト間一般化性を評価するための最初のベンチマークであるCagBenchを提案する。
以上の結果から,従来のディープラーニングモデルはドメイン間で変換されると大幅に劣化することがわかった。
本研究は,臨床的に有用で言語学的に堅牢な音声に基づく認知評価ツールを構築するための重要なステップを提供する。
論文 参考訳(メタデータ) (2025-08-05T12:06:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。