論文の概要: The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models
- arxiv url: http://arxiv.org/abs/2606.11082v1
- Date: Tue, 09 Jun 2026 16:42:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.620186
- Title: The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models
- Title(参考訳): シボレス効果:大規模言語モデルにおける言語間分布スキューの検討
- Authors: Hakan Mehmetcik,
- Abstract要約: 本研究では,フロンティア大言語モデル(LLM)における言語間分布スキュー(シボレス効果)の持続的逆境条件について検討した。
我々は、東地中海紛争の構造的ダイナミクスを反映した多年制の地政学的な戦争ゲーム、ケルレアン海危機(Cerrulean Sea Crisis)を開発している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This study investigates cross-lingual distributional skew (the Shibboleth Effect) in frontier large language models (LLMs) subjected to sustained adversarial conditions. We develop a multi-agent geopolitical wargame, the Cerulean Sea Crisis, a synthetic maritime territorial dispute designed to mirror the structural dynamics of Eastern Mediterranean conflicts. Six frontier models (GPT-4o, Llama-4, Mistral-Large, Gemini-3.1-Pro, Qwen3.6-Plus, and DeepSeek-R1) participate in a between-groups experiment (N = 10 games per arm, K = 5 rounds per game) in which the sole manipulation is the language of play (English versus Turkish), producing 586 validated statements. A zero-shot classifier assesses behavioral dispositions along two continuous dimensions: Concession Rate and Coercive Rhetoric. The results are heterogeneous. Llama-4 shows a substantial, Holm-corrected increase in coercive rhetoric under Turkish (delta = +0.800, p = .002), whereas Gemini-3.1-Pro displays an equally large decrease (delta = -0.750, p = .005). DeepSeek-R1 exhibits a similar negative shift (delta = -0.860, p = .006) and provides chain-of-thought evidence consistent with a buffering mechanism. GPT-4o shows no detectable effect (delta = +0.130, p = .614). These findings indicate that cross-lingual behavioral skew is contingent on model architecture and training regime rather than a universal property of Western-origin LLMs. We identify two distinct buffering mechanisms, chain-of-thought institutional anchoring and multilingual RLHF alignment, and discuss their implications for integrating LLMs safely into diplomatic and crisis-management settings.
- Abstract(参考訳): 本研究では,フロンティア大言語モデル(LLM)における言語間分布スキュー(シボレス効果)の持続的逆境条件について検討した。
我々は,東地中海紛争の構造的ダイナミクスを反映した総合海洋領土紛争である,多国間地政学的な戦争ゲームであるCerrulean Sea Crisisを開発する。
6つのフロンティアモデル(GPT-4o、Llama-4、Mistral-Large、Gemini-3.1-Pro、Qwen3.6-Plus、DeepSeek-R1)は、単独操作がプレイ言語(英語対トルコ語)であり、586の検証された文を生成する。
ゼロショット分類器は、2つの連続した次元に沿って振舞いを評価する。
結果は不均一である。
Llama-4は、トルコ(デルタ = +0.800, p = .002)の下で、ホルム補正された保圧レトリックの実質的な増加を示すが、ジェミニ-3.1-Proは同様に減少する(デルタ = -0.750, p = .005)。
DeepSeek-R1 も同様な負のシフト(デルタ = -0.860, p = 006)を示し、バッファリング機構と整合性を示す。
GPT-4oは検出可能な効果を示さない(デルタ = +0.130, p = .614)。
これらの結果から, 言語間行動スクリューは西オリジンLLMの普遍的特性ではなく, モデルアーキテクチャとトレーニング体制に即したものであることが示唆された。
そこで我々は,LLMを外交・危機管理環境に安全に組み込む上での意義を考察し,二つの異なるバッファリング機構,チェーン・オブ・インスティテュート・アンカーと多言語RLHFアライメントを同定した。
関連論文リスト
- Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs [0.0]
米国英語(en-US)とメキシコスペイン語(es-MX)のジェイルブレイク脆弱性を比較検討した最初の体系的言語横断型マルチモーダル型レッドチーム研究について述べる。
私たちの中心的な発見は、言語が脆弱性を均一にスケールしないことです。
これは、言語的および視覚的なアライメント障害が、異なるメカニズムを通して機能し、切り換え言語がその分離を公開するのに十分であることを示している。
論文 参考訳(メタデータ) (2026-05-22T02:12:45Z) - Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning [56.48520300004217]
本稿では、文脈干渉を内部の訓練信号に変換するセルフプレイのRLフレームワークであるSeyrnesを紹介する。
単一のモデルでは、可視的かつ気を散らすようなコンテキストの構築と、それ自身で盲点を露呈するように訓練されている。
これらの競合する目標を互いに衝突させることで、Sailnes氏は、表面的なパターンマッチングを超えてモデルを補完する。
論文 参考訳(メタデータ) (2026-05-12T06:58:35Z) - Self-Anchoring Calibration Drift in Large Language Models: How Multi-Turn Conversations Reshape Model Confidence [0.0]
自己調整条件ドリフト (SACD) は、大規模言語モデルにおいて、マルチターン会話をまたいだ事前出力を反復的に構築する際に、表現された自信の体系的な変化を示すという仮説的な傾向である。
我々は, 1ターンベースライン(A), マルチターンセルフアンチョリング(B), 独立反復制御(C)の3条件を用いて, 事実領域, 技術領域, オープンエンド領域にまたがる150の質問に対して, Claude Sonnet 4.6, Gemini 3.1 Pro, GPT-5.2を比較した。
その結果、事前登録された仮説から部分的に分岐する複雑なモデル不均一パターンが明らかとなった。
論文 参考訳(メタデータ) (2026-03-01T19:27:52Z) - Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases [0.0]
マルチモーダル・大規模言語モデル (MLLM) は現実世界のシステムにますます導入されているが、その安全性は相変わらず探索されていない。
そこで本研究では,26名のプロレッドチームによる726名の相手プロンプトの固定ベンチマークを用いて,MLLMの無害度を2段階評価する。
論文 参考訳(メタデータ) (2026-02-04T16:42:02Z) - Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models [50.99097734404912]
RLフレンドリなモデルでは, クラス内コンパクト性やクラス間分離が, 正誤応答に対する確率割当に現れることを示す。
6つの数学ベンチマークによる実験では、すべてのモデルファミリで一貫した改善が見られ、AIME24では5.9ポイントまで向上した。
論文 参考訳(メタデータ) (2026-01-11T13:34:44Z) - The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models [0.0]
層流仮説: 良性入力はLLMの高次元潜在空間において滑らかで漸進的な遷移を誘導する。
逆方向のプロンプトはカオス的な高分散軌道をトリガーする - セマンティック乱流(Semantic Turbulence)と呼ばれる。
テストによると、セマンティック乱流は、軽量でリアルタイムなジェイルブレイク検知器としてだけでなく、非侵襲的な診断ツールとしても機能している。
論文 参考訳(メタデータ) (2025-12-14T18:10:29Z) - The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models [1.4323566945483497]
本稿では,大規模言語モデルにおける「カメレオン行動」に関する最初の体系的研究について述べる。
我々は最先端のシステムに根本的な欠陥を露呈する。
情報源の再使用率と信頼性の相関は統計的に有意である。
論文 参考訳(メタデータ) (2025-10-19T04:51:14Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - "Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented Generation [90.09260023184932]
Retrieval-Augmented Generation (RAG) は、外部の知識源を活用して、事実の幻覚を減らすことで、Large Language Model (LLM) を出力する。
NoMIRACLは18言語にまたがるRAGにおけるLDM堅牢性を評価するための人為的アノテーション付きデータセットである。
本研究は,<i>Halucination rate</i>,<i>Halucination rate</i>,<i>Halucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sr。
論文 参考訳(メタデータ) (2023-12-18T17:18:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。