論文の概要: Do LLM Debates Repeat Arguments Differently Across Languages?
- arxiv url: http://arxiv.org/abs/2607.23442v2
- Date: Wed, 29 Jul 2026 02:20:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.703029
- Title: Do LLM Debates Repeat Arguments Differently Across Languages?
- Title(参考訳): LLMは言語間で異なる議論を繰り返すか?
- Authors: Huiqian Lai,
- Abstract要約: 中国語は英語に対して一貫して肯定的なギャップを持つ唯一の言語である。
多様性に気付くと、言語間でのテキスト優先の類似性が低下するが、中国語と英語のギャップは大幅に狭まるわけではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM debate is usually evaluated by final answers, yet transcripts reveal whether later turns develop new arguments or return to earlier claims in new wording. We study this process with \textit{prior-argument similarity}, which compares extracted argument units with earlier units in the same debate. In controlled eight-turn debates over 71 motions, six languages, and four model agents, Chinese is the only tested language with a consistently positive gap relative to English across three multilingual embedding models. The gap persists across agents, turn positions, regression adjustment, metric variants, extraction-length controls, a second-extractor subset, and cross-encoder tail rescoring. Manual calibration shows weak item-level alignment but a high-similarity tail enriched for substantive repetition. A diversity-aware prompt lowers \textit{prior-argument similarity} across languages, yet does not significantly narrow the Chinese--English gap. Multilingual debate evaluation should therefore measure argumentative development over time and report both average and gap terms.
- Abstract(参考訳): LLMの議論は通常最終回答によって評価されるが、後に新たな議論が展開されるか、あるいは新たな主張で以前の主張に戻るかが記述されている。
このプロセスは,抽出された議論単位と,同じ議論において先行した議論単位との比較を行う,textit{prior-argument similarity} を用いて研究される。
71の動作、6つの言語、4つのモデルエージェントに関する制御された8ターンの議論において、中国語は3つの多言語埋め込みモデルの間で英語に対して一貫した正の差を持つ唯一のテスト言語である。
ギャップはエージェント、ターン位置、回帰調整、メートル法変種、抽出長制御、第2のエクストラクタサブセット、およびクロスエンコーダのテールリスコリングにまたがって持続する。
手動キャリブレーションはアイテムレベルのアライメントが弱いが、実体的反復のために強化された高相似テールを示す。
多様性を意識したプロンプトは、言語間でのtextit{prior-argument similarity} を低くするが、中国語と英語のギャップを著しく狭めるものではない。
したがって、多言語による議論評価は、時間とともに議論的な発展を測り、平均項とギャップ項の両方を報告すべきである。
関連論文リスト
- Language as a Latent Variable for Reasoning Optimization [45.35129925776798]
LLMは英語中心のバイアスを減らすので、驚くべき傾向が現れます。
モデルの内部推論経路を構造的に修飾する潜在変数として機能する言語を仮定する。
言語変化を暗黙的な探索信号として扱うRLフレームワークであるpolyGRPOを提案する。
論文 参考訳(メタデータ) (2026-04-23T12:19:14Z) - When Meanings Meet: Investigating the Emergence and Quality of Shared Concept Spaces during Multilingual Language Model Training [57.230355403478995]
本研究では,EuroLLMの事前学習における言語に依存しない概念空間の開発について検討する。
共有概念空間は早期に出現し、洗練され続けていますが、それらとの整合性は言語に依存しています。
従来の作業とは対照的に、細かな手作業分析により、翻訳品質の顕著な向上は、行動の変化を反映していることが判明した。
論文 参考訳(メタデータ) (2026-01-30T11:23:01Z) - Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation [49.2073409243885]
大規模言語モデル(LLM)は、英語の対物生成に優れ、多言語習熟度を示す。
対象言語における直接生成された反事実と6言語間の英訳によって導出されるものの両方について自動評価を行う。
言語間で生成した偽物に一貫して現れる4つの主要なエラーを識別し分類する。
論文 参考訳(メタデータ) (2026-01-01T08:53:49Z) - Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models [44.94287386776289]
textbfCross-lingual Collapseは、多言語言語モデルが支配的な事前学習言語に回帰する体系的なドリフトである。
実験の結果, (i)GRPOは事前学習言語の不均衡を急速に増幅し, わずか数百回の更新で低リソース言語が侵食され, (ii) 言語整合性報酬はこのドリフトを緩和するが, ほぼ5~10ppの精度の低下を犠牲にしていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T08:08:48Z) - Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models [56.61984030508691]
言語混乱に関する最初の機械論的解釈可能性研究について述べる。
混乱点(CP)がこの現象の中心であることを示す。
比較分析によって同定された少数の臨界ニューロンを多言語で調整したニューロンで編集すると、混乱が著しく軽減されることがわかった。
論文 参考訳(メタデータ) (2025-05-22T11:29:17Z) - Multilingual Test-Time Scaling via Initial Thought Transfer [19.863010475923414]
テストタイムのスケーリングは、推論性能を高めるための推論タイム戦略として広く採用されている。
本研究は,DeepSeek-R1-Distill-LLama-8BとDeepSeek-R1-Distill-Qwen-7Bを評価し,多言語環境でのテスト時間スケーリングに関する最初の体系的研究である。
論文 参考訳(メタデータ) (2025-05-21T13:27:38Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。