論文の概要: Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing
- arxiv url: http://arxiv.org/abs/2607.20115v1
- Date: Wed, 22 Jul 2026 13:19:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.088158
- Title: Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing
- Title(参考訳): 言語的実現選択が因果トレース付きLLMスタンスに及ぼす影響の理解
- Abstract要約: 我々は、意味に敏感なケーススタディとして政治的スタンス判断を使用し、イギリスの政治的ステートメントデータセットを拡張します。
4つのオープンウェイトモデルの実験は、スタンス不安定が意味保存と意味反転の両方に影響を及ぼすことを示している。
その結果, 中間から後期までのデコーダ層, 特に最終プロンプト位置のブロック出力は, 最強の復元信号を与えることがわかった。
- 参考スコア(独自算出の注目度): 5.457386921498268
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are known to be sensitive to prompt and input formulations. However, existing studies have focused on lexical realization and largely ignored constructional choice. This paper studies whether linguistic construction can systematically shift LLM decisions and where these shifts can be causally localized inside the model. We use political stance judgment as a meaning-sensitive case study and extend an English political statements dataset, resulting in six controlled linguistic rewrite types that preserve or invert the meaning of a statement. Experiments on four open-weight models show that stance instability affect both meaning-preserving and meaning-inversing rewrites. Because output shifts reveal that rewrites affect stance, but not where in the model, we apply activation patching, where activations from the original statement are substituted into the forward pass for the rewritten statement and measure which components recover the original stance distribution. The results show that mid-to-late decoder layers, especially block outputs at the final prompt position, provide the strongest restoration signal.
- Abstract(参考訳): 大型言語モデル(LLM)は、プロンプトや入力の定式化に敏感であることが知られている。
しかし、既存の研究は語彙的実現に重点を置いており、建設上の選択は無視されている。
本稿では,言語構築がLLM決定を体系的にシフト可能か,モデル内でこれらの変化を因果的に局所化できるかを検討する。
我々は、政治的スタンス判断を意味に敏感なケーススタディとして使用し、英語の政治的ステートメントデータセットを拡張し、その結果、文の意味を保存または反転する6つの制御された言語的書き直し型を導出する。
4つのオープンウェイトモデルの実験は、スタンス不安定が意味保存と意味反転の両方に影響を及ぼすことを示している。
出力シフトは、書き直しがスタンスに影響を与えるが、モデルにはないことを明らかにするため、アクティベーションパッチを適用し、元のステートメントからアクティベーションがフォワードパスに置換され、書き直されたステートメントがどのコンポーネントで元のスタンス分布を復元するかを測定します。
その結果, 中間から後期までのデコーダ層, 特に最終プロンプト位置のブロック出力は, 最強の復元信号を与えることがわかった。
関連論文リスト
- Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning [23.983002175011205]
LLM(Large Language Model)ベースのナビゲーションシステムは、通常、明示的な空間表現(例えば、トポロジグラフ、セマンティックマップ)を入力として構成する。
本研究では,航法計画におけるLLMの言語的帰納バイアスを評価するために,異なる文脈からの言語構造をアンハングリングする2つのインターベンショナル・フレームワークを提案する。
本研究は,LLMに基づくナビゲーションにおける効果的なテキストベースの空間表現は,トポロジ的整合性を維持し,表現圧縮をモデルキャパシティに調整し,意味的正当性を確保するべきであることを示す。
論文 参考訳(メタデータ) (2026-05-29T15:09:25Z) - Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs [100.02824137397464]
難易度が増大する入力に遭遇した場合,大規模言語モデルが内部表現をどのように適応するかを検討する。
タスクの難易度が増大するにつれて、LLMの最後の隠れ状態は実質的にスペーサーとなる。
この空間性-微分的関係は、様々なモデルや領域で観測可能である。
論文 参考訳(メタデータ) (2026-03-03T18:48:15Z) - LLM Reasoning Predicts When Models Are Right: Evidence from Coding Classroom Discourse [0.18268488712787334]
大規模言語モデル(LLM)は、大規模に教育対話を自動的にラベル付けし分析するために、ますます多くデプロイされている。
本研究では,LLMが生成した推論がモデル自身の予測の正確性を予測するのに有効かどうかを検討する。
授業の対話から30,300人の教師の発話を分析し,複数の最先端LPMでラベル付けし,指導的移動構造とそれに伴う推論を行った。
論文 参考訳(メタデータ) (2026-02-10T14:38:13Z) - The Imperfective Paradox in Large Language Models [19.058068907991277]
本研究では,過去の進歩的側面が,達成のためのものではなく,活動のイベント実現を伴っている不完全なパラドックスについて検討する。
多様なセマンティッククラスでこの区別を探索するために設計された診断データセットであるImperfectiveNLIを紹介する。
広汎なテレロジカルバイアス: 目標志向のイベントの完了を体系的に幻覚させるモデル。
論文 参考訳(メタデータ) (2026-01-14T10:57:16Z) - Hey, That's My Data! Label-Only Dataset Inference in Large Language Models [63.35066172530291]
CatShiftはラベルのみのデータセット推論フレームワークである。
LLMは、新しいデータに晒されたとき、学習した知識を上書きする傾向にある。
論文 参考訳(メタデータ) (2025-06-06T13:02:59Z) - Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling [56.26834106704781]
大規模言語モデル(LLM)のユビキタス展開における主要な関心事の一つは、生成されたコンテンツの事実的誤りである。
我々は, LLMの内部コンパスの存在を裏付ける証拠を提供し, 生成時の事実的リコールの正しさを規定する。
モデルサイズにわたる実験のスケールとトレーニングのダイナミクスは、トレーニング中に自己認識が急速に出現し、中間層でピークとなることを浮き彫りにしている。
論文 参考訳(メタデータ) (2025-05-27T16:24:02Z) - ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models [75.05436691700572]
明示的な因果推論において,LLM(Large Language Models)を評価するための新しいデータセットであるExpliCaを紹介する。
ExpliCa上で7つの商用およびオープンソース LLM をテストしました。
驚くべきことに、モデルは因果関係と時間的関係を関連付ける傾向にあり、そのパフォーマンスはイベントの言語的順序にも強く影響される。
論文 参考訳(メタデータ) (2025-02-21T14:23:14Z) - Can adversarial attacks by large language models be attributed? [1.2289361708127877]
本研究では,Large Language Models (LLM) のクラスは,出力のみから識別できないことを示す。
近年では, 与えられた出力に対して, 可算モデル起源数の爆発を定量化している。
論文 参考訳(メタデータ) (2024-11-12T18:28:57Z) - CUE: An Uncertainty Interpretation Framework for Text Classifiers Built
on Pre-Trained Language Models [28.750894873827068]
本稿では,PLMモデルに固有の不確かさを解釈することを目的とした,CUEと呼ばれる新しいフレームワークを提案する。
摂動と原文表現の予測不確実性の違いを比較することにより,不確実性の原因となる潜伏次元を同定することができる。
論文 参考訳(メタデータ) (2023-06-06T11:37:46Z) - Mitigating Bias in Text Classification via Prompt-Based Text Transformation [0.2864713389096699]
テキストの書き直しをChatGPTに促すことが、意味を保ちながら人口統計信号を減少させるかどうかを検討する。
その結果, テキスト分類におけるバイアス軽減のための実践的, 一般化可能な手法として, プロンプトベースの書き直しが提案されている。
論文 参考訳(メタデータ) (2023-05-09T13:10:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。