論文の概要: Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes
- arxiv url: http://arxiv.org/abs/2607.18228v1
- Date: Mon, 20 Jul 2026 17:58:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.731586
- Title: Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes
- Title(参考訳): 圧力下における論理的判断:学習したソフトプレフィックスによる音韻安定性の診断
- Authors: Brian K Chen,
- Abstract要約: 学習した文脈的圧力が正しい判断をオーバーライドし、モデルの論理的安定性の限界を明らかにする方法を特徴付ける。
Qwen3.6-35B-A3B MoE、Qwen3-8B、Gemmaにまたがって、接頭辞は多くの正しい答えをリダイレクトし、目に見えない形やインターフェースの変更に対して有効である。
- 参考スコア(独自算出の注目度): 1.1844977816228046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: To test how correct logical judgments respond to learned context, we prepend a soft prefix to an exactly labeled syllogistic reasoning benchmark while keeping the model fixed. Soft prefixes are opaque continuous vectors, so we characterize them through the behavior they induce across controlled variations in logical form and interface. By studying which prefixes succeed and how their effects generalize, we characterize how learned contextual pressure can override correct judgments and expose limits in a model's logical stability. Across Qwen3.6-35B-A3B MoE, Qwen3-8B, and Gemma 4 31B, learned prefixes redirect many correct answers and remain effective across unseen forms and interface changes. In repeated tests with Qwen3.6 MoE and Gemma, they outperform paired random controls in all 16 model--direction--split comparisons by 37 to 99 percentage points. Qwen3.6 MoE flip rates remain between 72% and 90% across wording and prompt changes, while Gemma validity prefixes retain 54% to 56% flip compared with less than 1% for matched random prefixes. Diagnostic tests show that the dominant effect is a broad preference for one answer meaning rather than fixed-symbol forcing or a logical operation that transfers reliably between tasks. The form of this bias differs across models. In both Qwen models, simple score models often predict which judgments will flip but not how far their margins will move, whereas Gemma's overall response is more closely approximated by the same models. These results show that the dominant behavioral effect of successful soft prefixes is a broad answer preference, while the remaining response reveals substantial model-specific differences in logical stability.
- Abstract(参考訳): 学習文脈に正しい論理的判断がどう反応するかを検証するために,モデルの修正を保ちながら,正確にラベル付けされたシロメトリクス推論ベンチマークにソフトプレフィックスをプリペイドする。
ソフトプレフィックスは不透明な連続ベクトルであるので、論理形式やインターフェースの制御されたバリエーションによって誘導される振る舞いを通じて特徴付ける。
どの接頭辞が成功するか、その効果がどのように一般化するかを研究することで、学習された文脈的圧力が正しい判断を上書きし、モデルの論理的安定性の限界を露呈する方法を特徴づける。
Qwen3.6-35B-A3B MoE, Qwen3-8B, Gemma 4 31B にまたがって、接頭辞は多くの正しい答えをリダイレクトし、見知らぬ形やインターフェースの変化に対して有効である。
Qwen3.6 MoE と Gemma の繰り返しテストでは、16のモデル-方向-分割比較でペアのランダム制御を37から99ポイント上回った。
Qwen3.6 MoEのフリップ率は、72%から90%の間であり、Gemmaの有効接頭辞は54%から56%であり、一致したランダムな接頭辞では1%未満である。
診断検査の結果、支配的な効果は、固定記号強制やタスク間で確実に伝達する論理的操作よりも、一つの答えの意味を広く選好していることが判明した。
このバイアスの形式はモデルによって異なる。
どちらのQwenモデルでも、単純なスコアモデルはどの判断が反転するかを予測するが、マージンがどれくらい動くかは予測しない。
これらの結果から, ソフト接頭辞が有意な行動効果を示すのに対し, 残りの反応は論理安定性のモデル特異的な相違が顕著であることがわかった。
関連論文リスト
- Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - Three Regimes of Context-Parametric Conflict: A Predictive Framework and Empirical Validation [0.0]
大規模言語モデルが学習知識と矛盾する文書の相違にどのように対処するかを考察する。
本稿では,Regime 1 (単一ソース更新),Regime 2 (競合統合),Regime 3 (タスクに適した選択)という3つの登録フレームワークを提案する。
我々はClaude Sonnet 4.6、GPT-5.5、Gemini 2.5 Flash、Llama 4 Maverick、DeepSeek V3の3つの実験段階で9,970のAPIコールを使用してフレームワークを検証する。
論文 参考訳(メタデータ) (2026-05-12T06:00:48Z) - Trivial Vocabulary Bans Improve LLM Reasoning More Than Deep Linguistic Constraints [0.0]
前回の研究では、E-Primeは言語モデルにおいて選択的に推論を変更したと報告された。
提案したメカニズムをテストするために,アクティブなコントロールを備えたレプリケーションを設計しました。
これらの知見は不確認による発見の事例研究として提示する。
論文 参考訳(メタデータ) (2026-04-03T03:48:27Z) - How Does Prefix Matter in Reasoning Model Tuning? [57.69882799751655]
推論(数学)、コーディング、安全性、事実性の3つのコアモデル機能にまたがる3つのR1シリーズモデルを微調整します。
その結果,プレフィックス条件付きSFTでは安全性と推論性能が向上し,Safe@1の精度は最大で6%向上した。
論文 参考訳(メタデータ) (2026-01-04T18:04:23Z) - Universal Adversarial Suffixes Using Calibrated Gumbel-Softmax Relaxation [9.099589602551573]
我々は,任意の入力に付加されたユニバーサル逆接接尾辞について検討し,タスクやモデル間での精度を広く低減する。
提案手法は,Gumbel-Softmax 緩和を用いた微分可能な「ソフト」形式で接尾辞を学習し,推論のために識別する。
あるモデルで訓練された1つの接尾辞は、他のモデルに効果的に転送され、常に精度と精度の調整の両方を低下させる。
論文 参考訳(メタデータ) (2025-12-09T00:03:39Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models [0.0]
大きな言語モデル(LLM)が、ひとつの単語の誤読が安全性を損なう可能性があるような設定でコードを書くようになりました。
有用な堅牢性と有害な不感度の開始点を調査するために、50のLeetCode問題をコンパイルし、3つの最小限の急激な摂動を発生させる。
3つの「推論チューニング」バージョンを含む6つのフロンティアモデルにより、各変更プロンプトが解決される。
論文 参考訳(メタデータ) (2025-07-15T03:22:07Z) - Answer, Assemble, Ace: Understanding How LMs Answer Multiple Choice Questions [103.20281438405111]
MCQA(Multiple-choice Question answering)は、高性能トランスフォーマー言語モデルのキーコンピテンスである。
我々は,正解を予測するための関連情報をエンコードするキー隠れ状態のローカライズに語彙予測とアクティベーションパッチ手法を用いる。
後続の層は語彙空間における予測応答記号の確率を増大させ、この確率の増加は、特異な役割を持つ注目ヘッドのスパースセットと関連していることを示す。
論文 参考訳(メタデータ) (2024-07-21T00:10:23Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z) - How do Decisions Emerge across Layers in Neural Models? Interpretation
with Differentiable Masking [70.92463223410225]
DiffMaskは、差分性を維持しながら入力のサブセットをマスクアウトすることを学ぶ。
入力トークンを包含または無視する決定は、中間隠蔽層に基づく単純なモデルで行われる。
これにより、属性のヒートマップをプロットするだけでなく、ネットワーク層間で意思決定がどのように形成されるかを分析することができます。
論文 参考訳(メタデータ) (2020-04-30T17:36:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。