論文の概要: The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment
- arxiv url: http://arxiv.org/abs/2607.05552v1
- Date: Mon, 06 Jul 2026 18:37:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.302523
- Title: The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment
- Title(参考訳): 大規模言語モデルのイエス・ノーバイアスは、道徳的判断のシフトではなく、回答の順序と言葉を反映する
- Abstract要約: 増大する文献では、論理的に無関係な文言変化の下でそのような判断がシフトしていると報告されている。
イエス/ノーの質問では、「ノー」という言葉は一度に論理的な評定、語彙トークン、最後の印刷オプションである。
我々はこれらを分離するサイコメトリック・バッテリを導入する: 質問フォームのコーパスを横断する対称性。
- 参考スコア(独自算出の注目度): 3.7193230342956056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) increasingly issue judgments read as binary verdicts, and a growing literature reports such judgments shifting under logically irrelevant changes of wording - among them an amplified yes-no bias on moral dilemmas, absent in humans. A single framing cannot say what such a shift is: in a yes/no question the word "no" is at once logical verdict, lexical token, and last-printed option. We introduce a psychometric battery that separates these: crossed symmetrization - every logically irrelevant factor flipped in balanced pairs - across a corpus of question forms. A graded rating across logically equivalent forms recovers a coherent internal moral scale: frontier models' stance $θ$ is nearly format-invariant (cross-form incoherence 0.12-0.21 on a $\pm 1$ axis); small open-weight models fail in model-specific ways. Forcing the verdict through yes/no overlays a decomposable artifact: an order bias toward the last-printed option - opposite to classic human primacy - plus a lexical pull toward the word "no"; the artifact is substantial only in the Claude models (story-averaged -0.32 to -0.86), $\approx 0$ for GPT-5.5 and Gemini, and shrinks under extended reasoning. The word and the verdict share one token; swapping the words for arbitrary labels separates them, and the verdict-attached logical bias proves $\approx 0$ for every frontier model, while model-specific label and order attachments remain: the models are not drawn toward rejecting - the pull follows the printed surface, not the verdict it carries. A minimal model, $P = σ((θ\pm m)/s)$, summarizes any such artifact by a framing susceptibility m and a moral decisiveness s, measurably distinct from sampling temperature. The battery applies unchanged to any dilemma set and binary format: measuring what a model values requires crossing the frames of the question, not asking once.
- Abstract(参考訳): 大きな言語モデル(LLMs)は、二項の評決として読み上げられる判断をますます発行し、近年の文献では、言葉の論理的に無関係な変化の下で、そのような判断は人間にはない道徳的ジレンマに対する「イエス・ノー・バイアス」を増幅していると報告している。
イエス/ノーの質問では、「ノー」という言葉は一度に論理的な評定、語彙的トークン、最後の印刷されたオプションである。
横断対称性 - 論理的に無関係なすべての要素が、バランスの取れたペアで反転する - 質問フォームのコーパスを越えて、これらを分離する心理測定バッテリーを導入します。
フロンティアモデルの姿勢$θ$はほぼ形式不変($\pm 1$軸で0.12-0.21)であり、小さなオープンウェイトモデルはモデル固有の方法で失敗する。
yes/no による評決は、分解可能なアーティファクトをオーバーレイする: 古典的な人間の予備主義とは逆の、最後の印刷された選択肢への注文バイアスと "no" という単語への語彙的プル; アーティファクトは、クロードモデル(ストーリー平均 -0.32 から -0.86 )、GPT-5.5 と Gemini に対して $\approx 0$ で、拡張された推論の下で縮小する。
単語と評定は1つのトークンを共有し、任意のラベルに単語を置き換えると、それらが分離され、評定に付帯された論理バイアスはすべてのフロンティアモデルに対して$\approx 0$が証明される一方、モデル固有のラベルと順序のアタッチメントは残る。
最小限のモデルである$P = σ((θ\pm m)/s)$は、そのようなアーティファクトをフレーミング感受性 m と道徳的決定性 s で要約する。
バッテリーはどんなジレンマセットやバイナリフォーマットにも当てはまりません。
関連論文リスト
- Detectable Only Where It Is Confounded: What Verified Duplication Counts Say About Membership Evidence in Language Models [0.0]
言語モデルが予測する文章を異常に安価に見つけると、その文章が訓練データに含まれていたと結論付ける傾向があることが示される。
ほぼ全ての公開テストでは、どの文章がトレーニングデータ、メンバー、どれがそうでなかったかを推測する必要があった。
本稿では,OLMo-2とPythiaの2つのモデルファミリーが事前学習コーパスを公開し,各コーパスに現れる文の正確な回数を公開インデックスとして返却する。
答えは2つの側面から閉じてピンサーを形成する。
論文 参考訳(メタデータ) (2026-09-09T21:01:56Z) - Measuring AI Accountability Through Argumentation Analysis: Can Model Reasoning Withstand Scrutiny? [0.0]
現実的な曖昧さにもかかわらず機能するように設計された代替規格について検討する。
我々は、ウォルトンの議論スキームの理論とGovierの議論の緊急性に関する基準に基づく4相弁証法を用いる。
推論の異なるフレームに適応し、多重選択フレーミングを越えて拡張し、評定に先立つ推論とポストホックの正当化の両方を扱う。
論文 参考訳(メタデータ) (2026-09-04T12:40:39Z) - How Language Models Organize and Structure Moral Knowledge [1.0829694003408499]
オープンウェイト言語モデル上で6つの独立した線形プローブを訓練する。
方向は1つの道徳的検知器に崩壊することも、互いに孤立することもない。
このモデルは道徳的な緊張そのものを表しており、未解決の判断ではない。
論文 参考訳(メタデータ) (2026-08-27T17:30:30Z) - Reading Without a Reader: Large Language Models Collapse Reading and Writing into a Single Entangled Code [0.0]
テキストに最適化された1つの自己回帰パスからデコーダのみの大規模言語モデルが駆動されることを示す。
入力側の読み取りコードの $mathbfW_E$ と出力側の書き込みコードの $mathbfW_U$ を比較して、どのように絡み合ったか尋ねる。
最小対に対して、アレキサンドリアアナログは定理によって空である; 欲求生成は語彙全体のargmaxを意味するので、ペアのランクを勝ち取る。
論文 参考訳(メタデータ) (2026-07-02T16:21:41Z) - When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance [4.093009863847175]
キーワードベースのスコアリングでは,ロバストな負完全/真正の語彙共起パターンが見つかる。
キーワードレキシコンは普遍的な語彙的共起傾向を測定する。
論文 参考訳(メタデータ) (2026-06-24T17:36:39Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints [6.057587531186626]
目的指向エージェントが生成し、破壊し、交換する価値は、情報と同じカテゴリの法的構造量であることを示す。
価格がフレームに依存していない間、価値はフレーム相対的であり、そのリソースをプールし、その知覚を融合する艦隊が天井を継承する。
論文 参考訳(メタデータ) (2026-06-10T16:11:04Z) - Self-Normalized Martingales and Uniform Regret Bounds for Linear Regression [65.82017723631897]
自己正規化マルティンガレのスケール不変上界が可能であることを示す。
通常の正規化ペナルティを含まない自己正規化濃度不等式を導出する。
論文 参考訳(メタデータ) (2026-05-02T22:39:00Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Do Large Language Models Get Caught in Hofstadter-Mobius Loops? [0.0]
本稿では、現代のRLHF学習言語モデルが構造的に類似した矛盾の対象となっていることを論じる。
トレーニングプロセスは、ユーザの嗜好の遵守とユーザの意図に対する疑念を同時に報いる。
結果として生じる行動プロファイルは、クラークがHofstadter-Mobiusループと呼んだものと一致している。
論文 参考訳(メタデータ) (2026-03-10T20:43:37Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Do Biased Models Have Biased Thoughts? [0.48212500317840945]
本稿では,モデルが応答する前のステップが公正性に与える影響について考察する。
質問に答えるために、フェアネスメトリクスを使用して5ドルのポピュラーな大言語モデルで実験を行い、モデルの思考と出力における11ドルの異なるバイアスを定量化します。
論文 参考訳(メタデータ) (2025-08-08T19:41:20Z) - Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models [45.41676783204022]
大規模言語モデル(LLM)におけるバイアスの様々なプロキシ尺度について検討する。
MMLU (Multi-subject benchmark) を用いた人格評価モデルでは, スコアの無作為かつ大半がランダムな差が生じることがわかった。
LLMアシスタントメモリとパーソナライゼーションの最近の傾向により、これらの問題は異なる角度から開かれている。
論文 参考訳(メタデータ) (2025-06-12T08:47:40Z) - A Classification View on Meta Learning Bandits [67.41789029784755]
我々は,固定された盗賊の収集のために,解釈可能かつ高速な探索計画のメタラーニングを行うために,本来の分類図を用いている。
これは$O (lambda-2 C_lambda) log2 (MH)$で、$M$は$mathbbM$、$lambda$は盗賊上の分離パラメータ、$C_lambda (mathbbM)$は新しい分類係数である。
論文 参考訳(メタデータ) (2025-04-06T14:25:21Z) - How do Decisions Emerge across Layers in Neural Models? Interpretation
with Differentiable Masking [70.92463223410225]
DiffMaskは、差分性を維持しながら入力のサブセットをマスクアウトすることを学ぶ。
入力トークンを包含または無視する決定は、中間隠蔽層に基づく単純なモデルで行われる。
これにより、属性のヒートマップをプロットするだけでなく、ネットワーク層間で意思決定がどのように形成されるかを分析することができます。
論文 参考訳(メタデータ) (2020-04-30T17:36:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。