論文の概要: How Does Thinking Mode Change LLM Moral Judgments? A Controlled Instant-vs-Thinking Comparison Across Five Frontier Models
- arxiv url: http://arxiv.org/abs/2605.04488v1
- Date: Wed, 06 May 2026 04:33:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.643561
- Title: How Does Thinking Mode Change LLM Moral Judgments? A Controlled Instant-vs-Thinking Comparison Across Five Frontier Models
- Title(参考訳): 思考モードはLLMモラル判断をどう変えるか? : 5つのフロンティアモデル間でのインスタント・vsシンキングの比較
- Authors: Sai Sourabh Madur,
- Abstract要約: 提案手法は,同一モデルチェックポイント内における道徳的判断を変化させるかどうかを評価する。
意見の不一致は、即時合意がほぼ確実な21のモデル分散シナリオに集中していることが分かりました。
また、Reasoningは5つのモデルのうち3つのモデルの集団的判断の不整合を減らし、どのモデルでもそれを増加させない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We evaluate whether enabling provider-exposed reasoning mode changes moral judgments within the same model checkpoint. Across 100 moral-judgment scenarios and five frontier reasoning-trained LLMs (Claude Sonnet 4.6, GPT 5.5, Gemini 3 Flash, DeepSeek V3.1, and Qwen3.5 397B), aggregate binary-verdict agreement remains high and statistically indistinguishable between instant and thinking modes (Krippendorff's alpha = 0.78 vs. 0.79). However, disagreement is concentrated in 21 model-disputed scenarios, where instant-mode agreement is near chance (alpha = 0.08). On these scenarios, reasoning directionally narrows cross-model disagreement, increasing mean pairwise agreement from 5.4 to 6.7 out of 10. Reasoning also reduces demographic-judgment inconsistency in three of five models and does not increase it for any model. Across all five model families, reasoning changes self-labeled ethical frameworks more often than binary verdicts.
- Abstract(参考訳): 提案手法は,同一モデルチェックポイント内の道徳的判断を,プロバイダが提示する推論モードが変更するか否かを評価する。
100の道徳的判断シナリオと5つのフロンティア推論訓練 LLM (Claude Sonnet 4.6, GPT 5.5, Gemini 3 Flash, DeepSeek V3.1, Qwen3.5 397B) の合計二分判定契約は、インスタントモードと思考モードの間では高く統計的に区別できない(クリッペンドルフのα = 0.78 vs. 0.79)。
しかし、意見の不一致は21のモデル分散シナリオに集中しており、即時一致が近い(アルファ=0.08)。
これらのシナリオでは、推論はモデル間の不一致を方向的に狭め、平均対の合意は10の5.4から6.7に増加する。
また、Reasoningは5つのモデルのうち3つのモデルの集団的判断の不整合を減らし、どのモデルでもそれを増加させない。
5つのモデルファミリー全体において、推論は二項判定よりもむしろ、自己ラベル付き倫理的枠組みを変化させる。
関連論文リスト
- A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts [0.0]
本稿では,5モデルコンセンサスプロトコルを通じて運用される武器対知識分類軸を提案する。
これは4つの公開ベンチマークから引き出された3,133のプロンプトに適用される。
3,133のプロンプトは3-of-5のしきい値に達したため、コンセンサスパイプラインは曖昧さを除いたプロンプトを生成する。
論文 参考訳(メタデータ) (2026-05-04T21:42:10Z) - When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation [0.0]
一般的な仮定は、より強い推論はシミュレーションの忠実性を改善するべきであるというものである。
この仮定は、目的が戦略的問題を解決することではなく、有界に有理な振る舞いをサンプリングすることであるときに失敗する可能性がある。
従来のシミュレーション作業から適応した3つのマルチエージェントネゴシエーション環境において,この解法とサンプラーのミスマッチについて検討した。
論文 参考訳(メタデータ) (2026-04-12T13:36:10Z) - Understanding Moral Reasoning Trajectories in Large Language Models: Toward Probing-Based Explainability [8.026492468995187]
我々は,大規模言語モデルが推論段階を越えて倫理的枠組みをどのように構成するかを研究する。
道徳的推論には、体系的なマルチフレームワークの議論が伴う。
本稿では,LLMコヒーレンス評価と強く相関するモーラル表現一貫性(MRC)指標を提案する。
論文 参考訳(メタデータ) (2026-03-16T23:51:30Z) - The Fragility Of Moral Judgment In Large Language Models [0.0]
大規模言語モデル(LLM)の安定性と操作性をテストするための摂動フレームワークを提案する。
コンテンツ摂動の3つのファミリーを生成する: 表面編集(語彙/構造ノイズ)、視点シフト(声と姿勢の中立化)、説得手がかりである。
表面の摂動は低いフリップ率(7.5%)をもたらし、主に自己整合性ノイズフロア内にある。
不安定性は道徳的に曖昧なケースに集中する。
論文 参考訳(メタデータ) (2026-03-05T20:01:43Z) - MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment [48.39756797294967]
本稿では、視覚言語モデルと人間の道徳的嗜好を整合させるデータセットMM-SCALEを提案する。
それぞれのイメージ・シナリオペアには、道徳的受容性スコアと、人間による根拠付き推論ラベルが注釈付けされている。
我々のフレームワークは、よりリッチなアライメント信号とマルチモーダルな道徳的推論のキャリブレーションを提供する。
論文 参考訳(メタデータ) (2026-02-03T15:48:00Z) - Self-Improving VLM Judges Without Human Annotations [74.29324865147838]
自己合成データのみを用いて,人間の好みのアノテーションを使わずにVLM判断モデルを自己学習する枠組みを提案する。
提案手法は,Llama-3.2-11Bマルチモーダル判定を0.38から0.51に改善する。
これらの注釈のない結果の全体的な強みは、VLM能力の急速な向上とともに進化する将来の自己判断の可能性を示している。
論文 参考訳(メタデータ) (2025-12-02T20:52:19Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents [130.70999337445468]
言語モデル(LLM)エージェントと比較して、視覚言語モデル(VLM)エージェントを訓練する際の重要な課題は、テキスト状態から複雑な視覚観察に移行することである。
VLMエージェントは、明示的な視覚状態推論によって内部世界モデルを構築することができるか?
我々は、強化学習(RL)を通して、エージェントの推論プロセスを建築的に実施し、報奨する。
エージェントの状態推定と遷移モデリングへの推論が成功に不可欠であることが分かりました。
論文 参考訳(メタデータ) (2025-10-19T16:05:07Z) - Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models [14.425718737962102]
本稿では,複数の LLM の道徳的判断を集合的に定式化した道徳的判断に合成する枠組みを提案する。
我々の集約メカニズムは、連続的な道徳的受容可能性スコア(バイナリラベルの他に)を集合的確率に融合させる。
大規模社会道徳ジレンマデータセットの実験は、我々のアプローチが堅牢なコンセンサスを構築し、個々のモデル忠実性を改善することを示している。
論文 参考訳(メタデータ) (2025-06-17T15:22:21Z) - Reasoning Models Are More Easily Gaslighted Than You Think [85.84943447589511]
我々はOpenAIのo4-mini、Claude-3.7-Sonnet、Gemini-2.5-Flashの3つの最先端推論モデルを評価する。
ガス灯消火プロンプトによる精度低下が認められた。
GaslightingBench-Rは、推論モデルの認識可能性を評価するために設計された新しい診断ベンチマークである。
論文 参考訳(メタデータ) (2025-06-11T12:52:25Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。