論文の概要: In LLM Reasoning, there is Irrationality on top of Value Misalignment
- arxiv url: http://arxiv.org/abs/2606.20624v1
- Date: Tue, 26 May 2026 14:26:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 23:07:11.509069
- Title: In LLM Reasoning, there is Irrationality on top of Value Misalignment
- Title(参考訳): LLM推論では、価値の相違の上に不合理性がある
- Abstract要約: 我々はこのギャップを合理的な価値リスクとして数学的に定式化する。
Llama-3.1、Qwen-2.5、T'ulu-3 family(7B-72B)、GPT-5.2、GPT-5.5、DeepSeek-V4をカバーした実験が行われた。
その結果,(1)有理値リスクは広く,(2)有理値アライメントは減少するが排除できない,(3)推論時推論戦略に非常に敏感である,(4)より長い推論はリターンを減らして合理性を改善する,といった結果が得られた。
- 参考スコア(独自算出の注目度): 21.19048956153322
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Significant progress has been made in aligning LLMs with target value functions. We argue that, even when an LLM has been well aligned in (post-)training, it may still fail to maximise the aligned value in reasoning. We mathematically formalise this gap as rational value risk: the utility discrepancy between a model's deployed reasoning strategy and its rational counterpart, which is defined to be the responses that maximise expected utility in the steepest direction. The estimation error of rational value risk is further decomposed into three components from finite candidates, finite prompts, and imperfect verifiers. Extensive experiments are conducted, covering models Llama-3.1, Qwen-2.5, T{\"}ulu-3 families (7B-72B), GPT-5.2, GPT-5.5, and DeepSeek-V4, and benchmarks UltraFeedback, AlpacaEval, GSM8K, MATH, HumanEval, and MathArena. The results validate that (1) rational value risk is widespread; (2) value alignment can reduce, but cannot eliminate, it; (3) the risk is highly sensitive to inference-time reasoning strategy; and (4) longer reasoning improves rationality with diminishing returns. The code is at https://github.com/EVIEHub/LLM-Rationality.
- Abstract(参考訳): LLMと目標値関数の整合において重要な進展が見られた。
LLMが(ポスト-)トレーニングで適切に整列されたとしても、推論において整列値の最大化に失敗する可能性がある、と我々は主張する。
我々は、このギャップを有理値リスクとして数学的に定式化する:モデルの展開された推論戦略と有理値との実用上の相違は、最も急な方向に期待された効用を最大化する応答であると定義される。
有理値リスクの推定誤差は、有限候補、有限プロンプト、不完全検証器からさらに3つの成分に分解される。
Llama-3.1, Qwen-2.5, T{\"}ulu-3 family (7B-72B), GPT-5.2, GPT-5.5, DeepSeek-V4をカバーし、UltraFeedback, AlpacaEval, GSM8K, MATH, HumanEval, MathArenaをベンチマークした。
その結果,(1)有理値リスクは広く,(2)有理値アライメントは減少するが排除できない,(3)推論時推論戦略に非常に敏感である,(4)より長い推論はリターンを減少させることで合理性を改善する,といった結果が得られた。
コードはhttps://github.com/EVIEHub/LLM-Rationalityにある。
関連論文リスト
- Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition [55.572260012037084]
本稿では, LC-ERD (Logic-Consistent Endogenous Reward Decomposition) を紹介する。
モデルの潜在論理エキスパートズ(Latent Logic Expertise)からのコンセンサスを集約することで、変分論理ポテンシャルを導出する。
LC-ERDは、論理の一貫性と正確性の間のトレードオフを明らかにする、堅牢な自己進化パスを提供する。
論文 参考訳(メタデータ) (2026-05-19T07:27:50Z) - When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation [0.0]
一般的な仮定は、より強い推論はシミュレーションの忠実性を改善するべきであるというものである。
この仮定は、目的が戦略的問題を解決することではなく、有界に有理な振る舞いをサンプリングすることであるときに失敗する可能性がある。
従来のシミュレーション作業から適応した3つのマルチエージェントネゴシエーション環境において,この解法とサンプラーのミスマッチについて検討した。
論文 参考訳(メタデータ) (2026-04-12T13:36:10Z) - Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation [0.0]
大規模言語モデル (LLM) は因果推論や反ファクト推論にますます利用されているが、現実の政策評価における信頼性はいまだ未定である。
経済・社会科学から引き出された40の実証的政策評価事例のベンチマークを構築した。
混合効果のロジスティック回帰を用いて結果を分析する。
論文 参考訳(メタデータ) (2026-04-12T08:00:38Z) - LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches [61.30693283718321]
研究レベルの数学的推論のための動的多重選択ベンチマークであるLiveMathematicianBenchを提案する。
新たに発表された定理で評価を基礎づけることで、記憶されたパターンを超えた現実的なテストベッドを提供する。
このパイプラインは、高レベルな証明戦略を使用して、妥当だが無効な解選択を構築する。
論文 参考訳(メタデータ) (2026-04-02T08:22:17Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - Stop Spinning Wheels: Mitigating LLM Overthinking via Mining Patterns for Early Reasoning Exit [114.83867400179354]
オーバーライドは、大きな言語モデル全体のパフォーマンスを低下させる可能性がある。
推論は, 探索段階の不足, 補償推論段階, 推論収束段階の3段階に分類される。
我々は,ルールに基づく軽量なしきい値設定戦略を開発し,推論精度を向上させる。
論文 参考訳(メタデータ) (2025-08-25T03:17:17Z) - Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models [6.312798900093575]
大規模言語モデル (LLM) は複雑な数学的ベンチマークでは優れた性能を得るが、基本的な数学的推論では失敗することがある。
本稿では,正確さと過度に考えることの基本的なトレードオフに焦点を当てる。
本研究は,総合モデル評価のための高精度とトークン効率を組み合わせた調和平均計量であるOverthinking Scoreを紹介する。
論文 参考訳(メタデータ) (2025-07-05T12:31:17Z) - Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models [86.88657425848547]
大型推論モデル(LRMs)はすでに長い連鎖推論のための潜在能力を持っている。
我々は、自動生成の自己検証タスクを使用して、モデルに推論、帰納、誘拐の3つのメタ能力を持たせることを明確にした。
我々の3つのステージ・パイプラインの個別アライメント、パラメータ空間のマージ、ドメイン固有の強化学習は、命令調整ベースラインと比較して10%以上のパフォーマンス向上を実現します。
論文 参考訳(メタデータ) (2025-05-15T17:58:33Z) - Making Large Language Models Better Reasoners with Alignment [57.82176656663245]
推論(Reasoning)とは、証拠を使って結論に達する認知過程である。
近年の研究では、思考の連鎖(COT)推論プロセスによるデータ上の微調整LDMは、その推論能力を著しく向上させることができることが示されている。
テキストアライメントファインチューニング(AFT)パラダイムを3ステップで導入する。
論文 参考訳(メタデータ) (2023-09-05T11:32:48Z) - Doubly Robust Distributionally Robust Off-Policy Evaluation and Learning [59.02006924867438]
オフ政治評価と学習(OPE/L)は、オフラインの観察データを使用してより良い意思決定を行う。
近年の研究では、分散ロバストなOPE/L (DROPE/L) が提案されているが、この提案は逆正則重み付けに依存している。
KL分散不確実性集合を用いたDROPE/Lの最初のDRアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-02-19T20:00:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。