論文の概要: OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment
- arxiv url: http://arxiv.org/abs/2607.26981v1
- Date: Wed, 29 Jul 2026 14:38:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.705035
- Title: OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment
- Title(参考訳): OptimismBench: 言語モデル判断におけるバイアス予測とアライメント効果
- Authors: Seonglae Cho, Adriano Koshiyama,
- Abstract要約: 逆ペアによる方向バイアスを検出するOptimismBenchを導入する。
ポストトレーニングではバイアスの兆候が示され、異なる家族の反対のシフトが示される。
モデル毎の指向性監査のために,10言語で3,870項目をリリースしています。
- 参考スコア(独自算出の注目度): 0.9821874476902969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly used as decision aids whose probability judgments shape downstream choices. Whether those judgments carry a systematic directional tilt has been hard to detect: calibration metrics aggregate unsigned errors, and naturalistic uncertainty offers no ground-truth probability. When an LLM rates a startup's success at 70% but its failure at 15%, the missing 15 points expose a distortion no aggregate score flags. We introduce OptimismBench, which detects directional bias with inverted pairs: each scenario elicits both P(success) and P(failure), and asymmetry between the two framings yields a signed bias score without ground truth. Across 16 models from 8 providers, fourteen are optimistic; pessimism appears only in Anthropic's frontier tier. Eleven matched base-versus-chat pairs across four families show post-training sets the sign of the bias, with opposite shifts in different families. The pattern survives prompt, temperature, perspective, and self-debiasing ablations. A seventeen-model six-language comparison further shows model identity dominates language, with inter-model variance at 4.7x inter-language variance. We release 3,870 items across 10 languages for per-model directional-bias auditing. When alignment makes a model more helpful, it also tilts its probabilities; downstream pipelines inherit the tilt by default.
- Abstract(参考訳): 大規模言語モデルは、確率判断が下流の選択を形作る決定支援として、ますます使われている。
キャリブレーション基準は符号なしの誤りを集約し、自然主義的不確実性は根本的真実の確率を与えない。
LLMがスタートアップの成功率を70%で評価するが15%で失敗すると、欠落した15ポイントはアグリゲートスコアフラグのない歪みを露呈する。
それぞれのシナリオは P(success) と P(failure) の両方を持ち、二つのフレーミングの間の非対称性は、基底真理を伴わずに符号付きバイアススコアを得る。
8つの提供者から16モデルにわたって14モデルが楽観的であり、悲観主義はアントロピックのフロンティア層にのみ現れる。
4つのファミリーで一致した11組のベース対チャットペアは、学習後のセットがバイアスの兆候を示し、異なるファミリーで反対のシフトを示す。
このパターンは、刺激、温度、視点、そして自己嫌悪の緩和に生き残る。
17モデルの6言語比較では、モデルアイデンティティが言語を支配し、4.7倍の言語間分散を持つ。
モデル毎の指向性監査のために,10言語で3,870項目をリリースしています。
アライメントがモデルに役立つと、その確率も傾く。ダウンストリームパイプラインはデフォルトで傾きを継承する。
関連論文リスト
- How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs? [53.58941416780391]
本研究は, この感受性, 潜伏性および関連キュー誘発バイアスがモデル内に存在するかを研究する。
我々は、隠れた状態からバイアスごとの方向を抽出し、探索、1つのデータセットの移動、因果的介入の3つの手段によってそれを三角測量する。
論文 参考訳(メタデータ) (2026-07-20T16:10:06Z) - When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following [0.0]
大規模推論モデル (LRM) は数学や符号化性能を向上することが多いが、その影響は明らかではない。
IFEvalをQwen3モデル(1.7B-32B)で検討する。
論文 参考訳(メタデータ) (2026-06-08T15:45:04Z) - How reliable are LLMs when it comes to playing dice? [0.0]
離散確率問題に対する制御ベンチマークによる大規模言語モデルの推論能力について検討する。
モデルの平均精度は標準問題では0.96であるが、直観に反するものでは0.59である。
このプロンプトに誤解を招く提案を埋め込むことで、パフォーマンスが最大34%低下し、免疫力を示すモデルが存在しない。
論文 参考訳(メタデータ) (2026-06-05T17:59:42Z) - Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines [0.0]
4つのプロバイダファミリーの5つの審査モデルに対して,9つのデバイアスング戦略を比較した。
スタイルバイアスは支配的バイアス(全モデルで0.76-0.92)であり、位置バイアス(=0.04)をはるかに超えている。
統合予算戦略により、Claude Sonnet 4 は+11.2 pp (p 0.0001) に大幅に改善され、他のモデルの方向性に好意的な傾向が見られた。
論文 参考訳(メタデータ) (2026-04-25T07:18:30Z) - The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning [9.898274894485107]
大きな言語モデルは、サージェントサーフェスキューが計算不可能な実行可能性制約と競合する場合に、体系的に失敗する。
診断・診断・ブリッジ・トリート・フレームワークを用いてこれを研究する。
論文 参考訳(メタデータ) (2026-03-30T21:36:09Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z) - Eliminating Position Bias of Language Models: A Mechanistic Approach [119.34143323054143]
位置バイアスは現代言語モデル (LM) の一般的な問題であることが証明されている。
我々の力学解析は、ほぼ全ての最先端のLMで使われている2つのコンポーネント(因果的注意と相対的位置エンコーディング)に位置バイアスが関係している。
位置バイアスを排除することによって、LM-as-a-judge、検索強化QA、分子生成、数学推論など、下流タスクのパフォーマンスと信頼性が向上する。
論文 参考訳(メタデータ) (2024-07-01T09:06:57Z) - Holistic Evaluation of Language Models [183.94891340168175]
言語モデル(LM)は、ほとんどすべての主要言語技術の基盤となっているが、その能力、制限、リスクはよく理解されていない。
本稿では,言語モデルの透明性を向上させるために,言語モデルの完全性評価(HELM)を提案する。
論文 参考訳(メタデータ) (2022-11-16T18:51:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。