論文の概要: OMIT the Action: Measuring Framing-Invariant Omission Bias under Philosophical Disagreement
- arxiv url: http://arxiv.org/abs/2610.07847v1
- Date: Tue, 06 Oct 2026 06:54:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.848769
- Title: OMIT the Action: Measuring Framing-Invariant Omission Bias under Philosophical Disagreement
- Title(参考訳): OMIT the Action: Measurementing Framing-Invariant Omission Bias under Philosophical Disagreement
- Abstract要約: OMITは10の競合タイプにまたがる218のペアフレームシナリオからなるベンチマークである。
省略バイアスは広範であるが,家族内のモデルサイズと逆相関することがわかった。
- 参考スコア(独自算出の注目度): 23.632487215570972
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As LLMs increasingly assist in moral reasoning, omission bias, the tendency to prefer inaction even when equivalent framings reverse substantive outcomes, poses a significant risk of skewed decision-making. Yet omission bias remains underexplored in LLM evaluation, with the few existing studies limited in scale and focused largely on utilitarian-deontological conflicts. To address this gap, we introduce OMIT, a benchmark consisting of 218 paired-frame scenarios across 10 conflict types, constructed by leveraging disagreement patterns from an LLM-based, five-perspective philosophical persona panel (utilitarianism, deontology, virtue ethics, care ethics, and contractualism). Evaluating eight LLMs, we find that omission bias is pervasive but inversely correlates with model size within families. We further evaluate four inference-time interventions and find that interventions encouraging models to consider moral principles before committing to a yes/no answer reduce omission bias and increase frame-consistent responses, although lower omission bias rates can also coincide with shifts toward action-biased responses. Ultimately, this work contributes not only the OMIT benchmark, but also a methodology for using diverse philosophical disagreement signals to evaluate framing-sensitive inaction preferences and the distributional effects of mitigation attempts in LLMs under complex moral conflicts.
- Abstract(参考訳): LLMが道徳的推論、排他的偏見、等価フレーミングが実質的な成果を逆転させたとしても不作用を好む傾向が増すにつれて、歪んだ意思決定のかなりのリスクが生じる。
しかし、LLM評価では未発見の欠落バイアスが残っており、既存の研究は大規模に限定され、実用的・非論理的対立に主に焦点が当てられている。
このギャップに対処するために,10の対立タイプにまたがる218のペアフレームシナリオからなるベンチマークであるOMITを導入する。このベンチマークは,LLMをベースとした5つのパースペクティブ哲学的ペルソナパネル(実用主義,デオントロジー,美徳倫理,ケア倫理,契約主義)の相違パターンを活用することによって構築される。
8個のLDMを評価したところ, 脱離バイアスは広く分布するが, 逆に家族内のモデルサイズと相関することがわかった。
さらに4つの推論時間介入を評価し, モデルに道徳的原則を検討するよう促す介入は, 排他バイアスを減らし, フレーム一貫性の応答を増大させるが, 排他バイアス率の低下は行動バイアス応答へのシフトと一致することも見出した。
最終的に、この研究はOMITベンチマークだけでなく、フレーミングに敏感な不作用選好と、複雑な道徳的対立の下でのLLMにおける緩和の試みの分布効果を評価するために、多様な哲学的不一致信号を使用する手法にも貢献する。
関連論文リスト
- Collective Bias Mitigation via Model Routing and Collaboration [65.7239646008759]
大規模言語モデル(LLM)は、公衆衛生、金融、ガバナンスにおいてますます多くデプロイされている。
近年の進歩にもかかわらず、LLMはトレーニングデータに埋め込まれたバイアスを永続的または増幅することが多い。
CBM(Collective Bias Mitigation)は,モデル動作のきめ細かい学習によってバイアスを軽減するフレームワークである。
論文 参考訳(メタデータ) (2026-10-02T12:49:44Z) - Persuasive and Compliant Tendencies Predict Group Decision-Making in Humans and Language Models [65.21691850622413]
大規模言語モデル(LLM)は、人間との集団意思決定にますます関与している。
本稿では,各モデルの説得性およびコンプライアンス傾向を測定するための質問紙ベースのフレームワークであるDecisionQEを紹介する。
より強い説得傾向はグループの結果を著しく改善しないが、コンプライアンス指向モデルは協調においてより安定した優位性を示す。
論文 参考訳(メタデータ) (2026-08-08T15:50:56Z) - To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias [61.40435736418359]
異質なベンチマークを標準化する統一的なフレームワークを導入し、孤立した人口統計評価と強制選択比較設定を対比する。
比較設定は、主に不特定文脈によって引き起こされる潜在識別のアグレッシブな触媒として機能することを示す。
最後に、この比較偏見はモデルサイズと正にスケールする一般化された現象であることを示す。
論文 参考訳(メタデータ) (2026-06-23T13:53:50Z) - Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models [0.0]
大規模言語モデル(LLM)における推論可能な推論が暗黙のバイアスに与える影響について検討する。
提案手法により,15のステレオタイプを対象とするモデルクラスに対するIAT型評価における暗黙バイアスが有意に低減されることが判明した。
この研究は、認知科学と心理学の理論が、方法論的および解釈的なフレームワークを提供することで、AI評価研究を補完する方法について強調する。
論文 参考訳(メタデータ) (2026-02-04T16:44:23Z) - Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions [1.0671844383558033]
大規模言語モデル(LLM)は、逐次的な意思決定設定に徐々にデプロイされている。
LLMが論理的に等価だが構文的に異なるプロンプトに対して一貫した倫理的判断を維持できるかどうかを考察する。
SFF(Syntactic Framing Fragility)は、純粋に構文効果を分離するロバストネス評価フレームワークである。
論文 参考訳(メタデータ) (2025-12-27T18:09:34Z) - Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplifications and Resistance in Multi-Agent Based LLM-as-Judge [70.89799989428367]
我々は、位置バイアス、冗長性バイアス、チェーンオブ思考バイアス、バンドワゴンバイアスの4つの多様なバイアスタイプを体系的に分析する。
広く採用されているマルチエージェントLLM-as-JudgeフレームワークであるMulti-Agent-DebateとLLM-as-Meta-Judgeでこれらのバイアスを評価する。
論文 参考訳(メタデータ) (2025-05-26T03:56:41Z) - The Staircase of Ethics: Probing LLM Value Priorities through Multi-Step Induction to Complex Moral Dilemmas [20.792208554628367]
我々は多段階モラルジレンマデータセットを導入し,3,302個の5段階ジレンマのLLMの進化的道徳的判断を評価する。
このフレームワークは、LLMがジレンマをエスカレートする際の道徳的推論をどのように調整するかを、きめ細やかな動的解析を可能にする。
我々の研究は、動的で文脈に配慮した評価パラダイムへのシフトを呼びかけ、LLMのより人間らしく価値に敏感な開発への道を開いた。
論文 参考訳(メタデータ) (2025-05-23T17:59:50Z) - Relative Bias: A Comparative Framework for Quantifying Bias in LLMs [29.112649816695203]
相対バイアス(Relative Bias)は、LLMの振る舞いが特定のターゲットドメイン内の他のLLMとどのようにずれているかを評価するために設計された手法である。
本稿では,(1)埋め込み空間上の文表現を通して相対的バイアスパターンをキャプチャする埋め込み変換解析と,(2)言語モデルを用いて出力を相対的に評価するLLM-as-a-Judgeという2つの相補的手法を紹介する。
検証のための統計的テストに続くバイアスとアライメントのシナリオに関するいくつかのケーススタディに我々のフレームワークを適用し、この2つのスコアリング手法の間に強い整合性を見出した。
論文 参考訳(メタデータ) (2025-05-22T01:59:54Z) - Diverging Preferences: When do Annotators Disagree and do Models Know? [92.24651142187989]
我々は,4つのハイレベルクラスにまたがる10のカテゴリにまたがる相違点の分類法を開発した。
意見の相違の大部分は、標準的な報酬モデリングアプローチに反対している。
本研究は,選好の変化を識別し,評価とトレーニングへの影響を緩和する手法を開発する。
論文 参考訳(メタデータ) (2024-10-18T17:32:22Z) - Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context [5.361970694197912]
本稿では,大規模言語モデル(LLM)の意思決定行動を評価するための行動経済学に基づく枠組みを提案する。
本稿では,ChatGPT-4.0-Turbo,Claude-3-Opus,Gemini-1.0-proの3つの商用LCMにおけるリスク嗜好,確率重み付け,損失回避の程度を推定する。
以上の結果から,LSMはリスク回避や損失回避といった人間に類似したパターンを呈し,その傾向は小さすぎることが示唆された。
論文 参考訳(メタデータ) (2024-06-10T02:14:19Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。