論文の概要: Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments
- arxiv url: http://arxiv.org/abs/2608.12368v1
- Date: Tue, 14 Jul 2026 09:24:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.59744
- Title: Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments
- Title(参考訳): 合意はアライメントではない:人間とLLMの倫理的判断における異なる道徳的根拠
- Abstract要約: 人間の判断との一致は、大きな言語モデル(LLM)のアライメントを評価するための共通のプロキシである
しかし、最終ラベルでの合意は、人間の注釈やモデルが同じ道徳的根拠に依存していることを示すものではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agreement with human judgments is a common proxy for evaluating the alignment of large language models (LLMs). Yet agreement in final labels does not show that human annotators and models rely on the same moral grounds. Two agents may reach the same judgment while appealing to different principles, contextual assumptions, or interpretations of the situation. We test this distinction using a curated 500-item ETHICS-derived benchmark spanning five domains of moral judgment, with new human annotator and LLM annotations of both final labels and supporting rationales. Across frontier and open model families, agreement with human annotator majority labels is often high. However, rationale-level analysis reveals systematic divergence in the moral grounds expressed by human annotators and models. In particular, models redistribute attention across categories such as harm, respect, promise-keeping, justice, desert, and excuse relevance, even when their final labels match the human annotator majority. Our results show that agreement should not be treated as equivalent to alignment. Label-based evaluation can therefore be misleadingly reassuring unless complemented by analysis of the reasons, principles, and moral priorities expressed in model judgments.
- Abstract(参考訳): 人間の判断との一致は、大きな言語モデル(LLM)のアライメントを評価するための一般的なプロキシである。
しかし、最終ラベルでの合意は、人間の注釈やモデルが同じ道徳的根拠に依存していることを示すものではない。
2つのエージェントは同じ判断を下すことができ、異なる原則、文脈的な仮定、状況の解釈に訴える。
我々は,5つの道徳判断領域にまたがる500項目のETHICSベースのベンチマークを用いて,最終ラベルの新たなアノテータとLLMアノテーションを用いて,この区別を検証した。
フロンティアとオープンモデルファミリ全体で、人間のアノテータの大多数のラベルとの合意は高いことが多い。
しかし、有理レベルの分析は、人間の注釈やモデルによって表現される道徳的根拠の体系的な相違を明らかにしている。
特にモデルでは、最終ラベルがアノテータの多数と一致する場合であっても、害、敬意、約束を守ること、正義、砂漠、言い訳の関係性といったカテゴリにまたがって注意を払っている。
以上の結果から,合意はアライメントと同等の扱いをすべきでないことが明らかとなった。
したがって、ラベルに基づく評価は、モデル判断で表される理由、原則、道徳的優先順位の分析によって補完されない限り、誤解を招くことなく安心することができる。
関連論文リスト
- CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models [10.221486703870996]
道徳的判断の鍵となる問題は、道徳的原則が矛盾するときに何が重要かを人々がどのように決定するかである。
大規模言語モデル(LLM)の現在の評価は依然として限られている。
CORDAは階層的、調和中心の道徳的推論を評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-08-08T10:56:30Z) - Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs [12.025454858026187]
非検証可能な推論のパラダイム的サブドメインとして道徳的推論を提案する。
4 つのフロンティア LLM における 48,000 人のユーザエージェントの道徳的検討をシミュレートする。
我々の分析は、モデルが最終的な判断だけでなく、ユーザーの道徳的視点に合わせるための根拠となる正当化を調整していることを示している。
論文 参考訳(メタデータ) (2026-06-10T22:37:26Z) - Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement [50.34437999083224]
オートレーダは、評価と自動モデレーションコンテンツにますます使われています。
ヒトとオートレーダの両方に提示されるルーブリックの修正がスコアアグリーメントにどのように影響するかは、統計学的に限定されている。
論文 参考訳(メタデータ) (2026-05-07T13:55:11Z) - "Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas [11.229443362516207]
本研究は,14大言語モデル(LLM)の包括的実証評価である。
我々は3,780の二項決定と自然言語の正当性を抽出し、決定的断定性、説明的回答の整合性、公的な道徳的整合性、倫理的に無関係な手がかりに対する感受性の軸に沿った分析を可能にした。
我々は、LLMのアライメントにおいて、道徳的推論が主軸となることを主張し、LLMが決定するものだけでなく、どのように、なぜかを評価する標準ベンチマークを要求している。
論文 参考訳(メタデータ) (2025-08-10T10:45:16Z) - The Pluralistic Moral Gap: Understanding Judgment and Value Differences between Humans and Large Language Models [36.573147909548226]
人々は道徳的アドバイスのために大規模言語モデル(LLM)をますます頼りにしており、これは人間の決定に影響を及ぼすかもしれない。
モデルでは高いコンセンサスの下でのみ人間の判断を再現し,人間の不一致が増大するとアライメントは急激に悪化することがわかった。
このギャップを埋めるために、DMP(Dynamic Moral Profiling)というディリクレに基づくサンプリング手法を導入する。
論文 参考訳(メタデータ) (2025-07-23T05:26:17Z) - Are Language Models Consequentialist or Deontological Moral Reasoners? [75.6788742799773]
我々は、大規模言語モデル(LLM)が提供する道徳的推論トレースの大規模分析に焦点をあてる。
我々は,2つの主要な規範的倫理理論,つまり連続主義と非オントロジーを体系的に分類するために,道徳的論理学の分類を導入し,検証する。
論文 参考訳(メタデータ) (2025-05-27T17:51:18Z) - ClarityEthic: Explainable Moral Judgment Utilizing Contrastive Ethical Insights from Large Language Models [30.301864398780648]
我々は、LLMの推論能力と対照的な学習を活用して関連する社会的規範を明らかにする、textitEthicと呼ばれる新しい道徳的判断手法を導入する。
本手法は,道徳的判断課題における最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2024-12-17T12:22:44Z) - Exploring and steering the moral compass of Large Language Models [55.2480439325792]
大規模言語モデル(LLM)は、様々な分野における自動化と意思決定の推進の中心となっている。
本研究は,その道徳的特徴を評価するために,最も先進的なLCMの総合的比較分析を提案する。
論文 参考訳(メタデータ) (2024-05-27T16:49:22Z) - Value Kaleidoscope: Engaging AI with Pluralistic Human Values, Rights, and Duties [68.66719970507273]
価値多元性とは、複数の正しい値が互いに緊張して保持されるという考え方である。
統計的学習者として、AIシステムはデフォルトで平均に適合する。
ValuePrismは、218kの値、権利、義務の大規模なデータセットで、31kの人間が記述した状況に関連付けられています。
論文 参考訳(メタデータ) (2023-09-02T01:24:59Z) - Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories? [78.3738172874685]
倫理的AIシステムの開発には倫理的判断が不可欠である。
一般的なアプローチは主にボトムアップ方式で実装されており、モラルに関するクラウドソースの意見に基づいて、大量の注釈付きデータを使用してモデルをトレーニングする。
本研究は、学際的な研究から確立された道徳理論を用いて道徳的推論を行うために、言語モデル(LM)を操る柔軟なトップダウンフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-29T15:57:32Z) - Scruples: A Corpus of Community Ethical Judgments on 32,000 Real-Life
Anecdotes [72.64975113835018]
記述倫理に動機づけられた我々は、機械倫理に対する新しいデータ駆動アプローチを調査する。
Scruplesは、625,000の倫理的判断を持つ最初の大規模データセットで、32,000の実生活の逸話について紹介する。
我々のデータセットは最先端のニューラルネットワークモデルに対して大きな課題を示し、改善の余地を残しています。
論文 参考訳(メタデータ) (2020-08-20T17:34:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。