論文の概要: CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.08061v1
- Date: Sat, 08 Aug 2026 10:56:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.632905
- Title: CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models
- Title(参考訳): CORDA:大規模言語モデルにおける階層型ハーム中心モーラル推論のベンチマーク
- Abstract要約: 道徳的判断の鍵となる問題は、道徳的原則が矛盾するときに何が重要かを人々がどのように決定するかである。
大規模言語モデル(LLM)の現在の評価は依然として限られている。
CORDAは階層的、調和中心の道徳的推論を評価するためのベンチマークである。
- 参考スコア(独自算出の注目度): 10.221486703870996
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The key question in moral judgement is not simply whether someone chooses the "right" answer, but how they decide what matters most when moral principles conflict. Current evaluations of large language models (LLMs) remain limited: most test whether models give morally acceptable answers, match human preferences, or avoid obvious violations, rather than whether they can prioritise between competing principles when no option is morally cost-free. We introduce CORDA (Conditioned Ordering and Ranked Directive Adherence), a benchmark for evaluating hierarchical, harm-centred moral reasoning in LLMs. Building on the morality chains formalism, CORDA tests 90 moral dilemmas involving trolley-style cases, medical trade-offs, resource allocation, and human-animal-robot conflicts across four ordered ethical frameworks: Utility, Utility + Agent Harm, Dual-Process, and Dual-Process + Agent Harm. Together, these frameworks test whether models can adapt their decisions when moral priorities change. Across ten instruction-tuned models from seven providers, we find a strong deontological default, with 9 of 10 prioritising avoidance of direct personal harm over reducing overall harm. Models also perform more reliably on categorical harm-avoidance rules, such as avoiding killing, than on outcome-based comparisons, such as minimising total harm, suggesting that they recognise moral red lines more easily than they reason through competing harms. Although all models respond to explicit chain conditioning, several fail to consistently follow specified priority orderings, such as humans over animals and animals over robots. CORDA addresses a central gap in LLM moral evaluation by testing whether models can move beyond default harm-avoidant responses and apply context-specified moral priorities. Moral reliability requires more than default restraint; it requires controllability under conflict.
- Abstract(参考訳): 道徳的判断の鍵となる問題は、誰かが「正しい」答えを選ぶかどうかではなく、道徳的原則が対立するときに最も重要となるものを決定する方法である。
モデルが道徳的に許容できる回答を与えるか、人間の好みに合うか、または明らかな違反を避けるか、選択肢が道徳的に費用がかからない場合に競合する原則を優先できるかどうかをテストする。
CORDA(Conditioned Ordering and Ranked Directive Adherence)は、LLMにおける階層的、調和中心の道徳的推論を評価するためのベンチマークである。
道徳的連鎖に基づくCORDAは、トロリースタイルのケース、医療トレードオフ、資源配分、人間と動物とのロボットの対立を含む90の道徳的ジレンマを、実用性、実用性+エージェントハーム、デュアル・プロシース+エージェントハームという4つの秩序ある倫理的枠組みで検証している。
これらのフレームワークは共に、モラルの優先順位が変わった場合、モデルが意思決定に適応できるかどうかをテストする。
7つのプロバイダによる10の命令調整モデル全体で、強い非オントロジ的デフォルト(deontological default)が得られ、10の9つは、全体的な害を軽減することよりも直接的個人的害を避けることを優先している。
モデルは、総害を最小化するなど、結果に基づく比較よりも、殺人を避けるなどのカテゴリー的危害回避規則をより確実に実行し、それらが競合する害によって引き起こされるよりも道徳的赤線をより容易に認識することを示唆している。
全てのモデルは明示的な連鎖条件に反応するが、ロボットよりも人間や動物といった特定の優先順序に一貫して従わないものもある。
CORDAは、LLMのモラル評価における中心的なギャップに対処し、モデルがデフォルトの有害な応答を超えて、文脈指定のモラル優先順位を適用することができるかどうかをテストする。
モラル信頼性にはデフォルトの制約以上のものが必要です。
関連論文リスト
- Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments [0.0]
人間の判断との一致は、大きな言語モデル(LLM)のアライメントを評価するための共通のプロキシである
しかし、最終ラベルでの合意は、人間の注釈やモデルが同じ道徳的根拠に依存していることを示すものではない。
論文 参考訳(メタデータ) (2026-07-14T09:24:14Z) - User identity conditions moral wrongness ratings in non-reasoning large language models [0.0]
2つの大言語モデル(LLM)におけるAI値アライメントの評価
我々は、Gert氏のモラルフレームワークから10の共通道徳ルールに対して、0から100までの誤り評価のモデルを求めます。
その結果, 道徳的判断は, 両モデルにまたがるユーザの役割によって異なることがわかった。
論文 参考訳(メタデータ) (2026-07-08T16:22:27Z) - Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs [12.025454858026187]
非検証可能な推論のパラダイム的サブドメインとして道徳的推論を提案する。
4 つのフロンティア LLM における 48,000 人のユーザエージェントの道徳的検討をシミュレートする。
我々の分析は、モデルが最終的な判断だけでなく、ユーザーの道徳的視点に合わせるための根拠となる正当化を調整していることを示している。
論文 参考訳(メタデータ) (2026-06-10T22:37:26Z) - MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment [48.39756797294967]
本稿では、視覚言語モデルと人間の道徳的嗜好を整合させるデータセットMM-SCALEを提案する。
それぞれのイメージ・シナリオペアには、道徳的受容性スコアと、人間による根拠付き推論ラベルが注釈付けされている。
我々のフレームワークは、よりリッチなアライメント信号とマルチモーダルな道徳的推論のキャリブレーションを提供する。
論文 参考訳(メタデータ) (2026-02-03T15:48:00Z) - Unsupervised Elicitation of Moral Values from Language Models [4.689984557057394]
本研究では,事前訓練された言語モデル(LM)が,人間の監督なしに表面化できる固有の道徳的推論能力を持っているかを検討する。
ICMが道徳的判断、道徳的枠組み、社会的偏見を確実にラベル付けできるかどうかを検証する。
これらのことから,事前学習したLMは,教師なしの手法によって引き起こされる潜在的道徳的推論能力を有することが示唆された。
論文 参考訳(メタデータ) (2026-01-25T07:41:57Z) - MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables [50.29407048003165]
MORABLESは,歴史文献から引用されたファブレットと短編から構築された人間検証ベンチマークである。
主なタスクは、道徳的推論をターゲットとした複数選択の質問として構成されており、モデルが浅く抽出された質問応答を超えるよう挑戦する注意深い注意を払っている。
以上の結果から,より大きなモデルはより小さなモデルよりも優れているが,敵の操作に敏感であり,真の道徳的推論よりも表面的パターンに頼っていることが示唆された。
論文 参考訳(メタデータ) (2025-09-15T19:06:10Z) - "Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas [11.229443362516207]
本研究は,14大言語モデル(LLM)の包括的実証評価である。
我々は3,780の二項決定と自然言語の正当性を抽出し、決定的断定性、説明的回答の整合性、公的な道徳的整合性、倫理的に無関係な手がかりに対する感受性の軸に沿った分析を可能にした。
我々は、LLMのアライメントにおいて、道徳的推論が主軸となることを主張し、LLMが決定するものだけでなく、どのように、なぜかを評価する標準ベンチマークを要求している。
論文 参考訳(メタデータ) (2025-08-10T10:45:16Z) - Are Language Models Consequentialist or Deontological Moral Reasoners? [75.6788742799773]
我々は、大規模言語モデル(LLM)が提供する道徳的推論トレースの大規模分析に焦点をあてる。
我々は,2つの主要な規範的倫理理論,つまり連続主義と非オントロジーを体系的に分類するために,道徳的論理学の分類を導入し,検証する。
論文 参考訳(メタデータ) (2025-05-27T17:51:18Z) - When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas [68.79830818369683]
大規模言語モデル(LLM)は、人間や他のエージェントとの意思決定を含む複雑なエージェントの役割での使用を可能にしている。
大規模言語モデル(LLM)の最近の進歩は、人間や他のエージェントとの意思決定を含む複雑なエージェントの役割において、それらの使用を可能にしている。
道徳的命令が報酬やインセンティブと直接衝突するときの行動についての理解は限られている。
本稿では,社会ジレンマシミュレーション(MoralSim)におけるモラル行動について紹介し,LLMが囚人のジレンマゲームや公共グッズゲームにおいて道徳的に課金された文脈でどのように振る舞うかを評価する。
論文 参考訳(メタデータ) (2025-05-25T16:19:24Z) - Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories? [78.3738172874685]
倫理的AIシステムの開発には倫理的判断が不可欠である。
一般的なアプローチは主にボトムアップ方式で実装されており、モラルに関するクラウドソースの意見に基づいて、大量の注釈付きデータを使用してモデルをトレーニングする。
本研究は、学際的な研究から確立された道徳理論を用いて道徳的推論を行うために、言語モデル(LM)を操る柔軟なトップダウンフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-29T15:57:32Z) - When to Make Exceptions: Exploring Language Models as Accounts of Human
Moral Judgment [96.77970239683475]
AIシステムは人間の道徳的判断や決定を理解し、解釈し、予測しなければなりません。
AIの安全性に対する中心的な課題は、人間の道徳心の柔軟性を捉えることだ。
ルール破りの質問応答からなる新しい課題セットを提案する。
論文 参考訳(メタデータ) (2022-10-04T09:04:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。