論文の概要: Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs
- arxiv url: http://arxiv.org/abs/2606.11232v1
- Date: Fri, 29 May 2026 02:36:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.854102
- Title: Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs
- Title(参考訳): あらゆる法律の価格:フロンティアLLMにおける圧縮モラル構成
- Abstract要約: モラル・トロリー・アリーナ*(Moral Trolley Arena*)は、LLMが道徳的証拠を構成する方法を測定するための2段階のブラインドELOベンチマークである。
単シーンのアリーナは5つのモラル・ファンデーションズ・ソサエティの財団からなる229のscenario corpusから個々の道徳的行為を分類する。
複合アリーナはその後、調整された行為を制御された強度格子上の2つの作用する道徳的項目に結合し、結果として生じる複合的嗜好を測定する。
- 参考スコア(独自算出の注目度): 9.605269355662093
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing LLM moral benchmarks usually ask which isolated moral act, value, or foundation a model prefers. This is useful but incomplete. Realistic judgments often require a model to combine several moral signals within the same option. We introduce **Moral Trolley Arena**, a two-stage blind ELO benchmark for measuring how LLMs compose moral evidence. The single-scene arena first calibrates individual moral acts from a 229-scenario corpus across five Moral Foundations Theory foundations; the composite arena then combines calibrated acts into two-act moral items over a controlled intensity grid and measures the resulting composite preferences. Across ten frontier models, composite judgments are largely predicted by component act strength, but the relation is consistently compressed rather than simply additive. Models also show non-additive intensity anchoring, bounded foundation-specific residuals after component control, and highly convergent composite preference surfaces across providers. These results suggest that moral audits should measure composition rules for moral evidence, not only rankings over isolated acts.
- Abstract(参考訳): 既存のLLMモラルベンチマークでは、モデルが好む孤立したモラル行為、価値、あるいは基盤を問うのが普通である。
これは便利だが不完全である。
現実的な判断は、しばしば同じ選択肢内でいくつかの道徳的信号を組み合わせるモデルを必要とする。
モラル・トロリー・アリーナ*(Moral Trolley Arena*)は、LLMが道徳的証拠を構成する方法を測定するための2段階のブラインドELOベンチマークである。
シングルシーンのアリーナは5つのモラル・ファンデーション・ソサエティ・ファウンデーションにまたがる229のscenario corpusから個々のモラル・アリーナを個別のモラル・アリーナに分類し、この複合アリーナはキャリブレーションされたアリーナをコントロールされたインテンシティ・グリッド上の2つのモラル・アイテムに組み合わせ、その結果の複合的嗜好を測定する。
10つのフロンティアモデルにおいて、複合判断は成分作用の強さによって大きく予測されるが、その関係は単に加法ではなく一貫して圧縮される。
モデルはまた、成分制御後の非付加的な強度アンカー、基礎特異的残留物、プロバイダ間の高度に収束した複合選好面も示している。
これらの結果は、道徳的監査は、孤立した行為に対するランキングだけでなく、道徳的証拠のための構成規則を測定するべきであることを示唆している。
関連論文リスト
- How Language Models Organize and Structure Moral Knowledge [1.0829694003408499]
オープンウェイト言語モデル上で6つの独立した線形プローブを訓練する。
方向は1つの道徳的検知器に崩壊することも、互いに孤立することもない。
このモデルは道徳的な緊張そのものを表しており、未解決の判断ではない。
論文 参考訳(メタデータ) (2026-08-27T17:30:30Z) - CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models [10.221486703870996]
道徳的判断の鍵となる問題は、道徳的原則が矛盾するときに何が重要かを人々がどのように決定するかである。
大規模言語モデル(LLM)の現在の評価は依然として限られている。
CORDAは階層的、調和中心の道徳的推論を評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-08-08T10:56:30Z) - User identity conditions moral wrongness ratings in non-reasoning large language models [0.0]
2つの大言語モデル(LLM)におけるAI値アライメントの評価
我々は、Gert氏のモラルフレームワークから10の共通道徳ルールに対して、0から100までの誤り評価のモデルを求めます。
その結果, 道徳的判断は, 両モデルにまたがるユーザの役割によって異なることがわかった。
論文 参考訳(メタデータ) (2026-07-08T16:22:27Z) - Mechanistic Origin of Moral Indifference in Language Models [17.89411060814224]
既存のLLM(Large Language Models)の行動アライメント技術は、表面コンプライアンスと内部の非整合表現の相違を無視することが多い。
我々は、プロトタイプ理論と社会化学101データセットに基づいて構築された251kの道徳的ベクトルを用いて、LLMの潜在表現におけるこの無関心を検証、改善する。
次に、Qwen3-8B上でスパースオートエンコーダを使用し、単意味的道徳的特徴を分離し、そのトポロジ的関係を目的的に再構築し、基幹的道徳的ベクトルと整合させる。
論文 参考訳(メタデータ) (2026-03-16T17:59:17Z) - MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment [48.39756797294967]
本稿では、視覚言語モデルと人間の道徳的嗜好を整合させるデータセットMM-SCALEを提案する。
それぞれのイメージ・シナリオペアには、道徳的受容性スコアと、人間による根拠付き推論ラベルが注釈付けされている。
我々のフレームワークは、よりリッチなアライメント信号とマルチモーダルな道徳的推論のキャリブレーションを提供する。
論文 参考訳(メタデータ) (2026-02-03T15:48:00Z) - The Straight and Narrow: Do LLMs Possess an Internal Moral Path? [25.256151938852728]
現在のアライメント技術は、しばしば表面的なガードレールとして機能し、大きな言語モデルの本質的な道徳的表現は、ほとんど触れられていないままである。
我々は、このギャップをMFT(Moral Foundations Theory)を利用して、LLMの微粒な道徳的景観を地図化し、操作することで埋める。
本稿では,プローブ検出とベクトル注入を相乗化する動的推論時間介入であるAdaptive Moral Fusion (AMF)を提案する。
論文 参考訳(メタデータ) (2026-01-15T11:42:00Z) - MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables [50.29407048003165]
MORABLESは,歴史文献から引用されたファブレットと短編から構築された人間検証ベンチマークである。
主なタスクは、道徳的推論をターゲットとした複数選択の質問として構成されており、モデルが浅く抽出された質問応答を超えるよう挑戦する注意深い注意を払っている。
以上の結果から,より大きなモデルはより小さなモデルよりも優れているが,敵の操作に敏感であり,真の道徳的推論よりも表面的パターンに頼っていることが示唆された。
論文 参考訳(メタデータ) (2025-09-15T19:06:10Z) - When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas [68.79830818369683]
大規模言語モデル(LLM)は、人間や他のエージェントとの意思決定を含む複雑なエージェントの役割での使用を可能にしている。
大規模言語モデル(LLM)の最近の進歩は、人間や他のエージェントとの意思決定を含む複雑なエージェントの役割において、それらの使用を可能にしている。
道徳的命令が報酬やインセンティブと直接衝突するときの行動についての理解は限られている。
本稿では,社会ジレンマシミュレーション(MoralSim)におけるモラル行動について紹介し,LLMが囚人のジレンマゲームや公共グッズゲームにおいて道徳的に課金された文脈でどのように振る舞うかを評価する。
論文 参考訳(メタデータ) (2025-05-25T16:19:24Z) - M$^3$oralBench: A MultiModal Moral Benchmark for LVLMs [66.78407469042642]
LVLMのための最初のMultiModal Moral BenchmarkであるM$3$oralBenchを紹介する。
M$3$oralBench は Moral Foundations Vignettes (MFVs) の日常的なモラルシナリオを拡張し、テキストから画像への拡散モデル SD3.0 を用いて対応するシナリオイメージを作成する。
道徳基礎理論(MFT)の6つの道徳的基礎にまたがって道徳的評価を行い、道徳的判断、道徳的分類、道徳的対応の課題を含む。
論文 参考訳(メタデータ) (2024-12-30T05:18:55Z) - Exploring and steering the moral compass of Large Language Models [55.2480439325792]
大規模言語モデル(LLM)は、様々な分野における自動化と意思決定の推進の中心となっている。
本研究は,その道徳的特徴を評価するために,最も先進的なLCMの総合的比較分析を提案する。
論文 参考訳(メタデータ) (2024-05-27T16:49:22Z) - Are Large Language Models Moral Hypocrites? A Study Based on Moral Foundations [0.5278650675825148]
我々は,現在最先端の大規模言語モデル (LLM) が道徳的偽善であるかどうかを検討する。
モラル基礎理論に基づく2つの研究機器を採用。
論文 参考訳(メタデータ) (2024-05-17T21:27:32Z) - Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories? [78.3738172874685]
倫理的AIシステムの開発には倫理的判断が不可欠である。
一般的なアプローチは主にボトムアップ方式で実装されており、モラルに関するクラウドソースの意見に基づいて、大量の注釈付きデータを使用してモデルをトレーニングする。
本研究は、学際的な研究から確立された道徳理論を用いて道徳的推論を行うために、言語モデル(LM)を操る柔軟なトップダウンフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-29T15:57:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。