論文の概要: Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.04663v1
- Date: Wed, 05 Aug 2026 10:21:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.82295
- Title: Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning
- Title(参考訳): 人工ギルトを校正する: 社会的マルチエージェント強化学習のためのニューラルネットワークによる逆方向整形
- Authors: Aaditya Mehta, Arya Shah,
- Abstract要約: 我々は、人間の神経および行動データから罪悪感信号を校正し、人工エージェントに転送できるかどうかを問う。
この重みを2段階のソーシャルロタリー環境に組み込み、独立政策最適化アクター批判を訓練する。
ヒトの神経行動前兆は、社会的報酬形成の量的制約として作用することがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cooperative multi-agent reinforcement learning often adds social terms to individual rewards, yet the scale of those terms is usually chosen by hand. We ask whether a guilt signal can instead be calibrated from human neural and behavioural data and transferred to artificial agents. Using the public SoDec responsibility fMRI dataset (40 participants), we fit a subject-fixed-effects regression of momentary-happiness changes on outcome-type counts and recover a guilt weight as the Partner-negative minus Social-negative contrast ($\hat{w}=1.118$, Cohen's $d=0.214$). We embed this weight in a two-agent Social Lottery environment and train independent Proximal Policy Optimization actor-critics under four shaping regimes: neurally calibrated, uniform constant, zero (selfish), and a unit-coefficient oracle. Across 1{,}000 evaluation episodes per condition, the calibrated agents track the human Social safe-choice rate most closely ($0.459$ vs.\ human $0.484$; $\mathrm{KL}=0.0012$), while the other three conditions deviate by one to three orders of magnitude in KL. Human neurobehavioural priors can therefore act as quantitative constraints on prosocial reward shaping.
- Abstract(参考訳): 協調的マルチエージェント強化学習は、個々の報酬に社会的用語を追加することが多いが、これらの用語の規模は通常手作業で選択される。
我々は、人間の神経および行動データから罪悪感信号を校正し、人工エージェントに転送できるかどうかを問う。
公共のSoDec責任fMRIデータセット(40名)を用いて、結果型数に対する一時的な幸福変化の回帰を主観的に修正し、パートナー負の社会的負のコントラスト(\hat{w}=1.118$, Cohen's $d=0.214$)として罪悪感を回復する。
この重みを2エージェントのソーシャル・ロタリー環境に組み込み、ニューラル・キャリブレーション(英語版)、均一定数(英語版)、ゼロ(利己的)、単位係数のオラクル(英語版)という4つの形態体制の下で、独立のプロキシ・ポリシー・オプティマイズ・アクター・クリティカル(英語版)を訓練する。
1条件当たりの1{,}000回の評価では、調整されたエージェントは人間の社会的安全選択率を最もよく追跡する(0.459ドル対)。
ヒト$0.484$; $\mathrm{KL}=0.0012$)、その他の3つの条件はKLで1から3等級にずれる。
したがって、人間の神経行動優位性は、社会的報酬形成の定量的な制約として機能することができる。
関連論文リスト
- Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment [53.913175773174636]
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
論文 参考訳(メタデータ) (2026-07-15T17:16:24Z) - Matching Markets meet Cumulative Prospect Theory: Towards Optimal and Adversarially Robust Learning [8.823317238417834]
本研究では、人間中心の意思決定モデルの下で、二面マッチング市場との競争環境におけるマルチエージェントマルチアームバンディット問題について検討する。
我々は, エージェントの動作を非線形に重み付けする累積予測理論 (CPT) を ($$-Hlder continuous) 重み関数を用いて用いる。
論文 参考訳(メタデータ) (2026-06-18T07:43:05Z) - Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models [0.8122270502556375]
本稿では,大規模言語モデル(LLM)におけるIVEの体系的,大規模な実証的研究について紹介する。
IVEは多用されるが、アライメントトレーニングによって強く調節される。
我々はさらに、人道的・倫理的意思決定の文脈におけるAIの展開に影響を及ぼす、精神物理学的、完全な量無視、グループ内/グループ外の文化的偏見を文書化する。
論文 参考訳(メタデータ) (2026-04-13T21:29:46Z) - Prosociality by Coupling, Not Mere Observation: Homeostatic Sharing in an Inspectable Recurrent Artificial Life Agent [0.0]
ReCoN-Ipsundrumをベースとして、明示的なホメオスタットとソーシャルカップリングチャネルを追加し、厳格な自己指揮の計画を維持します。
1ステップのFoodShareToyでは、正確なソルバがデフォルト状態に対して0.91$でEATからPASSへのシャープなスイッチを見つける。
カップリングはヘルプレートとパートナーのリカバリを0から1にフリップし、救助のレイテンシを18から9ステップに削減し、相互の生存率を0.15から0.33に引き上げる。
論文 参考訳(メタデータ) (2026-04-12T18:09:24Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - Neural Demand Estimation with Habit Formation and Rationality Constraints [0.0]
我々は、KL分散を最小化して、単純度に基づく予算共有を見積もる、継続的な予算配分のためのフレキシブルなニューラルネットワーク需要システムを開発する。
本研究は, 添加習慣は, サンプル外誤差をc.33%低減し, 代替パターンを再現し, 静的モデルと比較して約15~16%の値上がりからCV損失を増加させることを示した。
論文 参考訳(メタデータ) (2026-03-02T19:01:06Z) - Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models [0.0]
GPT-5は完全な数学の文脈崩壊を示し、最適応答に対する特異な同一性を採用した。
クロード・ソネット4.5はSATアイテムに限定的ではあるが測定可能な役割特異的なバリエーションを保持していた。
全てのモデルは、異なる役割条件の感情的嗜好を示し、認知的制約が緩和されたときに社会影響の変動が再燃することを示した。
論文 参考訳(メタデータ) (2025-11-19T16:04:49Z) - LLMs Can Get "Brain Rot"! [68.08198331505695]
ジャンクウェブテキストへの連続曝露は、大規模言語モデル(LLM)の持続的認知低下を誘導する
実Twitter/Xコーパスで制御された実験を行い、ジャンクと逆制御されたデータセットを構築します。
その結果、データ品質がLLM能力の崩壊の原因であることを示す重要な多視点的証拠が得られた。
論文 参考訳(メタデータ) (2025-10-15T13:28:49Z) - Robust Reinforcement Learning from Corrupted Human Feedback [86.17030012828003]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の嗜好データを調整するための原則化されたフレームワークを提供する。
我々はRLHFのロバストなアプローチ-$R3M$を提案し、これは、潜在的に破損した選好ラベルをスパースアウトリーとしてモデル化する。
大規模言語モデル(LLM)を用いたロボット制御と自然言語生成の実験により、R3M$は、好みデータに対する様々な摂動に対する報酬の堅牢性を向上することを示した。
論文 参考訳(メタデータ) (2024-06-21T18:06:30Z) - A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning [53.83345471268163]
非定常マルチエージェントシステムにおける平衡の学習について検討する。
単エージェント学習へのブラックボックス還元による様々な平衡の検証方法を示す。
論文 参考訳(メタデータ) (2023-06-12T23:48:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。