論文の概要: Reinforcement Learning with Comparative Evidence for Social Intelligence
- arxiv url: http://arxiv.org/abs/2610.04072v1
- Date: Fri, 02 Oct 2026 21:35:23 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:04:40.98756
- Title: Reinforcement Learning with Comparative Evidence for Social Intelligence
- Title(参考訳): ソーシャルインテリジェンスのための比較エビデンスを用いた強化学習
- Abstract要約: Reinforcement Learning with Comparison Evidence (RLCE) は、厳密なアノテーションから報酬を構築することなく、ラベルのないトレーニングデータから社会的理解を学ぶ。
RLCEは、7つの手法の中で最強のパフォーマンスを達成している。
- 参考スコア(独自算出の注目度): 71.36958862570982
- License:
- Abstract: Developing socially intelligent AI remains heavily dependent on human-annotated data, limiting the scale and breadth of social understanding models can acquire. Methods that derive training signals from unlabeled data offer a path beyond this dependence, but social predictions lack the verification oracles available in mathematics and coding. Moreover, core social targets such as affect, intent, preference, and pragmatic meaning are often ambiguous. The same behavior can support multiple plausible interpretations, making it difficult to verify which is best supported. To address this challenge, we introduce Reinforcement Learning with Comparative Evidence (RLCE), a reinforcement learning method that learns social understanding from unlabeled training data without constructing rewards from ground-truth annotations. Given distinct answers in a rollout group, RLCE constructs evidence tests that identify observable evidence favoring an answer over another, validates these tests against the input sample, and aggregates test outcomes to determine the best-supported interpretation. Tests are regenerated as the policy produces new answers, enabling them to evolve with the policy. Across four benchmarks spanning affect, pragmatics, communicative intent, and preference, RLCE attains the strongest performance among seven methods that use no ground-truth training labels for rewards, including consensus, policy LLM-judge verification, multimodal co-evolution, and rubric-based rewards. Gains over the strongest baseline reach up to +18.93 points. Analyses further show that RLCE exhibits a larger share of reward variation between correct and incorrect predictions than compared rubric methods, can overturn erroneous policy-derived preferences, and benefits from pairwise test construction, compositional test aggregation, and on-policy test evolution.
- Abstract(参考訳): 社会的にインテリジェントなAIの開発は、人間の注釈付きデータに大きく依存しており、社会的理解モデルの規模と広さを制限している。
ラベルのないデータからトレーニング信号を引き出す方法は、この依存を超えた道筋を提供するが、社会予測は数学やコーディングで利用できる検証の誤りを欠いている。
さらに、感情、意図、嗜好、現実的な意味といった中核的な社会的目標はしばしば曖昧である。
同じ振る舞いは、複数のもっともらしい解釈をサポートすることができ、どれが最もサポートされているかを検証するのが難しくなる。
この課題に対処するために,本研究では,未ラベルのトレーニングデータから社会的理解を学習する強化学習法であるReinforcement Learning with Comparison Evidence (RLCE)を紹介する。
ロールアウトグループで個別の回答が与えられた場合、RLCEは、別の解答に賛成する観察可能な証拠を識別するエビデンステストを構築し、これらのテストを入力サンプルに対して検証し、最も支持された解釈を決定するためにテスト結果を集計する。
テストは、ポリシーが新しい回答を生成するときに再生され、ポリシーでそれらが進化することを可能にする。
影響、プラグマティクス、コミュニケーション意図、嗜好にまたがる4つのベンチマークで、RLCEは、コンセンサス、ポリシー LLM-judge 検証、マルチモーダル共進化、ルーブリックベースの報酬を含む、基礎的なトレーニングラベルを使用しない7つの方法の中で、最強のパフォーマンスを達成している。
最強のベースラインでの利得は+18.93点に達する。
さらに、RLCEは、比較したルーブリック法よりも正しい予測と誤った予測の間の報酬のばらつきが大きいことを示し、誤ったポリシーに基づく嗜好を覆し、ペアワイズなテスト構築、構成的テスト集約、および政治上のテスト進化の恩恵を享受できることを示した。
関連論文リスト
- Harnessing Image Question Dependence for Better VLM Test-time Reinforcement Learning [66.13367818892503]
Vlm 適応性を向上させるために画像探索依存を利用したテスト時強化学習フレームワーク TTIQ を提案する。
TTIQの教師は、元の画像検索ペアとその画像と質問対応のバリエーションの下で、各サンプル応答を強制する。
イメージと質問への依存と信頼を組み合わせることで、共同で接地された応答を好む応答レベルの報酬を構築する。
論文 参考訳(メタデータ) (2026-09-09T22:54:15Z) - AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes [59.134503227559634]
マルチモーダル大言語モデル(MLLM)は,VQAとシーン理解において高い性能を発揮する。
モデルは、マイクロ表現やボディランゲージのような人中心の手がかりを無視しながら、正しい答えを予測できる。
本稿では、感情的推論を検証可能なフレームワークであるAffect Omniを提案する。
論文 参考訳(メタデータ) (2026-08-24T11:25:04Z) - SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution [82.31558282651811]
複雑な対人相互作用をナビゲートするソーシャルインテリジェンスは、言語エージェントに根本的な課題を提示する。
既存のアプローチでは、言語モデルを直接使用してエピソードレベルの報酬を分配する。
協調ゲーム理論に基づく新しい原理的枠組みであるSAVOIRを提案する。
論文 参考訳(メタデータ) (2026-04-21T02:08:25Z) - Modernizing Ground Truth: Four Shifts Toward Improving Reliability and Validity in AI in Education [3.275822752813799]
ジェネレーティブ・人工知能(GenAI)は現在、教育に広く普及しているが、GenAIシステムの有効性は、それらを訓練し評価するために使用されるラベル付きデータの質と解釈に制約されている。
我々は,多くの教育評価や実践支援設定には,高参照構造やスキュードラベル分布などの課題が含まれていると論じている。
1) IRR を機械的受容閾値(例えば k > 0.8 )ではなく,不一致を局所化し,構成を洗練するための診断信号として扱うこと,(2) レーダの専門知識,コードブックの開発,和解手順,セグメンテーションの透過的な報告を必要とすること,の4つの実践的シフトを提案する。
論文 参考訳(メタデータ) (2026-03-31T01:47:01Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - Incentivizing Truthful Language Models via Peer Elicitation Games [13.262897952363147]
大きな言語モデル(LLM)は強力な生成能力を示しているが、矛盾や幻覚の傾向が強い。
我々は,異なるベースモデルからインスタンス化されたジェネレータと複数の識別器を含むピア・エリケーション機構を通じて,LPMを整列させる学習自由ゲーム理論フレームワークであるPeer Elicitation Games (PEG)を紹介した。
論文 参考訳(メタデータ) (2025-05-19T18:16:58Z) - A Psychology-based Unified Dynamic Framework for Curriculum Learning [5.410910735259908]
本稿では、心理学に基づくカリキュラム学習のための統一動的フレームワーク(PUDF)を提案する。
我々は、人工集団(AC)からの応答にIRT(Item Response Theory)を適用して、データトレーニングの難しさを定量化する。
本稿では,モデル学習中に適切なデータ量をスケジュールするDDS-MAE戦略を提案する。
論文 参考訳(メタデータ) (2024-08-09T20:30:37Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。