論文の概要: Step-Level Preference Learning for Generative Agents in Social Simulations
- arxiv url: http://arxiv.org/abs/2607.14485v1
- Date: Thu, 16 Jul 2026 01:58:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.954656
- Title: Step-Level Preference Learning for Generative Agents in Social Simulations
- Title(参考訳): 社会シミュレーションにおける生成エージェントのステップレベル選好学習
- Abstract要約: エージェント決定トラジェクトリよりもステップレベルの人間の嗜好監督を収集できる対話型シミュレーションインタフェースであるメソッドを導入する。
このデータに対して教師付き微調整と直接選好最適化を用いて、オープンウェイト言語モデル上でステップレベルの選好学習を行う。
以上の結果から,段階的人間監督は,局所的意思決定の質と長期的エージェントの行動を改善するための効果的な訓練信号であることが示唆された。
- 参考スコア(独自算出の注目度): 12.28229222918353
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM)-based generative agents simulate human behavior through long-horizon decision-making processes that comprise intermediate steps such as planning, memory retrieval, reflection, and action selection. However, fine-grained human annotations of these intermediate steps remain scarce, and existing agents are not grounded in human preferences over such intermediate decisions. To address this gap, we introduce \method, an interactive simulation interface that enables us to collect step-level human preference supervision over agent decision trajectories, leading to a dataset of 57K fine-grained annotations. We conduct step-level preference learning on open-weight language models using supervised finetuning and direct preference optimization on this data, consistently improving simulation fidelity, coordination, and interaction quality, and inducing more socially effective agent behavior. Our results show that step-level human supervision is an effective training signal for improving both local decision quality and long-horizon agent behavior.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づく生成エージェントは、計画、記憶検索、リフレクション、行動選択といった中間ステップを構成する長い水平決定プロセスを通じて人間の振る舞いをシミュレートする。
しかし、これらの中間段階の微粒な人間のアノテーションは依然として乏しく、既存のエージェントはそのような中間決定よりも人間の好みに根ざしていない。
このギャップに対処するため,対話型シミュレーションインタフェースである \method を導入し,エージェント決定トラジェクトリに対するステップレベルの人間の嗜好監視を行えるようにし,57K の細かいアノテーションのデータセットを作成する。
このデータに対する教師付き微調整と直接選好最適化を用いて、オープンウェイト言語モデルのステップレベルの選好学習を行い、シミュレーションの忠実度、コーディネーション、相互作用品質を一貫して改善し、より社会的に効果的なエージェントの振る舞いを誘導する。
以上の結果から,段階的人間監督は,局所的意思決定の質と長期的エージェントの行動を改善するための効果的な訓練信号であることが示唆された。
関連論文リスト
- Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - RecNet: Self-Evolving Preference Propagation for Agentic Recommender Systems [109.9061591263748]
RecNetは、レコメンデータシステムのための自己進化的な好みの伝達フレームワークである。
関連ユーザやアイテム間で、リアルタイムの好み更新を積極的に伝達する。
逆相では、フィードバック駆動の伝搬最適化機構がマルチエージェント強化学習フレームワークをシミュレートする。
論文 参考訳(メタデータ) (2026-01-29T12:14:31Z) - AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation [0.7031557790463293]
人間のインタラクションから世界モデル駆動エージェントを学習するフレームワークであるAlignを紹介する。
実証に関する反事実的軌跡を生成し, LLMに人間の選択と判断を比較し, 準最適行動を特定し, 教訓を抽出するよう促す。
論文 参考訳(メタデータ) (2026-01-02T03:01:33Z) - Scaling Environments for LLM Agents in the Era of Learning from Interaction: A Survey [30.673419015614233]
エージェントは環境と直接対話し、強化学習を通じて経験から学ぶべきだという意見が高まりつつある。
本稿では,この反復処理をGEFループとして定式化し,環境がエージェントに挑戦するためのタスクを生成し,タスク実行中のエージェントの動作に応答して観察を返却し,その後の学習のためのロールアウトに対する評価フィードバックを提供する。
このパラダイムの下では、環境は経験的データの必須生産元として機能し、より複雑な、現実主義、対話性へのスケールの必要性を強調している。
論文 参考訳(メタデータ) (2025-11-12T12:56:25Z) - Predictive Preference Learning from Human Interventions [37.039055683595414]
今後の展開を予測するために,PPL(Predictive Preference Learning from Human Interventions)を導入する。
PPLは、各人間の介入をLの将来の時間ステップにブートストラップし、優先地平線(英語版)と呼ばれ、エージェントが同じ行動に追従し、ヒトが優先地平線に同じ介入をすると仮定する。
これらの将来の状態に好みの最適化を適用することにより、専門家の修正は、エージェントが探索されるであろう安全クリティカルな領域に伝播される。
論文 参考訳(メタデータ) (2025-10-02T00:38:18Z) - What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context [56.590259941275434]
RecPOは、シーケンシャルなレコメンデーションのための優先順位最適化フレームワークである。
これは、推定された嗜好階層と時間信号に基づいて適応的な報酬マージンを利用する。
タイムリーな満足感、コヒーレントな嗜好の維持、変化する状況下での識別の行使など、人間の意思決定の重要な特徴を反映している。
論文 参考訳(メタデータ) (2025-06-02T21:09:29Z) - MF-LLM: Simulating Population Decision Dynamics via a Mean-Field Large Language Model Framework [53.82097200295448]
MF-LLM(Mean-Field LLM)は,まず平均場理論を社会シミュレーションに取り入れる。
MF-LLMは反復過程を通じて個人と人口間の双方向相互作用をモデル化する。
IB-Tuneは、Information Bottleneckの原理にインスパイアされた、新しい微調整手法である。
論文 参考訳(メタデータ) (2025-04-30T12:41:51Z) - Contextual Online Uncertainty-Aware Preference Learning for Human Feedback [13.478503755314344]
RLHF(Reinforcement Learning from Human Feedback)は人工知能において重要なパラダイムとなっている。
最適モデルに基づくオンライン意思決定と統計的推測を同時に行うための新しい統計的枠組みを提案する。
本稿では,大規模マルチタスク言語理解データセット上での大規模言語モデルのランク付けのための人間の嗜好データ分析に,提案手法を適用した。
論文 参考訳(メタデータ) (2025-04-27T19:59:11Z) - SocialMOIF: Multi-Order Intention Fusion for Pedestrian Trajectory Prediction [21.780343024406285]
SocialMOIFはこれらの課題に対処するために提案されており、近隣グループ間の高次の意図的相互作用に集中している。
SocialMOIF内では、軌道分布近似器が軌道を実際のデータとより密に整合する値へと導くように設計されている。
より正確で効率的な並列予測を可能にするために、グローバルな軌道が導入された。
論文 参考訳(メタデータ) (2025-04-22T06:14:49Z) - SDPO: Segment-Level Direct Preference Optimization for Social Agents [56.970902914217156]
大規模言語モデル(LLM)を利用した社会エージェントは、人間の社会的振る舞いをシミュレートできるが、複雑な社会対話を扱うには不十分である。
マルチターンエージェントの動作を最適化するために,対話内のキーセグメントを動的に選択するセグメントレベル直接参照最適化(SDPO)を提案する。
論文 参考訳(メタデータ) (2025-01-03T14:09:46Z) - PersLLM: A Personified Training Approach for Large Language Models [66.16513246245401]
データ構築とモデルチューニングを改善するためのフレームワークPersLLMを提案する。
データ利用が不十分な場合には、Chain-of-Thoughtプロンプトやアンチインダクションといった戦略を取り入れます。
厳密な振舞いパターンを設計し,モデルの性格の特異性とダイナミズムを高めるために自動DPOを導入する。
論文 参考訳(メタデータ) (2024-07-17T08:13:22Z) - Multi-Agent Dynamic Relational Reasoning for Social Robot Navigation [50.01551945190676]
社会ロボットナビゲーションは、日常生活の様々な状況において有用であるが、安全な人間とロボットの相互作用と効率的な軌道計画が必要である。
本稿では, 動的に進化する関係構造を明示的に推論した系統的関係推論手法を提案する。
マルチエージェント軌道予測とソーシャルロボットナビゲーションの有効性を実証する。
論文 参考訳(メタデータ) (2024-01-22T18:58:22Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z) - Instance-Aware Predictive Navigation in Multi-Agent Environments [93.15055834395304]
エージェント間の相互作用と将来のシーン構造を予測するIPC(Instance-Aware Predictive Control)アプローチを提案する。
我々は,ego中心の視点でエージェント間のインタラクションを推定するために,新しいマルチインスタンスイベント予測モジュールを採用する。
シーンレベルとインスタンスレベルの両方の予測状態をより有効活用するために、一連のアクションサンプリング戦略を設計します。
論文 参考訳(メタデータ) (2021-01-14T22:21:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。