論文の概要: ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction
- arxiv url: http://arxiv.org/abs/2608.13622v1
- Date: Thu, 13 Aug 2026 01:51:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.168249
- Title: ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction
- Title(参考訳): ARC: オープンエンド実世界のインタラクションにおける公平なアドバンテージ比較
- Abstract要約: ARCはレスポンシブでステアブルで実行対応のユーザエージェントインタラクションのための新しいパラダイムである。
ARCは、コアである$/2$ツール使用ベンチマークを大幅に強化する。
Interはシンクスタイルのベースラインに対して4.91sから1.27sに短縮する。
- 参考スコア(独自算出の注目度): 4.6344273009233214
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-ended real-world interaction admits multiple valid behaviors: an agent may answer directly, ask for clarification, provide progress updates, or confirm before acting. This flexibility breaks a core assumption behind group-based RL: rollouts compared within a group are no longer guaranteed to be behaviorally comparable. As a result, reward-model preferences over interaction style can distort relative advantages and steer optimization toward reward-preferred behaviors rather than context-appropriate ones. We formalize this as a \textit{reward fairness problem} and propose \textbf{ARC} (Advantage Regularization via Conditioning), a training recipe that restores fairer relative comparison through strategy-conditioned rollout grouping, together with hybrid rewards and entropy regularization. We study ARC in our proposed \inter, a novel paradigm for responsive, steerable, and execution-aware user-agent interaction that decouples user-visible communication from latent reasoning and tool use. \inter\ also provides the annotation and distillation pipeline for constructing \inter-86K, our strategy-annotated training corpus for supervised and RL training. Empirically, ARC substantially strengthens the core $τ/τ^2$ tool-use benchmarks, while \inter\ reduces time-to-first-token from 4.91s to 1.27s relative to a think-style baseline. Together, these results suggest that a central bottleneck in open-ended interactive learning is not only how agents are rewarded, but whether their behaviors are compared fairly in the first place. The ARC implementation and \inter-86K training data will be released.
- Abstract(参考訳): エージェントは直接答えたり、明確化を求めたり、進捗報告を提供したり、行動する前に確認したりすることができる。
この柔軟性は、グループベースのRLの背後にある中核的な仮定を破る: グループ内で比較されたロールアウトは、もはや振る舞いに匹敵するものと保証されない。
結果として、相互作用スタイルよりも報酬モデルの方が、相対的な利点を歪曲し、文脈に合ったものよりも報酬が優先される行動に最適化することができる。
我々はこれを「textit{reward fairness problem}」として定式化し、戦略条件付きロールアウトグループ化によるより公正な比較を復元するトレーニングレシピである「textbf{ARC} (Advantage Regularization via Conditioning)」と、ハイブリッド報酬とエントロピー正規化を提案する。
提案した \inter は,ユーザ可視コミュニケーションを潜時推論やツール使用から切り離す,応答性,操縦性,実行に配慮したユーザエージェントインタラクションのための新しいパラダイムである。
また,教師およびRLトレーニングのための戦略注釈付きトレーニングコーパスである \inter-86K を構築するためのアノテーションと蒸留パイプラインも提供する。
ARCは中核となる$τ/τ^2$ツール使用ベンチマークを大幅に強化する一方、 \inter\はシンクスタイルのベースラインに対して4.91sから1.27sに短縮する。
これらの結果は、オープン・エンド・インタラクティブ・ラーニングにおける中心的なボトルネックは、エージェントが報酬を受ける方法だけではなく、その振る舞いがそもそもかなり比較されるかどうかを示唆している。
ARC実装と \inter-86K トレーニングデータもリリースされる。
関連論文リスト
- SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL [6.238212335422264]
グループ相対強化学習は、同じプロンプトの兄弟ロールアウトを待つ。
トラジェクトリセンタリングは一般的に,アクターが消費するトークン重み付け量を中心にしないことを示す。
また、学習者の受取命令ではなく、それを生成する政策イベントによって、プロンプトエビデンスを整理する。
論文 参考訳(メタデータ) (2026-08-25T17:52:19Z) - Rank-Then-Act: Reward-Free Control from Frame-Order Progress [5.357451930622806]
Rank-Then-Act (RTA) は、環境に配慮せず、専門家によるビデオデモからコントロールポリシーを学ぶためのフレームワークである。
VLM(Vision-Language Model)をオフラインで,プログレッシブベースのオーディショナルスコアラーとしてトレーニングする。
我々は,予測進行ランクと真の時間指標とのスピアマンランク相関を計算し,有界でスケール不変な学習信号を生成する。
論文 参考訳(メタデータ) (2026-07-02T08:50:32Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models [29.703793991791674]
既存のRAG指向強化学習法は、文書の忠実さを評価するのにしばしば失敗する外部報酬に依存している。
コントラッシブ・ライリフッド・リワード(CLR)を中心とした新たな「内外的」ハイブリッド報酬枠組を提案する。
CLRは、エビデンスをサポートしないプロンプトで条件付けられたレスポンス間のログライクなギャップを直接最適化する。
論文 参考訳(メタデータ) (2026-02-02T12:21:59Z) - Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval [49.85856484781787]
本稿では,ILMエージェントを検索プロセスのアクティブマニピュレータに高める新しいパラダイムであるInteract-RAGを紹介する。
我々は、ゼロショット実行と相互作用軌跡の合成を可能にする推論強化ワークフローを開発する。
6つのベンチマーク実験により、Interact-RAGは他の高度な手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-10-31T15:48:43Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - STARec: An Efficient Agent Framework for Recommender Systems via Autonomous Deliberate Reasoning [54.28691219536054]
我々は、自律的な熟考的推論機能を備えたレコメンデータシステムを支援する、ゆっくり考えられた拡張エージェントフレームワークSTARecを紹介する。
我々は,先進的推論モデルと嗜好整合型報酬形成から構造化知識の蒸留を組み合わせた2段階のパラダイムであるアンカー強化訓練を開発する。
MovieLens 1MとAmazon CDsベンチマークの実験では、STARecは最先端のベースラインと比較して、大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-08-26T08:47:58Z) - Resisting Contextual Interference in RAG via Parametric-Knowledge Reinforcement [9.66890519317288]
Retrieval-augmented Generation (RAG)は、知識集約的なタスクのパフォーマンスを向上させるが、間違った、無関係、あるいは、検索されたテキストの矛盾によって脱線することができる。
本稿では,大規模言語モデルにパラメトリック知識を用いた強化学習フレームワークであるKnowledgeable-R1を提案する。
論文 参考訳(メタデータ) (2025-06-05T15:34:15Z) - Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization [75.1240295759264]
本稿では,BMC という名前のペアデータにおけるブリッジ・アンド・モデリングの効果的なフレームワークを提案する。
目的の修正によって、ペアの選好信号の一貫性と情報性が向上する。
DPOだけではこれらの相関をモデル化し、ニュアンス付き変動を捉えるには不十分である。
論文 参考訳(メタデータ) (2024-08-14T11:29:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。