論文の概要: Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
- arxiv url: http://arxiv.org/abs/2609.24985v1
- Date: Mon, 21 Sep 2026 17:57:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.459639
- Title: Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
- Title(参考訳): 臨界状態RL:マルチTurnツール用トレーニング可能な状態の診断
- Abstract要約: マルチターンインタラクションにおけるトレーニング可能な状態を特定するために、Critical-State RLを導入する。
それぞれの報酬がタスク成功に対するアクションの効果を捉えているかどうか、参照ポリシーよりも改善できるかどうかを評価する。
Berkeley Function Calling Leaderboard (BFCL) v4の実験では、診断選択された州でのトレーニングと代替州でのトレーニングを比較している。
- 参考スコア(独自算出の注目度): 54.30773141960395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-turn tool-use failures can hinge on a single model call, yet reward variation alone does not reveal which call would benefit from training. When rewards depend on later interactions, their variation can reflect downstream randomness rather than differences between the current actions. We introduce Critical-State RL to identify trainable states in multi-turn interactions. Given task-defined candidate calls and local rewards, the method assesses whether each reward captures the action's effect on task success and whether improvement over a reference policy is possible. It then uses nested sampling to separate action-dependent reward variation from continuation noise and optimizes the policy at the selected states using contextual-bandit training. Experiments on the Berkeley Function Calling Leaderboard (BFCL) v4 compare training at diagnostic-selected states with training at alternative states. For missing-function tasks, the diagnostic selects the response after the tool becomes available; for missing-argument tasks, it selects the response before the missing argument is supplied. Training the selected responses improves performance, including about 14 percentage points on the missing-function task, while training the alternatives leaves performance flat or worse. We further apply the recipe across models and tasks, including logged repeat-call avoidance and memory management.
- Abstract(参考訳): マルチターンツール使用障害は、単一のモデルコールでヒンジすることができるが、報酬の変動だけでは、トレーニングの恩恵を受ける呼び出しを明らかにしない。
報酬が後の相互作用に依存する場合、その変動は現在の行動の違いよりも下流のランダム性を反映することができる。
マルチターンインタラクションにおけるトレーニング可能な状態を特定するために、Critical-State RLを導入する。
タスク定義された候補呼び出しと局所報酬が与えられた場合、各報酬がタスク成功に対するアクションの効果を捉え、参照ポリシーよりも改善できるかどうかを評価する。
次に、ネストサンプリングを使用して、継続ノイズからアクション依存報酬変動を分離し、コンテキスト帯域トレーニングを使用して選択された状態のポリシーを最適化する。
Berkeley Function Calling Leaderboard (BFCL) v4の実験では、診断選択された州でのトレーニングと代替州でのトレーニングを比較している。
不足機能タスクは、ツールが利用可能になった後に応答を選択し、不足機能タスクは、不足引数が供給される前に応答を選択する。
選択されたレスポンスのトレーニングでは、不足機能タスクの約14ポイントを含むパフォーマンスが向上し、代替のトレーニングではパフォーマンスがフラットか悪化する。
さらに、ログ化された繰り返し呼び出し回避やメモリ管理など、モデルやタスクにまたがってレシピを適用します。
関連論文リスト
- Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training [52.78248352851176]
強化学習(Reinforcement Learning, RL)は、大規模言語モデルにおける推論能力を引き出すための訓練後のパラダイムである。
本研究では,この残差軸をタスク学習可能性として検討する。
そこで我々はTrajValを提案する。TrajValは、短いプローブランと2つのエンドポイント評価からタスク毎の学習可能性を近似する軽量なプローブベース推定器である。
論文 参考訳(メタデータ) (2026-08-10T07:43:05Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z) - Same State, Different Task: Continual Reinforcement Learning without
Interference [21.560701568064864]
連続学習(CL)における主な課題は破滅的な忘れことであり、これは新しいタスクを学ぶ際に、以前にマスターされたタスクのパフォーマンスが低下したときに生じる。
干渉の有無で共有再生バッファを持つ単一ニューラルネットワーク予測器をベースとした既存のCL法が失敗することを示す。
本稿では,この課題に対処する簡単な方法であるOWLを提案する。OWLは,共有特徴抽出層を用いて因子化ポリシーを学習するが,それぞれが新しいタスクを専門とする分離ヘッドを学習する。
論文 参考訳(メタデータ) (2021-06-05T17:55:10Z) - Assessment of Reward Functions for Reinforcement Learning Traffic Signal
Control under Real-World Limitations [0.0]
本稿では,マンチェスター大都市圏のジャンクションシミュレーションにおいて,異なる報酬関数を用いたエージェントの性能を比較した。
速度の最大化により、すべての需要レベルにおいて平均待ち時間が最低となり、文献で紹介された他の報酬よりも性能が著しく向上したことが判明した。
論文 参考訳(メタデータ) (2020-08-26T15:47:15Z) - Quantifying Differences in Reward Functions [24.66221171351157]
2つの報酬関数間の差を直接定量化するために、等価・ポリティ不変比較(EPIC)距離を導入する。
EPIC は、常に同じ最適ポリシーを導出する報酬関数の同値類において不変であることを示す。
論文 参考訳(メタデータ) (2020-06-24T17:35:15Z) - Improving Multi-Turn Response Selection Models with Complementary
Last-Utterance Selection by Instance Weighting [84.9716460244444]
我々は、データリソース自体の根底にある相関を利用して、異なる種類の監視信号を導出することを検討する。
2つの公開データセットで広範な実験を行い、両方のデータセットで大幅に改善した。
論文 参考訳(メタデータ) (2020-02-18T06:29:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。