論文の概要: Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows
- arxiv url: http://arxiv.org/abs/2607.01465v1
- Date: Wed, 01 Jul 2026 20:55:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.591205
- Title: Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows
- Title(参考訳): 次世代予測を超えて - Atlassianのワークフロー上でのツール使用エージェントの概念のRLVR証明
- Authors: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji,
- Abstract要約: RLVR(Reinforcement Learning with Verifiable Rewards)は、ターゲット環境に直接適用される。
リワードはツールコールトレースから完全に計算され、ライブAPI、学習された判断、ループ内の人間ラベルがない。
報奨が非退化である4つのシナリオにおいて、RL訓練されたポリシーは平均報酬を0.35--0.92から0.95--1.00まで引き上げる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are trained to predict the next token, not to act inside a specific API. In niche enterprise SaaS workflows -- where success means hitting the right endpoint with the right nested arguments in the right order -- this objective mismatch shows up as silent failures: dropped required fields, hallucinated tools, or early stops after a single read. We ask whether Reinforcement Learning with Verifiable Rewards (RLVR), applied directly in the target environment, closes the gap. As a proof of concept we build a suite of five synthetic environments emulating the Jira REST v3 and Confluence v2 APIs at schema fidelity; rewards are computed entirely from the tool-call trace, with no live API, no learned judge, and no human label in the loop. Scoring prompted Qwen3-1.7B and Qwen3.5-4B on the same checkers that drive GRPO training, we find that on the four scenarios whose rewards are non-degenerate the RL-trained policy lifts average reward from a 4B-baseline range of 0.35--0.92 to 0.95--1.00, with the largest single gain on Confluence page creation ($0.35 \rightarrow 1.00$). We position this as a preliminary step toward outcome-optimised small models for niche enterprise APIs, and foreground two limitations a workshop reader should weigh: hand-crafting verifiable rewards does not scale beyond the handful of endpoints reported here, and one of our five scenarios (ticket-transition) has a saturating reward shape that the prompted 4B already maxes out.
- Abstract(参考訳): 大規模な言語モデルは、特定のAPI内で動作するのではなく、次のトークンを予測するようにトレーニングされる。
ニッチなエンタープライズSaaSワークフロー -- 成功とは、正しい順序で正しいネストされた引数で正しいエンドポイントに到達することを意味する -- では、この客観的なミスマッチは、サイレントな失敗として現れます。
対象環境に直接適用するRLVR(Reinforcement Learning with Verifiable Rewards)がギャップを埋めるかどうかを問う。
概念実証として、Jira REST v3とConfluence v2 APIをスキーマの忠実度でエミュレートする5つの合成環境のスイートを構築します。
Qwen3-1.7B と Qwen3.5-4B は、GRPO トレーニングを推進している同じチェッカー上で、報酬が非退化している4つのシナリオにおいて、RL トレーニングされたポリシーは、平均的な報酬を 0.35-0.92 から 0.95--1.00 の 4B ベースラインの範囲に引き上げ、 Confluence ページの作成において最大の利益(0.35 \rightarrow 1.00$)を得る。
これはニッチなエンタープライズAPIのための結果最適化された小さなモデルに向けた予備的なステップであり、ワークショップ読者が考慮すべき2つの制限である: 手作りの検証可能な報酬は、ここで報告された少数のエンドポイントを超えてスケールしない。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - NITP: Next Implicit Token Prediction for LLM Pre-training [62.744626632562664]
本研究では,表現空間に直接集中的監督を施した離散予測を増大させるために,Next Implicit Token Prediction (NITP)を提案する。
NITPは、安定な自己教師対象と同じモデルから浅層表現を用いて、次のトークンの暗黙的なセマンティック内容を予測するようにモデルを訓練する。
実験的には、0.5Bから9Bのパラメータを含む高密度モデルとMoEモデルにまたがって、NITPは無視できる計算オーバーヘッドでダウンストリーム性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-24T09:13:12Z) - You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories [23.542887618146988]
検証可能な報酬(RLVR)を用いた強化学習は極めて低ランクであり,予測可能性が高いことを示す。
本稿では,短時間の観測窓からランク1部分空間を推定する,単純で計算効率のよいRELEXを提案する。
注目すべきは、RELEXはトレーニングコストなしで観測窓をはるかに越えることができることだ。
論文 参考訳(メタデータ) (2026-05-20T17:53:20Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection [0.0]
SpecKVは軽量適応型コントローラで、ドラフトモデル自体から抽出した信号を使って投機1歩あたり$を選択できる。
圧縮レジーム間の最適な$$シフトと、ドラフトモデルの信頼性とエントロピーが受容率の強い予測因子であることを実証する。
論文 参考訳(メタデータ) (2026-05-04T17:55:05Z) - MolmoAct2: Action Reasoning Models for Real-world Deployment [67.6315757474802]
MolmoAct2は、実用的なデプロイメントのために構築された、完全にオープンなアクション推論モデルである。
空間的および具体的推論に特化した VLM バックボーンである MolmoER を紹介する。
低コストプラットフォームにまたがる3つの新しいデータセットをリリースする。
論文 参考訳(メタデータ) (2026-05-04T17:51:21Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning [65.2421542320293]
推論能力は汎用知能の重要な構成要素である。
OpenAIのoシリーズモデルなどのプロプライエタリ企業による最近の進歩は、推論タスクに顕著な進歩をもたらした。
本稿では、数学的推論タスクのための textbfOutcome textbfREwtextbfArd ベースの強化 textbfLearning により達成できる性能限界を追求する新しい RL フレームワーク OREAL を提案する。
論文 参考訳(メタデータ) (2025-02-10T18:57:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。