論文の概要: TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards
- arxiv url: http://arxiv.org/abs/2609.10315v1
- Date: Wed, 09 Sep 2026 15:21:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:09.080551
- Title: TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards
- Title(参考訳): TRACE:シンセシド・リワードを用いた因果探索のための推論エージェントの訓練
- Abstract要約: 検証可能な報酬付き強化学習(RLVR)は、数学やコードなどの分野において高度な言語モデル推論を持つ。
この検証の非対称性を設計できるかどうかを問う。
本手法は,12の根本原因と細粒度セグメント属性を有するデジタル広告診断環境であるTRACEで実現した。
- 参考スコア(独自算出の注目度): 15.908097225313968
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has advanced language-model reasoning in domains such as mathematics and code, where objective answers are inexpensive to check. Diagnostic reasoning over complex data lacks this advantage: establishing the true cause of an anomaly often requires costly expert investigation and may remain ambiguous after the fact. We ask whether this asymmetry of verification can instead be engineered. We sample an intervention, inject it into a controlled simulator, and generate the observations it would produce. The hidden intervention provides an oracle label and objective reward, while the agent must still investigate noisy, confounded, and distributed evidence. We instantiate this approach in TRACE, a digital-advertising diagnostic environment with 12 root causes and fine-grained segment attribution. Agents investigate each episode using Python and SQL and must identify both the root cause and, when applicable, the affected segment assignment. On a held-out 235-episode test set, the strongest prompted baseline, Claude Opus 5, reaches 0.686 FullAttr@1. Supervised fine-tuning raises Qwen3.5-35B-A3B from 0.159 to 0.637, and subsequent RL with synthesized rewards reaches 0.757, outperforming all evaluated prompted baselines, including frontier closed-source models and a prompted Qwen3.5-122B-A10B model. The resulting policy also uses substantially fewer tool calls than the prompted 35B base. These results provide evidence that access to a scalable, objective training signal can be a more important constraint than model scale alone. More broadly, simulation-based verification can make otherwise ambiguous diagnostic reasoning tasks amenable to scalable reinforcement learning.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、客観的な回答が安価にチェックできる数学やコードなどの領域において、高度な言語モデル推論を持つ。
複雑なデータに対する診断的推論は、この利点を欠いている: 異常の真の原因を確立するには、しばしば費用がかかる専門家による調査が必要であり、事実の後にあいまいなままである。
この検証の非対称性を代わりに設計できるかどうかを問う。
我々は介入をサンプリングし、それを制御されたシミュレータに注入し、それが生成する観測結果を生成する。
隠された介入は、神託のラベルと客観的報酬を提供するが、エージェントは未だにうるさい、確立された証拠、そして分散された証拠を調査しなければならない。
本手法は,12の根本原因と細粒度セグメント属性を有するデジタル広告診断環境であるTRACEで実現した。
エージェントはPythonとSQLを使用して各エピソードを調査し、根本原因と、適用可能な場合、影響を受けるセグメント割り当ての両方を特定する必要がある。
ホールドアウトされた235エピソードテストセットでは、最強のベースラインであるClaude Opus 5が0.686 FullAttr@1に達した。
改良された微調整によりQwen3.5-35B-A3Bは0.159から0.637に上昇し、その後に合成された報酬を持つRLは0.757に達し、フロンティアのクローズドソースモデルやQwen3.5-122B-A10Bモデルを含む全ての評価されたベースラインを上回った。
結果として得られたポリシーは、誘導された35Bベースよりもはるかに少ないツールコールを使用する。
これらの結果は、スケーラブルで客観的なトレーニング信号へのアクセスが、モデルスケール単独よりも重要な制約であることを示す。
より広範に、シミュレーションベースの検証は、拡張性強化学習に適した、あいまいな診断推論タスクを可能にする。
関連論文リスト
- AREX: Towards a Recursively Self-Improving Agent for Deep Research [75.96468303743958]
本稿では,再帰的自己改善型ディープリサーチエージェントであるAREXを紹介する。
AREXは、証拠を集め、暫定的な回答を構築する内部研究ループを交互に構成する。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
論文 参考訳(メタデータ) (2026-07-23T16:05:46Z) - When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion [0.0]
検証可能な報酬(RLVR)を用いた強化学習は、繰り返しサンプリング時にモデルを悪化させながら、一サンプル精度を向上させることができる。
トレーニング後、このポリシーはベースモデルよりも小さな問題を、大きな$k$で解決する可能性がある。
失敗は境界プロンプトに集中しており、ベースモデルにはサンプリングによって回復できる稀な正しい軌道が含まれており、有限のRLVRロールアウトグループに確実に現れるには小さすぎる。
論文 参考訳(メタデータ) (2026-07-12T17:17:18Z) - Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection [80.15317858033534]
ForeAgentは、反復的な自己進化を伴うAI生成画像検出のためのエージェント法医学フレームワークである。
ForeAgentはChameleonベンチマークで最先端のパフォーマンスを達成し、精度は82.18%に達した。
ForeAgent は GPT-5 や GPT-5-mini と比較して、より一貫性があり、因果的な推論をもたらす。
論文 参考訳(メタデータ) (2026-06-25T02:59:33Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents [0.0]
小さな言語モデルからの正しい回答の50~69%は、根本的な欠陥のある推論を含んでいる。
本稿では,レイタ間合意を実質的に検証したプロセスベース計量であるReasoning Integrity Score(RIS)を紹介する。
メタ認知は十分なモデルキャパシティを伴わずに混乱を増幅するのに対し、RAGは外部のエビデンスに基礎を置き、エラーを7.6%削減する。
論文 参考訳(メタデータ) (2026-01-01T23:54:15Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning [54.30630356786752]
ReasonMedは、これまでで最大の医療推論データセットで、370万の高品質な例がある。
マルチエージェント生成、検証、改善プロセスを通じて構築される。
ReasonMedを用いて、簡潔な答えの要約と詳細なCoT推論を統合することで、最も堅牢な微調整結果が得られる。
論文 参考訳(メタデータ) (2025-06-11T08:36:55Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning [65.2421542320293]
推論能力は汎用知能の重要な構成要素である。
OpenAIのoシリーズモデルなどのプロプライエタリ企業による最近の進歩は、推論タスクに顕著な進歩をもたらした。
本稿では、数学的推論タスクのための textbfOutcome textbfREwtextbfArd ベースの強化 textbfLearning により達成できる性能限界を追求する新しい RL フレームワーク OREAL を提案する。
論文 参考訳(メタデータ) (2025-02-10T18:57:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。