論文の概要: BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics
- arxiv url: http://arxiv.org/abs/2608.16211v1
- Date: Mon, 17 Aug 2026 07:44:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.579968
- Title: BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics
- Title(参考訳): BaT: ステージゴムを用いた自己進化型医療研究エージェントを目指して
- Abstract要約: エージェントポストトレーニングのための自己改善システムであるBenchmark-as-Teacher(BaT)を提案する。
BaTには非同期のStage BankデータパイプラインとBiCuRLという2つのリンクコンポーネントが含まれている。
AutoMedBench-Lite、BaT-4B、BaT-9BはQwen Instructベースラインのスコアの2倍以上だった。
- 参考スコア(独自算出の注目度): 34.53669187809908
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Long-horizon agents are beginning to automate complete workflows that produce code, reports, and research artifacts. Medical imaging workflows are multi-stage and data-sensitive, while expert trajectories remain scarce and difficult to share. Structured benchmarks can localize failures through stage-level rubrics, but standard post-training discards these diagnostics before the next training round. We present Benchmark-as-Teacher (BaT), a recursive self-improvement system for agent post-training. BaT contains two linked components: the asynchronous Stage Bank data pipeline and BiCuRL (Bilevel Curriculum Reinforcement Learning), its self-improving post-training method. Stage Bank synthesizes content-isolated training states outside the policy-update loop. BiCuRL uses a fixed held-out evaluation to select the next stage curriculum, verifies rollouts with task rubrics, updates the policy with GRPO, and returns the candidate checkpoint to evaluation. On AutoMedBench-Lite, BaT-4B and BaT-9B more than double the Overall scores of their Qwen Instruct baselines. BaT-9B Agent reaches 79.6 Overall, exceeding Claude Opus 4.6 with Claude Code at 77.5.
- Abstract(参考訳): ロングホライゾンエージェントは、コード、レポート、研究成果物を生成する完全なワークフローを自動化し始めている。
医療画像のワークフローは多段階的でデータに敏感だが、専門家の軌跡は乏しく共有が難しい。
構造化ベンチマークはステージレベルのルーリックを通じて障害をローカライズするが、標準のポストトレーニングでは、次のトレーニングラウンドの前にこれらの診断を破棄する。
エージェントポストトレーニングのための再帰的自己改善システムであるBenchmark-as-Teacher(BaT)を提案する。
BaTには非同期のStage BankデータパイプラインとBiCuRL(Bilevel Curriculum Reinforcement Learning)の2つのリンクコンポーネントが含まれている。
Stage Bankは、ポリシー更新ループの外で、コンテンツ分離されたトレーニングステートを合成する。
BiCuRLは、固定されたホールドアウト評価を使用して、次の段階のカリキュラムを選択し、タスクルーリックによるロールアウトを検証し、GRPOでポリシーを更新し、候補チェックポイントを評価に返却する。
AutoMedBench-Lite、BaT-4B、BaT-9BはQwen Instructベースラインのスコアの2倍以上だった。
BaT-9B Agentは79.6点に達し、Claude Opus 4.6を上回り、Claude Codeは77.5点に達した。
関連論文リスト
- NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness [76.6324710887112]
NeoHorse-1は、エージェントのポストトレーニングを通じてこの経路を探索するために開発されたエージェントネイティブモデルのファミリーである。
本システムでは,異種モデルプールとインテリジェントなルーティング,予測能力要求,選択されたサービス層,およびその後のユーザ毎のインタラクションを結合する。
論文 参考訳(メタデータ) (2026-09-08T03:14:54Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks [18.870142584352703]
自己進化は、エージェントの永続状態を以前の経験から更新し、関連するタスクを解決するために再利用する。
GDPevoは、GDP関連の企業で開発された進化ネイティブなベンチマークである。
GDPevoはCRM、ERP、金融、医療、法律、データ中心主義にまたがっている。
論文 参考訳(メタデータ) (2026-08-04T14:51:56Z) - LoopsBench: From Harness Engineering to Loop Engineering in Benchmarking Coding Agent [60.27239351179265]
LOOPSBENCHは、符号化エージェント評価におけるループエンジニアリングのベンチマークである。
8つのプログラミング言語と9つのドメインにまたがる、本物のソースからの112のタスクで構成されている。
フロー対応ランタイムは、準備されたフロンティアに沿ってテストをリリースし、レグレッション義務として完了したノードを保持します。
論文 参考訳(メタデータ) (2026-07-31T20:18:25Z) - Cross-Benchmark Generalization in Long-Horizon Agents [1.0742728354283815]
我々は,27のカテゴリにわたる363の長距離モデルコンテキストプロトコル(MCP)タスク上で,オープンウェイト・ミックス・オブ・エキスパート・モデルを構築した。
トレーニングには外部ベンチマークタスクやグレーダが入らず、報酬、ハイパーパラメータのトレーニング、トレーニングされたチェックポイントの選択、停止を外部スコアが知らせなかった。
両方のソフトウェアベンチマークは、ソフトウェアエンジニアリングタスクを含まないトレーニングコレクションにもかかわらず改善されている。
論文 参考訳(メタデータ) (2026-07-31T18:05:36Z) - DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines [9.38656029481013]
我々は,LLMエージェントを案内して,プラットフォームネイティブな非巡回グラフを構築するプラットフォームであるtextscDataFlow-Harnessを紹介した。
12タスクのデータエンジニアリングベンチマークでは、textscDataFlow-Harnessが93.3%のエンドツーエンドパスレートを達成した。
論文 参考訳(メタデータ) (2026-07-18T03:30:19Z) - Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages [51.86479668480496]
私たちは、現在のLLMトレーニングパイプラインの、成長を続ける多くのステージに対して、どのようにより効率的にスケールするかという問題に取り組みます。
オフライン報酬条件強化学習に触発されたイントロスペクティブトレーニング(IXT)を提案する。
IXTは思考報酬モデルを使用して、自然言語の批判に基づくフィードバックでデータを注釈付けし、パイプラインの初期段階から品質に配慮したトレーニングを可能にする。
論文 参考訳(メタデータ) (2026-05-19T06:04:08Z) - DataPrep-Bench: Benchmarking LLMs as Training Data Preparators [35.76000147244654]
データ構築とデータ品質評価を共同で評価する最初の統合ベンチマークであるDataPrep-Benchを紹介する。
データ構築には、同一の原料を消費し、Dlly-15kと共同で出力のベースモデルを微調整する。
データ品質評価において、スコアリング関数は、共有候補プールの下流性能とピアソン相関によりスコアされる。
論文 参考訳(メタデータ) (2026-05-19T02:23:53Z) - SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [41.98672557723593]
SWEQA-Proは,多種多様な長期リポジトリと実行可能な環境から構築されたベンチマークである。
さらに,2段階のトレーニングレシピであるSupervised Fine-Tuning(SFT)とReinforcement Learning from AI Feedback(RLAIF)という,スケーラブルな合成データパイプラインを提案する。
SWE-QA-ProのGPT-4oを2.3ポイント超え、最先端モデルとのギャップを大幅に狭める。
論文 参考訳(メタデータ) (2026-03-17T05:12:48Z) - Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains [97.5573252172065]
自動推論評価器(FARE)のファミリーを,簡易な反復的リジェクションサンプリング制御による微調整手法で訓練する。
FARE-8Bはより大型のRL訓練評価器に挑戦し、FARE-20Bはオープンソース評価器の新しい標準となる。
推論時リランカとして、FARE-20BはMATH上でのニアオークル性能を達成する。
論文 参考訳(メタデータ) (2025-10-20T17:52:06Z) - Self-training Improves Pre-training for Natural Language Understanding [63.78927366363178]
我々は、半教師付き学習を通じてラベルのないデータを活用する別の方法として、自己学習について研究する。
本稿では,ラベル付きデータからタスク固有のクエリの埋め込みを計算するデータ拡張手法であるSentAugmentを紹介する。
我々のアプローチは、標準的なテキスト分類ベンチマークで最大2.6%の改善を達成し、スケーラブルで効果的な自己学習に繋がる。
論文 参考訳(メタデータ) (2020-10-05T17:52:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。