論文の概要: CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
- arxiv url: http://arxiv.org/abs/2608.06352v1
- Date: Thu, 06 Aug 2026 17:53:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.992729
- Title: CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
- Title(参考訳): CalibForge: 学習可能な端末タスクのスケーリングのための逆ソルバー校正
- Abstract要約: CalibForgeは、自律型ターミナルタスク合成システムである。
検証されたソルバの挙動を用いて、逆ソルバの校正によって候補タスクを修正する。
CalibForgeを使って5,431の端末タスクを構築します。
- 参考スコア(独自算出の注目度): 87.1086886770395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training terminal agents requires executable and verifiable tasks that are not merely solvable, but appropriately challenging for learning. Executable validation establishes feasibility, yet does not reveal how a task behaves relative to a given solver setting. In this paper, we present CalibForge, an autonomous terminal-task synthesis system that uses verified solver behavior to revise candidate tasks through adversarial solver calibration. Multi-solver calibration targets disagreement within a heterogeneous solver pool, whereas contrastive solver calibration targets a designated strong-pass/weak-fail relation; both operationalize a solver-relative learnable zone anchored in demonstrated solvability. Using CalibForge, we construct 5,431 calibrated terminal tasks. Our ablations show that both strategies yield more effective supervision than authoring and validation alone or ordinary single-solver feedback. Models trained on the full collection achieve 32.58% and 47.57% on Terminal-Bench 2.0. The largest improvements over the corresponding base model reach 24.71 percentage points on Terminal-Bench 2.0, 27.68 points on SWE-bench Pro, and 30.04 points on Doc2Repo. Together, these results support solver-relative learnability as a practical target for constructing effective and transferable agent training data.
- Abstract(参考訳): ターミナルエージェントの訓練には、単に解決可能なだけでなく、学習に適切な課題である実行可能かつ検証可能なタスクが必要である。
実行可能な検証は実現可能性を確立するが、与えられたソルバ設定に対してタスクがどのように振る舞うかは明らかにしない。
本稿では、検証されたソルバ動作を用いて、対向型ソルバ校正による候補タスクの修正を行う自動端末タスク合成システムであるCalibForgeについて述べる。
マルチソルバキャリブレーションは異種ソルバプール内の不一致を目標とし、対照的にコントラスト型ソルバキャリブレーションは指定された強パス/弱フェイル関係を対象とし、どちらも可解性を示すために固定されたソルバ相対学習可能なゾーンを運用する。
CalibForgeを使って5,431の校正端末タスクを構築します。
われわれは,両戦略が単独のオーサリングや検証,あるいは通常のシングルゾルバフィードバックよりも効果的に管理できることを示した。
完全なコレクションでトレーニングされたモデルは、ターミナルベンチ2.0で32.58%と47.57%に達する。
対応するベースモデルに対する最大の改善点は、ターミナルベンチ2.0で24.71ポイント、SWEベンチProで27.68ポイント、Doc2Repoで30.04ポイントに達した。
これらの結果は,効果的かつ伝達可能なエージェントトレーニングデータを構築するための実践的ターゲットとして,解法-相対的学習性をサポートする。
関連論文リスト
- TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents [41.82249291285459]
TRACEは、モデルウェイトを変更することなく、スキルベースのエージェントの行動知識を反復的に改善する。
GPT-5.5では、TRACEは一貫性(Pass3)を34.6ポイント改善し、59.9%から94.5%に改善した。
これらの結果から,TRACEは高モデルポテンシャルを安定かつ一貫した性能向上に変換することを示した。
論文 参考訳(メタデータ) (2026-08-24T04:36:03Z) - ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents [23.840537431318296]
エージェントが何を達成し、どのように達成するかを同時に測定するデュアルアセスメントベンチマークであるClawTrackを提示する。
ClawTrackは8つのドメインにわたる320のタスクと25以上の決定論的モックサービスで構成されている。
プロセスグレーダは、12,541のタスク固有の項目で固定された4次元(ゴールアライメント、効率性、情報利用、結果検証)に沿って各推論ターンをスコアする。
論文 参考訳(メタデータ) (2026-07-30T11:18:47Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents [52.758563996979596]
言語モデルエージェントは、マルチターンツールの使用によって現実的なタスクを解決するのにますます効果的である。
SENTINELは障害駆動型強化学習フレームワークで,障害のロールアウトを目標とするトレーニングタスクに変換する。
Tau2-Bench Retail with Qwen3-4B-Thinking-2507では、SENTINELはPass1を66.4から74.9に改善し、Passkメトリクス全体にわたる一般的な合成タスクにおいてRLを上回っている。
論文 参考訳(メタデータ) (2026-06-11T05:06:50Z) - Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills [12.442806027914097]
本稿では,エージェントの過去の解法トレースをトレーニング信号のソースとして再利用する,クローズドループ自己進化フレームワークであるSocratic-SWEを紹介する。
トレースを報酬計算の証拠としてのみ扱うのではなく、Socratic-SWEはそれらを、繰り返し発生する障害と効果的な修復パターンを要約した構造化されたエージェントスキルに蒸留する。
論文 参考訳(メタデータ) (2026-06-05T16:00:17Z) - MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination [0.0]
本稿では,MARGIN(Multi-Agent Grading via Incremental Normalisation)を提案する。
18の基盤モデル、8のベンチマーク、44,000以上の観測結果から、MARGINは分布シフト時の最良の設計時ベースラインよりも3-6倍低いキャリブレーション誤差を達成している。
論文 参考訳(メタデータ) (2026-05-21T18:25:05Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Heimdall: test-time scaling on the generative verification [2.662648783972914]
我々は,解の正しさを正確に判定できる長い CoT 検証 LLM である Heimdall を提案する。
純粋強化学習では、競争力のある数学の問題を62.5%から94.5%に向上する。
また,Heimdallの機能を拡張し,問題解決のスケールアップを図るため,Pessimistic Verificationを提案する。
論文 参考訳(メタデータ) (2025-04-14T15:46:33Z) - SolBench: A Dataset and Benchmark for Evaluating Functional Correctness in Solidity Code Completion and Repair [51.0686873716938]
コード補完モデルによって生成されたSolidityスマートコントラクトの機能的正しさを評価するベンチマークであるSolBenchを紹介する。
本稿では,スマートコントラクトの機能的正当性を検証するための検索拡張コード修復フレームワークを提案する。
その結果、コード修復と検索技術は、計算コストを削減しつつ、スマートコントラクト完了の正しさを効果的に向上することを示した。
論文 参考訳(メタデータ) (2025-03-03T01:55:20Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z) - V-STaR: Training Verifiers for Self-Taught Reasoners [71.53113558733227]
V-STaR はモデル生成解の正しさを判断する DPO を用いて検証器を訓練する。
複数のイテレーションでV-STaRを実行すると、徐々により良い推論器と検証器が得られる。
論文 参考訳(メタデータ) (2024-02-09T15:02:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。