論文の概要: LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
- arxiv url: http://arxiv.org/abs/2608.28281v1
- Date: Fri, 28 Aug 2026 12:44:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.333023
- Title: LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
- Title(参考訳): LoopArena: ループエンジニアリングのランタイムコントローラとしてのベンチマークモデル
- Abstract要約: コーディングエージェントを中心とした開発作業を組織化するためのプラクティスとして,ループエンジニアリングが登場している。
LoopArenaは、1つのモデルが、長時間実行中のタスクを通じて、個別のコーディングエージェントをいかにうまくガイドできるかを評価するためのベンチマークです。
- 参考スコア(独自算出の注目度): 47.39676953516343
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Loop Engineering is emerging as a practice for organizing development work around coding agents. Instead of writing each prompt by hand, practitioners design loops that monitor progress, assign work, run checks, and decide what the agent should do next. Even with a capable coding agent, a loop may trust a stale progress note, skip needed verification, spend its budget in the wrong direction, or stop before the task is safe to submit. Yet the final outcome of one end-to-end run cannot tell whether success or failure reflects the loop's guidance or the coding agent's ability to carry out the task. We introduce LoopArena, a benchmark for evaluating how well one model can guide a separate coding agent through a long-running task. The model under evaluation is the \textbf{Controller}: after each coding round, it receives a structured summary of the run and instructs a separate, fixed coding agent, the \textbf{Worker}, on what to do or verify next, or decides whether to stop. LoopArena evaluates this ability in three complementary settings that differ in execution scope and cost. Type I scores next-step Loop Contract selection through execution-validated questions without running the Worker at evaluation time. Type II executes repeated control over a selected slice of a full task, while Type III evaluates the paired full task from its original state. On full tasks, the best observed Strict Success Rate is \textbf{24.69\%}, leaving substantial room for improvement in long-horizon loop control. Across Controllers, the paired reduction in estimated inference cost averages \textbf{64.4\%}, and Type II produces a similar ordering under the main Core criterion (Spearman's \(ρ=\textbf{0.9747}\)). We release the benchmark data and evaluation code at https://github.com/AMAP-ML/LoopArena .
- Abstract(参考訳): コーディングエージェントを中心とした開発作業を組織化するためのプラクティスとして,ループエンジニアリングが登場している。
各プロンプトを手書きする代わりに、プロンプトの進捗を監視し、作業の割り当て、チェックの実行、次にエージェントが何をすべきかを決めるループを設計する。
有能なコーディングエージェントであっても、ループは古い進捗ノートを信頼したり、必要な検証をスキップしたり、予算を間違った方向に費やしたり、タスクが安全に送信される前に停止することがある。
しかし、一方のエンドツーエンド実行の最終結果は、成功と失敗がループのガイダンスやコーディングエージェントのタスク実行能力に反映しているかどうかを判断できない。
LoopArenaは、1つのモデルが、長時間実行中のタスクを通じて、個別のコーディングエージェントをいかにうまくガイドできるかを評価するためのベンチマークです。
評価中のモデルは、 \textbf{Controller} である: 各コーディングラウンドの後に、実行の構造化された要約を受け取り、次に何をするか、検証するか、あるいは停止するかを個別の固定されたコーディングエージェントである \textbf{Worker} に指示する。
LoopArenaは、実行範囲とコストが異なる3つの補完的な設定で、この機能を評価する。
Type Iは、評価時にWorkerを実行することなく、実行検証された質問を通じて、次のステップのLoop Contract選択をスコアする。
Type IIは、選択されたフルタスクのスライスに対して繰り返し制御を実行するが、Type IIIは、ペア化されたフルタスクを元の状態から評価する。
完全なタスクでは、最もよく観察される Strict Success Rate は \textbf{24.69\%} であり、長い水平ループ制御の改善の余地を残している。
コントローラ全体では、推定推論コスト平均の対の削減平均は \textbf{64.4\%} であり、タイプII は主要なコア基準の下でも同様の順序付けを生成する(Spearman の \(ρ=\textbf{0.9747}\)。
ベンチマークデータと評価コードはhttps://github.com/AMAP-ML/LoopArenaで公開しています。
関連論文リスト
- Iris: Climbing to the Search Frontier [21.066541702697112]
我々は35B-A3Bスケールと397B-A17Bスケールでトレーニングされた2つの検索エージェントであるIris-miniとIris-proを紹介する。
論文 参考訳(メタデータ) (2026-09-03T17:51:01Z) - Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection [51.39973047614183]
本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
$textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTaskは、情報的タスクの選択と、部分的な評価からフルセットのパフォーマンスの推定という2つの課題に対処することで、ハーネスでバリデーションタスクを共進化させる。
論文 参考訳(メタデータ) (2026-08-20T15:24:54Z) - LoopsBench: From Harness Engineering to Loop Engineering in Benchmarking Coding Agent [60.27239351179265]
LOOPSBENCHは、符号化エージェント評価におけるループエンジニアリングのベンチマークである。
8つのプログラミング言語と9つのドメインにまたがる、本物のソースからの112のタスクで構成されている。
フロー対応ランタイムは、準備されたフロンティアに沿ってテストをリリースし、レグレッション義務として完了したノードを保持します。
論文 参考訳(メタデータ) (2026-07-31T20:18:25Z) - OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation [41.885817564161975]
シミュレーションに基づくマルチエージェントオーケストレーション計画評価ベンチマークであるOrchBenchについて述べる。
決定論的シミュレータは、労働者エージェントを呼び出すことなく、結果の計画を評価し、結果の質、メースパン、トークンコストの解釈可能な尺度を返す。
多様なプランナーやワークフローの規模で見ると、単にエージェントの数を増やすよりも、タスククリティカルな情報を保存することが重要であることが分かります。
論文 参考訳(メタデータ) (2026-07-28T12:43:34Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data [4.191965713559235]
コーディングエージェントは、スコアに対してソフトウェアを改善するために、単独で残すことができます。
このパターンでは、エージェントはデータセット、評価スクリプト、編集可能な1つのファイルを受け取り、監督なしで反復する。
このループを実際の生産タスクで実行し、ノイズの多い音声認識書面にどのクラニック詩が現れるかを決定しました。
論文 参考訳(メタデータ) (2026-07-20T15:32:09Z) - CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents [5.604484678527336]
CLOSER-Bench (CLOSER-Bench) は、予算付きクロスステージ設計クロージャのための制御された評価プロトコルである。
Spec-to-RTL、RTL-to-GDS、Spec-to-GDSタスクを組み合わせ、すべてのシミュレータ、合成、STA、プレース・アンド・ルートの呼び出しを記録する。
最終品質、任意の進捗状況、ツールコスト、ステージ間のリカバリを測定します。
論文 参考訳(メタデータ) (2026-07-18T04:28:47Z) - LACUNA: Safe Agents as Recursive Program Holes [3.2613419151327343]
LLMエージェントはますますコードを記述することで振る舞うが、エージェントを駆動するランタイムとモデルが記述するコードの間には分割が持続する。
我々は、安全性を維持しながら、この分割を閉じるエージェントのためのプログラミングモデルであるLACUNAを紹介する。
我々のプリミティブは、通常の制御フローとしてReActループ、サブエージェント、スキル、並列分解、マルチモデル計画を表現する。
論文 参考訳(メタデータ) (2026-05-27T15:27:25Z) - ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning [9.137158235106941]
ExecVerifyは、実行トレースから得られた検証済みのホワイトボックス報酬を組み込むことで、テキストの模倣を越えている。
ExecVerifyでトレーニングされた7Bモデルは、コード推論ベンチマークで32Bモデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T18:49:45Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - Rethinking Thinking Tokens: LLMs as Improvement Operators [80.12087211785949]
推論トレーニングは、LLMに長い思考の連鎖(長いCoT)を生み出す動機を与え、自己チェックによるソリューション戦略を探索することを可能にする。
これにより、精度が高くなりますが、コンテキストの長さ、トークン/計算コスト、応答レイテンシが膨らみます。
現在のモデルはメタ認知を活用して、このParetoフロンティアで他の組み合わせを提供できるのでしょうか?
i) 多様なドラフトを並列に生成し、(ii) それらを有界なテキストワークスペースに蒸留し、(iii) このワークスペース上に条件付き精製する。
論文 参考訳(メタデータ) (2025-10-01T17:08:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。