論文の概要: RLE-Bench: A Qualifying Exam for Coding Agents as Robot Learning Engineers
- arxiv url: http://arxiv.org/abs/2609.34210v2
- Date: Tue, 29 Sep 2026 05:16:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.722741
- Title: RLE-Bench: A Qualifying Exam for Coding Agents as Robot Learning Engineers
- Title(参考訳): RLE-Bench: ロボット学習技術者としてのコーディングエージェントのためのクオリティエグザム
- Abstract要約: エージェントは、異質なアーティファクトを構築し、統合し、診断し、改善しなければならない。
RLE-Benchは、インタラクティブ制御、ポリシー学習、知覚と推定、機械設計の4つのロボット開発にまたがるロボット学習タスクのベンチマークである。
我々は、エージェントが訓練した政策エージェントに達成した成功率、ハーネスエージェントの構築、そしてエージェントが設計した機械構造から、コーディングエージェントが提出したアーティファクトを評価するために、多様なタスク固有のメトリクスを使用します。
- 参考スコア(独自算出の注目度): 15.762203715830955
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents are beginning to move beyond purely digital tasks to tackle physical-world challenges, particularly in robotics. Existing robotics benchmarks, however, primarily focus on the performance of individual artifacts, such as policies or controllers, offering limited coverage of coding agents' broader engineering capabilities. Real-world robotics extends beyond control: agents must build, integrate, diagnose, and improve heterogeneous artifacts under resource constraints and reason from multimodal feedback. To evaluate these broader capabilities, we introduce RLE-Bench, a benchmark of robot-learning tasks spanning four representative robotics development workflows: interactive control, policy learning, perception and estimation, and mechanical design. We use diverse task-specific metrics to evaluate the artifacts submitted by the coding agents, from the success rate the agents achieved to the policy agents trained, the harness agent built, and the mechanical structures the agent designed. We aggregate these metrics into an overall RLE Index and report workflow-specific capability profiles, enabling systematic comparison of coding agents' capabilities across multiple capability dimensions. Beyond performance ranks, we also conduct in-depth case studies examining agent behavior on representative tasks, highlighting both current capabilities and limitations, and pointing to the opportunities robotics tasks have to offer for future agent training.
- Abstract(参考訳): コーディングエージェントは、純粋にデジタルなタスクを超えて、特にロボット工学における物理的な課題に取り組み始めている。
しかし、既存のロボティクスベンチマークは、主にポリシーやコントローラのような個々のアーティファクトのパフォーマンスに焦点を当てており、コーディングエージェントの幅広いエンジニアリング能力を限定的にカバーしている。
エージェントはリソース制約の下で異質なアーティファクトを構築し、統合し、診断し、改善する必要がある。
これらより広範な機能を評価するために、インタラクティブ制御、ポリシー学習、知覚と推定、機械設計の4つのロボット開発ワークフローにまたがるロボット学習タスクのベンチマークであるRLE-Benchを紹介した。
我々は、エージェントが訓練した政策エージェントに達成した成功率、ハーネスエージェントの構築、そしてエージェントが設計した機械構造から、コーディングエージェントが提出したアーティファクトを評価するために、多様なタスク固有のメトリクスを使用します。
これらのメトリクスを総合的なRLEインデックスに集約し、ワークフロー固有の機能プロファイルを報告し、複数の機能ディメンションにわたるコーディングエージェントの機能の体系的な比較を可能にします。
パフォーマンスランキング以外にも、エージェントの動作を代表的タスクで詳細に調査し、現在の能力と限界の両方を強調し、ロボット工学のタスクが将来のエージェントトレーニングにもたらす機会を指摘する。
関連論文リスト
- EmbodiedSWE: Coding Agents for Long Horizon Dexterous Robotics [41.54412649343374]
本研究は, ロボット工学の長期化を図り, 汎用的なロボットポリシーを学習するための拡張性のある監視を行うことができるかどうかを問うものである。
EMBODIEDSWE-BENCHは、コンタクトリッチな操作、変形可能なオブジェクト、長距離タスクにまたがる符号化エージェントのシミュレーションベンチマークである。
符号化エージェント生成シミュレーションにのみ焦点を絞ったVLAが,実ロボットの長時間作業を完成させることを示す。
論文 参考訳(メタデータ) (2026-09-23T03:38:58Z) - Humans are Missing from AI Coding Agent Research [116.47136146149226]
我々は、自律的なプログラミングエージェントから人間中心のコーディングエージェントへの方向転換を主張する。
課題解決ループを特徴付ける4つの中核的相互作用レベルを同定する。
論文 参考訳(メタデータ) (2026-07-04T01:24:03Z) - RoboWits: Unexpected Challenges for Robotic Creative Problem Solving [58.58727722988084]
我々は、認知的推論、創造的ツールの使用、予期しない状況に対する堅牢性を評価するために設計された、双方向のロボットベンチマークであるRoboWitsを紹介する。
このパイプラインを用いて,30種類の種タスクと208のタスクを,幾何学的,物質的,集合的推論にまたがる変異と難易度でキュレートした。
プレトレーニングされたVLAは,単一タスクの微調整後にシードタスクに予備的な成功を示すが,変異タスクの実行に苦慮している。
論文 参考訳(メタデータ) (2026-05-28T17:57:15Z) - A Hierarchical Agentic Framework for Autonomous Drone-Based Visual Inspection [1.7165503847488661]
本稿では,自律型ドローン制御のための階層型エージェントフレームワークと,個別機能実行のための推論手法を提案する。
本フレームワークは,産業用リードアウトの解釈や検査機器の検査など,屋内産業環境での視覚的検査作業に重点を置いている。
自然言語処理をエージェント通信に活用することにより、従来のドローンベースのソリューションに代わる、斬新で柔軟な、ユーザアクセス可能な代替手段を提供する。
論文 参考訳(メタデータ) (2025-09-30T20:31:30Z) - From Virtual Agents to Robot Teams: A Multi-Robot Framework Evaluation in High-Stakes Healthcare Context [2.016235597066821]
現在のフレームワークは、エージェントを物理的に具体化されたエンティティではなく、概念的なタスク実行子として扱う。
本稿では,プロセスの透明性,前向きな障害回復,コンテキストグラウンド化を重視した3つの設計ガイドラインを提案する。
我々の研究は、よりレジリエントで堅牢なマルチエージェントロボットシステムの開発を知らせる。
論文 参考訳(メタデータ) (2025-06-04T04:05:38Z) - TaskBench: Benchmarking Large Language Models for Task Automation [82.2932794189585]
タスク自動化における大規模言語モデル(LLM)の機能を評価するためのフレームワークであるTaskBenchを紹介する。
具体的には、タスクの分解、ツールの選択、パラメータ予測を評価する。
提案手法は, 自動構築と厳密な人的検証を組み合わせることで, 人的評価との整合性を確保する。
論文 参考訳(メタデータ) (2023-11-30T18:02:44Z) - RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation [68.70755196744533]
RoboGenはジェネレーティブなロボットエージェントで、ジェネレーティブなシミュレーションを通じて、さまざまなロボットのスキルを自動的に学習する。
我々の研究は、大規模モデルに埋め込まれた広範囲で多目的な知識を抽出し、それらをロボット工学の分野に移す試みである。
論文 参考訳(メタデータ) (2023-11-02T17:59:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。