論文の概要: Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction
- arxiv url: http://arxiv.org/abs/2606.11909v1
- Date: Wed, 10 Jun 2026 10:37:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-11 16:42:38.414033
- Title: Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction
- Title(参考訳): Embodied-BenchClaw: 身体的空間知能ベンチマーク構築のための自律的マルチエージェントシステム
- Authors: Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma,
- Abstract要約: Embodied-BenchClawは、エンボディされた空間知能ベンチマークを構築するための自律的なエージェントシステムである。
ユーザが指定した評価意図から、Embodied-BenchClawは、完全かつ継続的に更新可能なベンチマークパッケージを自動生成する。
- 参考スコア(独自算出の注目度): 11.402128645349379
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmarks are essential for evaluating embodied spatial intelligence, yet their construction is labor-intensive, hard to reuse, and difficult to maintain. Existing embodied benchmarks are often static and may quickly become saturated as models improve, limiting their ability to distinguish new capabilities. We propose Embodied-BenchClaw, an autonomous agentic system for constructing embodied spatial intelligence benchmarks. Given a user-specified evaluation intent, Embodied-BenchClaw automatically produces a complete and continually updatable benchmark package through a five-stage pipeline: intent blueprinting, data collection, structuring and cleaning, benchmark synthesis, and evaluation reporting. The pipeline is coordinated by three agents for planning, construction, and evaluation. To improve reusability and reliability, Embodied-BenchClaw introduces an extensible Skill Library and process quality control, enabling benchmark construction to be composable, verifiable, and repairable. We instantiate multiple benchmarks covering indoor spatial reasoning, outdoor spatial reasoning, robotic manipulation, quadruped robot navigation, UAV/aerial-view understanding, and static benchmark enhancement. These benchmarks span diverse embodied carriers, data sources, and spatial capabilities. Experiments with human evaluation, judge-based assessment, consistency checks, cost analysis, and ablations show that Embodied-BenchClaw can construct verifiable, executable, maintainable, and diagnostically useful embodied spatial benchmarks with reduced manual effort.
- Abstract(参考訳): ベンチマークは、具体的空間知能を評価するのに不可欠であるが、その構築は労働集約的で、再利用が難しく、維持が困難である。
既存の実施ベンチマークは、しばしば静的であり、モデルが改善されるにつれて、すぐに飽和し、新しい機能を区別する能力を制限する。
Embodied-BenchClawは,仮想空間知能ベンチマークを構築するための自律エージェントシステムである。
Embodied-BenchClawは,ユーザが指定した評価意図を前提として,インテントブループリント,データ収集,構造化とクリーニング,ベンチマーク合成,評価レポートという5段階のパイプラインを通じて,完全かつ継続的に更新可能なベンチマークパッケージを自動生成する。
パイプラインは計画、建設、評価のために3つのエージェントによって調整される。
再利用性と信頼性を向上させるため、Embodied-BenchClawは拡張可能なスキルライブラリとプロセス品質管理を導入し、ベンチマーク構築を構成可能、検証可能、修復可能とした。
室内空間推論、屋外空間推論、ロボット操作、四脚ロボットナビゲーション、UAV/空中視理解、静的ベンチマーク強化を含む複数のベンチマークをインスタンス化する。
これらのベンチマークは、様々なエンボディキャリア、データソース、空間能力にまたがる。
人間の評価、判断に基づく評価、整合性チェック、コスト分析、改善による実験により、Embodied-BenchClawは、手作業の少ない検証可能、実行可能、保守可能、診断に有用な空間ベンチマークを構築することができる。
関連論文リスト
- Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends [10.685326391262512]
エンボディード・インテリジェンス(Embodied Intelligence)は、ナビゲーション、家庭支援、操作、自律運転、航空エージェント、マルチモーダル大型モデル制御にまたがる。
この拡張により、ベンチマーク構築は信頼性評価のための中心的なボトルネックとなった。
この調査は5段階の建設パイプラインを通して文献をレビューする。
論文 参考訳(メタデータ) (2026-06-10T15:25:02Z) - Benchmark Everything Everywhere All at Once [28.30618112297148]
ベンチマーク構築用に設計された完全自律型エージェントシステムであるBenchmark Agentを紹介する。
本フレームワークは,ユーザクエリ分析やサブタスク設計からデータアノテーション,品質管理に至るまで,完全なベンチマーク構築パイプラインを編成する。
テキスト理解やマルチモーダル理解,ドメイン固有の推論など,さまざまな評価シナリオにまたがる15の代表的なベンチマークを作成した。
論文 参考訳(メタデータ) (2026-06-04T17:52:04Z) - DEP: A Decentralized Large Language Model Evaluation Protocol [51.3646001384887]
分散評価プロトコル(Decentralized Evaluation Protocol, DEP)は、分散化されているが統一され、標準化された評価フレームワークである。
ユーザ、LLM、ベンチマークを分離することで、DEPはモジュラー、プラグ・アンド・プレイの評価を可能にする。
我々は,ブレークポイントの再開,同時要求,混雑制御などの機能をサポートするプロトコル互換ツールキットであるDEP Toolkitを開発した。
論文 参考訳(メタデータ) (2026-03-01T16:10:16Z) - Easy Data Unlearning Bench [53.1304932656586]
アンラーニングアルゴリズムの評価を簡略化する統一型ベンチマークスイートを導入する。
セットアップとメトリクスの標準化により、未学習のメソッド間で再現性、拡張性、公正な比較が可能になる。
論文 参考訳(メタデータ) (2026-02-18T12:20:32Z) - OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding [57.39403818250357]
ここでは,レポジトリベースエージェントコーディングにおける足場認識命令のベンチマークを行うOctoBenchを紹介する。
OctoBenchは34の環境と217のタスクを3つの足場タイプでインスタンス化し、7,098の客観的チェックリストアイテムとペアリングする。
実験により、タスク解決と足場対応の体系的なギャップが明らかになり、トレーニングと評価の必要性が強調される。
論文 参考訳(メタデータ) (2026-01-15T12:36:08Z) - AI Benchmark Democratization and Carpentry [12.180796797521062]
大規模な言語モデルはしばしば静的なベンチマークを行い、ベンチマーク結果と実世界のパフォーマンスのギャップを生じさせる。
現在のベンチマークでは、上位層のハードウェア上でのピークパフォーマンスを強調し、多様な実世界のシナリオに対する限られたガイダンスを提供することが多い。
民主化は、技術革新とレベルを越えた体系的な教育の両方を必要とし、ベンチマーク設計と使用において持続的な専門知識を構築する。
論文 参考訳(メタデータ) (2025-12-12T14:20:05Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - BenchAgents: Multi-Agent Systems for Structured Benchmark Creation [23.653678381444276]
BenchAgentsは評価ベンチマークの作成を自動化するフレームワークである。
BenchAgentsを使って、計画、制約満足度、因果推論に関連する機能を評価するベンチマークを作成します。
次に、これらのベンチマークを使用して、最先端のモデルを研究し、共通の障害モードとモデルの違いに関する新たな洞察を抽出します。
論文 参考訳(メタデータ) (2024-10-29T22:56:18Z) - Integrated Benchmarking and Design for Reproducible and Accessible
Evaluation of Robotic Agents [61.36681529571202]
本稿では,開発とベンチマークを統合した再現性ロボット研究の新しい概念について述べる。
このセットアップの中心的なコンポーネントの1つはDuckietown Autolabであり、これは比較的低コストで再現可能な標準化されたセットアップである。
本研究では,インフラを用いて実施した実験の再現性を解析し,ロボットのハードウェアや遠隔実験室間でのばらつきが低いことを示す。
論文 参考訳(メタデータ) (2020-09-09T15:31:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。