論文の概要: EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
- arxiv url: http://arxiv.org/abs/2607.05155v1
- Date: Mon, 06 Jul 2026 14:39:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.194035
- Title: EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
- Title(参考訳): EdgeBench: 実環境から学ぶためのスケーリング法則を公開
- Abstract要約: 環境学習における全体的な性能は対数シグミドスケーリング法に従っており、精度は極めて高い。
モデル世代全体で、エージェントの学習速度は3ヶ月毎に約2倍になる。
- 参考スコア(独自算出の注目度): 68.96384119845945
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretraining scaling laws reveal that model capability improves predictably with data and compute. But learning from real world environments after deployment remains far less understood. Analyzing roughly 38,000 hours of agent interaction with the environment across 134 real world tasks, we find, to the best of our knowledge, the first evidence that overall performance during environment learning follows a log-sigmoid scaling law with remarkably high precision, reaching R^2 = 0.998. Across model generations, we also find that agent learning speed roughly doubles every three months. This discovery stems from EdgeBench, a suite of 134 real world tasks with ultra-long horizons, spanning scientific discovery, software engineering, combinatorial optimization, professional knowledge work, formal mathematics, and interactive games. Each task sustains at least 12 hours of continuous agent operation under rich, multilevel feedback, and is built through substantial expert effort. We publicly release 51 tasks and our full evaluation framework to accelerate the study of how agents learn from real world experience.
- Abstract(参考訳): スケーリング法則の事前訓練は、データと計算によってモデル能力が予測通りに改善することを示している。
しかし、デプロイ後の現実世界の環境から学ぶことは、まだほとんど理解されていない。
実世界のタスク134件にわたる環境との約38,000時間のエージェントインタラクションを分析したところ、私たちの知る限り、環境学習における全体的なパフォーマンスは、非常に高精度な対数シグモドスケーリング法に従っており、R^2 = 0.998に達するという最初の証拠であることがわかった。
モデル世代全体で、エージェントの学習速度は3ヶ月毎に約2倍になる。
この発見は、科学的な発見、ソフトウェア工学、組合せ最適化、専門知識労働、フォーマル数学、インタラクティブゲームにまたがる134の現実世界タスクからなるEdgeBenchに端を発する。
各タスクは、リッチでマルチレベルなフィードバックの下で、少なくとも12時間の継続的エージェント操作を持続し、相当な専門家の努力によって構築されます。
我々は51のタスクと、エージェントが現実世界の体験からどのように学習するかを研究するための完全な評価フレームワークを公開している。
関連論文リスト
- AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents [50.667928258781934]
我々はAgentOdysseyを紹介した。AgentOdysseyは、リッチエンティティ、ワールドダイナミクス、ロングホライゾンタスクを備えたオープンエンドテキストゲームを手続き的に生成する新しい評価フレームワークである。
ゲーム進行だけでなく、世界知識獲得、エピソード記憶、オブジェクトとアクションの探索、アクションの多様性、モデルコストの診断テストも提供する多面的評価手法を提案する。
実験の結果、エージェントのキー能力の限界と、その意味のある地平線に影響を与える要因が明らかになった。
論文 参考訳(メタデータ) (2026-05-29T22:40:51Z) - FutureSim: Replaying World Events to Evaluate Adaptive Agents [69.52411849743358]
我々はFutureSimを構築し、エージェントは世界の時系列的なリプレイと対話しながら、知識の遮断を越えて世界の出来事を予測する。
FutureSimは、その能力の明確な分離を明らかにし、最高のエージェントの精度は25%であり、多くは予測を全く行わずにBrierのスキルスコアが劣っている。
全体として、我々のベンチマーク設計は、現実世界の長い時間軸にまたがるオープンエンド適応において、AIの進歩を測定するための道を開くことを願っている。
論文 参考訳(メタデータ) (2026-05-14T17:59:28Z) - OSExpert: Computer-Use Agents Learning Professional Skills via Exploration [55.660669638732024]
汎用コンピュータ利用エージェントは、人間の専門家ほど役に立たない。
本研究では,環境の単位関数を探索し,検証するための深度優先探索アルゴリズムを提案する。
エージェントは、合成タスクのカリキュラムを自己構築するために、ユニットスキル間の構成性を利用する。
論文 参考訳(メタデータ) (2026-03-09T05:27:56Z) - Online Continual Learning For Interactive Instruction Following Agents [20.100312650193228]
このような学習シナリオは,ロボットエージェントが世界を探索し,知覚する上で,継続的に世界を学ぶことが求められているため,現実的ではない,と我々は主張する。
本研究では,新しい行動学習と新しい環境学習という,エンボディエージェントのための2つの連続学習環境を提案する。
論文 参考訳(メタデータ) (2024-03-12T11:33:48Z) - Human-Timescale Adaptation in an Open-Ended Task Space [56.55530165036327]
大規模にRLエージェントを訓練することで、オープンエンドの新規な3D問題に人間と同じくらい早く適応できる一般的なコンテキスト内学習アルゴリズムが実現可能であることを示す。
我々の研究は、より大規模で適応的なRLエージェントの基礎を築いた。
論文 参考訳(メタデータ) (2023-01-18T15:39:21Z) - WordCraft: An Environment for Benchmarking Commonsense Agents [107.20421897619002]
我々はLittle Alchemy 2.0をベースとしたRL環境であるWordCraftを提案する。
この軽量環境は、現実のセマンティクスにインスパイアされたエンティティとリレーションに基づいて実行され、構築される。
論文 参考訳(メタデータ) (2020-07-17T18:40:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。