論文の概要: Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning
- arxiv url: http://arxiv.org/abs/2610.02715v1
- Date: Fri, 02 Oct 2026 02:51:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.172501
- Title: Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning
- Title(参考訳): Ego2World:エゴセントリックなCooking Videoを実行可能な世界へコンパイルする
- Abstract要約: Ego2Worldは、アノテートされた調理アクティビティを、部分的な観察の下で実行可能な計画環境に変換するベンチマークである。
コンパイラはソースステップとオブジェクトをシンボリックアクションルール、永続的な世界状態、明示的なタスク条件にリンクする。
世界国家とエージェントの信念は別々に維持され、計画と情報の再利用に関する制御された研究を可能にする。
- 参考スコア(独自算出の注目度): 49.28013800186945
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric videos capture how people carry out everyday activities, yet testing an agent requires evaluating the consequences of actions it chooses itself. We introduce Ego2World, a benchmark that turns annotated cooking activities into executable planning environments under partial observation. Its compiler links source steps and objects to symbolic action rules, persistent world states, and explicit task conditions, so researchers can execute an agent's proposed actions and check their outcomes. World state and agent belief are maintained separately, enabling controlled studies of planning and information reuse across continuing tasks. Evaluating six planners on 105 tasks shows that accepted operations often leave task goals unmet. Execution traces and condition checks distinguish interrupted runs, partial attainment, and completed execution without goal attainment. In a separate paired Qwen-Plus study, persistent belief improves action validity by 4.15 percentage points and reduces visual-query attempts by 90.27%, with higher token use and no detected completion gain. Ego2World provides a reusable testbed for tracing how planning and memory choices affect execution, observation demand, and task attainment, connecting recorded human activity to the development and evaluation of interactive agents.
- Abstract(参考訳): エゴセントリックなビデオは、人々が日常的な活動を行う様子を撮影するが、エージェントをテストするには、自分が選択した行動の結果を評価する必要がある。
Ego2Worldは、アノテートされた調理活動を、部分的な観察の下で実行可能な計画環境に変換するベンチマークである。
コンパイラはソースステップとオブジェクトをシンボリックアクションルール、永続的な世界状態、明示的なタスク条件にリンクするので、研究者はエージェントの提案したアクションを実行し、結果を確認することができる。
世界国家とエージェントの信念は別々に維持され、継続するタスクにおける計画と情報の再利用に関する制御された研究を可能にする。
105タスクの6人のプランナーを評価すると、受け入れた操作がタスクの目標を未完成のままにしておくことがよくあります。
実行トレースと条件チェックは、中断された実行、部分的に達成し、目標達成なしに完了した実行を区別する。
個別のQwen-Plus研究では、永続的信念はアクションの有効性を4.15ポイント改善し、視覚的クエリの試みを90.27%削減し、トークンの使用は高く、完成度は検出されない。
Ego2Worldは、計画とメモリの選択が実行、監視要求、タスク達成にどのように影響するかを追跡する再利用可能なテストベッドを提供し、記録された人間のアクティビティを対話エージェントの開発と評価に接続する。
関連論文リスト
- LexiconVLA: Learning Reusable Atomic Action Codebooks for Unseen Tasks [52.045695649147966]
クロスタスク再利用のための検索可能な原子-作用レキシコンを提案する。
グローバルかつ詳細なコードブックは、共有インタラクション構造ときめ細かい実行のバリエーションをキャプチャする。
視覚-原子的行動アライメントは、視覚状態変化からの軌道再構成と、行動コードからの視覚的結果予測を結合する。
論文 参考訳(メタデータ) (2026-09-29T05:45:52Z) - A Brain-inspired Hierarchical Framework for Zero-Shot Robot Task Reasoning and Execution [9.745144598922584]
メソッドは、人間の脳における役割の分割にインスパイアされたゼロショット階層的なフレームワークである。
コマンドを明示的なオブジェクト状態に基底付け、再利用可能なアトミックアクションをタスク条件付きシーケンスに構成し、実行コストで代替シーケンスをランク付けする。
メソッドは、ReKep、Dream2Flow、および$_0.5$ベンチマークよりも高い成功率を達成する。
論文 参考訳(メタデータ) (2026-09-05T08:59:04Z) - HarnessWAM: Bridging Prediction and Deliberation in World Action Models [39.20825071922887]
World Action Models (WAM) は、環境力学とロボットの動作を共同で学習し、身体的制御に物理的進化の先行を取り入れている。
本稿では,WAMの予測・検討ギャップに対処するため,WAMのエージェントフレームワークであるHarnessWAMを提案する。
我々は、HarnessWAMがRoboMemArenaで59.6%、69.9%、RoboCerebra Idealで23.7%、最先端のフルタスクとサブタスクの成功率を達成したことを示す。
論文 参考訳(メタデータ) (2026-08-10T12:15:59Z) - WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity [75.96851880065331]
ビジュアル品質、制御の整合性、空間整合性、世界反応性の4つのレベルにまたがる診断ベンチマークであるWorldExamを紹介した。
8つのタスクにまたがる1,474のケースで構成され、カメラ、アクション、言語駆動モデルパラダイムの統一的な評価をサポートする。
カメラ駆動型モデルはカメラ制御に優れるが,インターフェースは動的相互作用をサポートしていない。
論文 参考訳(メタデータ) (2026-08-03T17:59:54Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning [55.43343782036886]
Ego2Worldは、エゴセントリックな調理動画を、グラフ遷移ルールによって管理される実行可能な象徴的世界に変換する実行可能なベンチマークである。
評価中、シミュレータは隠された世界グラフを保持し、エージェントはローカルな観測と実行フィードバックのみを使用して、独自の部分的信念グラフを計画する。
この分離により、エージェントは真の世界の状態を観察することなく、メモリとリプランを更新せざるを得なくなる。
論文 参考訳(メタデータ) (2026-05-13T10:53:15Z) - AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback [28.254110943200683]
AsgardBenchは、視覚的に基礎があり、ハイレベルなアクションシーケンス生成と対話的な計画を評価することを目指している。
評価の結果,視覚的入力を使わずに性能が急激に低下し,視覚的接地や状態追跡の弱点が明らかとなった。
私たちのベンチマークでは,より限定的な疑問に言及しています – 期待通りに進まなければ,実際に計画に適応するために,モデルが見ているものを使用することは可能ですか?
論文 参考訳(メタデータ) (2026-03-16T20:31:43Z) - Active Intelligence in Video Avatars via Closed-loop World Modeling [55.29966567726842]
現在のビデオアバター生成法は、アイデンティティの保存と動きのアライメントが優れているが、真のエージェンシーは欠如している。
本稿では,L-IVA (Long-Horizon Interactive Visual Avatar) の導入について述べる。
また,ビデオアバターにおける能動的インテリジェンスを実現する最初のフレームワークであるORCAについても紹介する。
論文 参考訳(メタデータ) (2025-12-23T18:59:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。