論文の概要: Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- arxiv url: http://arxiv.org/abs/2607.08233v1
- Date: Thu, 09 Jul 2026 08:29:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.46786
- Title: Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- Title(参考訳): ZendoWorldをプレイする - アクティブビジュアルコンセプトインジェクションにおけるAIエージェントの対応
- Authors: Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting,
- Abstract要約: ZendoWorldは、エージェントが視覚ゲーム観測に関する論理的なルールを推論しなければならない、制御されたインタラクティブ環境である。
我々は、純粋なVLM推論、ベイズ粒子フィルタリング、動的概念発見、ニューロシンボリックな方法にまたがるいくつかのエージェントを評価した。
本研究の主目的は,(1)ラベルの精度が高いと根本規則の回復が示唆されないこと,(2)認知と帰納は異なるエージェントクラスにおいて異なるボトルネックとなること,(3)VLMをベースとしたエージェントは,仮説の不確実性を積極的に減少させることなく,ほぼ不均一な実験を提案すること,である。
- 参考スコア(独自算出の注目度): 39.71864879537297
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A central challenge in building intelligent systems is enabling agents to jointly perceive complex inputs, form hypotheses about hidden patterns, and design informative experiments to test them. To study this problem, we propose ZendoWorld, a controlled interactive environment in which agents must infer a logical rule about visual game observations, acquire information by proposing new scenes, and refine their hypotheses based on feedback from the game environment. We evaluate several agents spanning pure VLM reasoning, Bayesian particle filtering, dynamic concept discovery, and neuro-symbolic methods. Our main findings are: (1) high accuracy in predicting labels for observed examples does not imply recovery of the underlying rule; (2) perception and induction are distinct bottlenecks for different agent classes; and (3) VLM-based agents propose near-uninformative experiments, failing to actively reduce hypothesis uncertainty. To compare these results, we collect human data on the task, which reveals a gap in inductive reasoning, particularly for more complex rules. Overall, ZENDOWORLD takes an important step toward evaluating intelligent agents and identifies concrete avenues for improvement, particularly in domains like scientific discovery.
- Abstract(参考訳): インテリジェントシステム構築における中心的な課題は、エージェントが複雑な入力を共同で知覚し、隠れたパターンに関する仮説を形成し、それらをテストするための情報的実験を設計することである。
そこで本研究では,エージェントが視覚ゲーム観測に関する論理的ルールを推論し,新たなシーンを提案して情報を取得し,ゲーム環境からのフィードバックに基づいて仮説を洗練させる,制御された対話型環境であるZendoWorldを提案する。
我々は、純粋なVLM推論、ベイズ粒子フィルタリング、動的概念発見、ニューロシンボリックな方法にまたがるいくつかのエージェントを評価した。
本研究の主目的は,(1)観察例のラベルの精度向上は,基礎的ルールの回復を示唆するものではないこと,(2)認知と誘導は異なるエージェントクラスにおいて異なるボトルネックであること,(3) VLMをベースとしたエージェントがほぼ不均一な実験を提案し,仮説の不確かさを積極的に低減できないこと,である。
これらの結果を比較するために、タスク上の人的データを収集し、特により複雑なルールのために、帰納的推論のギャップを明らかにする。
全体として、ZENDOWORLDは知的エージェントの評価に向けて重要な一歩を踏み出し、特に科学的発見のような分野において、改善のための具体的な方法を特定する。
関連論文リスト
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop [55.468404995694975]
我々は,OmniGibson上に構築された10のタスクカテゴリと29のサブカテゴリにまたがる空間知能の具体化ベンチマークを開発した。
我々は最先端のMLLMの実験を行い、活発な探索が受動的に優れていることを発見した。
矛盾した視点を求め、信念を改定する人間とは異なり、モデルは証拠の品質に関わらず、高い信頼をもって早々に行動する。
論文 参考訳(メタデータ) (2026-05-18T17:59:02Z) - What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity [38.38728887407681]
VLMエージェントは、好奇心を駆使した探索を通じて、内部世界モデルに挑戦し、洗練するシグナルを積極的に見つけることができるだろうか?
本稿では,エージェントの言語世界モデルに基づく推論と探索を,進化するターゲットネットワークの安定的な視覚表現に基礎付けることによってブリッジする統合フレームワークGLANCEを提案する。
論文 参考訳(メタデータ) (2026-05-05T14:08:54Z) - DISCOVERYWORLD: A Virtual Environment for Developing and Evaluating Automated Scientific Discovery Agents [49.74065769505137]
本研究では,新しい科学的発見の完全なサイクルを実行するエージェントの能力を開発し,ベンチマークする最初の仮想環境であるDiscoVERYWORLDを紹介する。
8つのトピックにまたがる120の異なる課題タスクが含まれており、3レベルの難易度といくつかのパラメトリックなバリエーションがある。
従来の環境においてよく機能する強力なベースラインエージェントが、ほとんどのdiscoVERYWORLDタスクに苦労していることがわかった。
論文 参考訳(メタデータ) (2024-06-10T20:08:44Z) - Assessing biomedical knowledge robustness in large language models by query-efficient sampling attacks [0.6282171844772422]
大規模言語モデル(LLM)におけるパラメトリックドメイン知識の深化は、現実世界のアプリケーションへの迅速な展開を加速させている。
近年、自然言語処理タスクの逆例として命名されたエンティティが発見され、事前訓練されたLLMの知識の堅牢性に対するそれらの潜在的な影響に関する疑問が提起されている。
バイオメディカル知識のロバスト性を評価するために,パワースケール距離重み付きサンプリングに基づく埋め込み空間攻撃を開発した。
論文 参考訳(メタデータ) (2024-02-16T09:29:38Z) - Interactive Visual Reasoning under Uncertainty [29.596555383319814]
我々は,不確実性下での人工エージェントの推論能力を評価するためのIVRE環境を考案した。
IVREは、Blicket検出を中心にしたリッチなシナリオを特徴とする対話型環境である。
論文 参考訳(メタデータ) (2022-06-18T13:32:41Z) - Information is Power: Intrinsic Control via Information Capture [110.3143711650806]
我々は,潜時状態空間モデルを用いて推定したエージェントの状態訪問のエントロピーを最小化する,コンパクトで汎用的な学習目的を論じる。
この目的は、不確実性の低減に対応する環境情報収集と、将来の世界状態の予測不可能性の低減に対応する環境制御の両方をエージェントに誘導する。
論文 参考訳(メタデータ) (2021-12-07T18:50:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。