論文の概要: Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration
- arxiv url: http://arxiv.org/abs/2607.16352v1
- Date: Fri, 17 Jul 2026 07:10:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.127716
- Title: Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration
- Title(参考訳): 実行前の明確化:3次元ツールオーケストレーションにおける初期非対称性解消のための自己進化剤
- Abstract要約: 現在の3Dエージェントは、曖昧さをノイズとして扱い、単一ターンの仮定で盲目的実行をデフォルトとする。
CLAREは,意図的非対称性を実行エラーではなく,戦略的対話の機会として扱う,明確で進化的な3Dエージェントである。
- 参考スコア(独自算出の注目度): 22.08745522207589
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A fundamental intent asymmetry plagues modern 3D asset creation: while state-of-the-art 3D toolchains demand precise, executable parameters, ordinary users typically provide vague, underspecified instructions. Current 3D agents treat this ambiguity as noise, defaulting to blind execution under a single-turn assumption. To address this limitation, we introduce CLARE, a clarification-aware and evolutionary 3D agent that treats intent asymmetry not as an execution error, but as an opportunity for strategic dialogue. By decoupling the generation pipeline into four specialized cognitive roles, CLARE intercepts and resolves underspecified instructions before invoking computationally expensive 3D tools to seamlessly execute tasks across five diverse domains: text-to-3D generation, single-view reconstruction, multi-view reconstruction, point cloud editing, and post-processing. Crucially, rather than relying on rigid manual rules, CLARE self-evolves its clarification policy via simulated multi-turn interactions. By optimizing a Multi-turn Reward, the agent internalizes the delicate balance between interaction efficiency and task completion. To rigorously test this, we construct 3D-Clarify, a comprehensive benchmark comprising 620 interaction scenarios with systematically injected ambiguity, missing information, and mistaken details. CLARE achieves state-of-the-art performance, with 60.40% and 43.34% success rates on single-step and multi-step tasks, respectively, more than doubling existing baselines. Both quantitative and qualitative results demonstrate that proactive clarification is the missing key to robust 3D execution. Code is available at https://github.com/xyzhu1225/CLARE.
- Abstract(参考訳): 最先端の3Dツールチェーンは正確で実行可能なパラメータを要求するが、普通のユーザーは曖昧で不特定な指示を提供する。
現在の3Dエージェントはこの曖昧さをノイズとして扱い、単一ターンの仮定で盲目的実行をデフォルトとする。
この制限に対処するために、CLAREは、意図的非対称性を実行エラーではなく、戦略的対話の機会として扱う、明確で進化的な3Dエージェントである。
生成パイプラインを4つの特別な認知的役割に分離することで、CLAREは計算コストの高い3Dツールを起動する前に、未特定の命令をインターセプトして解決し、テキストから3D生成、単一ビュー再構成、マルチビュー再構成、ポイントクラウド編集、後処理の5つの領域でシームレスにタスクを実行する。
重要なことは、厳格なマニュアルルールに頼るのではなく、CLAREは、シミュレーションされたマルチターン相互作用を通じて、その明確化ポリシーを自己進化させる。
マルチターンリワードを最適化することにより、エージェントは相互作用効率とタスク完了の微妙なバランスを内部化する。
これを厳密に検証するため、3D-Clarifyは、系統的に注入されたあいまいさ、情報の欠如、詳細を誤る620の相互作用シナリオからなる包括的なベンチマークである。
CLAREは最先端のパフォーマンスを達成し、60.40%と43.34%が1ステップと複数ステップのタスクで成功し、これは既存のベースラインを2倍にしている。
定量的および定性的な結果は、プロアクティブな明確化がロバストな3次元実行の欠落鍵であることを示している。
コードはhttps://github.com/xyzhu1225/CLAREで公開されている。
関連論文リスト
- SceneActBench: Can Agents Act on the 3D Scenes They See? [40.002502466292015]
SceneActBenchは、統一されたエージェント環境ループの下で5つの3Dタスクにまたがる視覚的条件付きアクションのベンチマークである。
タスク固有の幾何測定値を用いて、各最終的な結果が隠れた真実に対して評価される。
論文 参考訳(メタデータ) (2026-07-24T15:16:47Z) - AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models [0.0]
3Dビジュアルグラウンド(3DVG)は、AIを具現化する上で不可欠な機能であり、自然言語の記述に基づいて、エージェントがオブジェクトを3Dシーンにローカライズする必要がある。
タスク固有の3Dトレーニングを必要とせずに,色のついた点クラウド上で直接動作する,ゼロショットの3Dビジュアルグラウンドティングフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T14:29:04Z) - On the Feasibility and Opportunity of Autoregressive 3D Object Detection [60.86546723351944]
AutoReg3Dは、検出をシーケンス生成としてキャストする自動回帰型3D検出器である。
さまざまなポイントクラウドやバックボーンに互換性があり、アンカーやNMSなしで、競合するnuScenesのパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-03-09T05:46:53Z) - Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling [41.61826091940538]
視覚言語モデル(VLM)は,社会プラットフォーム上でのマルチモーダル誤報の検出に有効であることが証明されている。
しかしながら、単一のVLMの容量は、より複雑な混在するマルチモーダル誤情報検出タスクにおいて不足する。
我々は,ゼロショット誤情報検出のためのマルチエージェントフレームワークであるAgentM3Dを提案する。
論文 参考訳(メタデータ) (2026-03-03T02:07:52Z) - VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement [66.13644883379087]
MLLMを用いた3次元オブジェクト配置における3つの課題に対処する。
まず、MLLMの弱い視覚的基盤に対処するために、MPPベースのAPIを導入する。
第2に、MLLMの3Dシーン理解を、特殊な視覚ツール群で強化する。
第3に,反復的かつエラーを起こしやすい更新を管理するために,協調的なマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T19:22:39Z) - Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution [51.89342880214462]
Operations Research knowledge-based 3D Grounded Task Scheduling (ORS3D)は、言語理解、3Dグラウンド、効率最適化の相乗効果を必要とする新しいタスクである。
ORS3Dの研究を容易にするために,ORS3D-60Kを構築した。
ORS3D-60Kの実験は、言語理解、3Dグラウンド、スケジューリング効率にまたがるGRANTの有効性を検証する。
論文 参考訳(メタデータ) (2025-11-24T18:59:17Z) - SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding [40.60812160987424]
3Dビジュアルグラウンド(3DVG)は、自然言語による3Dシーンのオブジェクトのローカライズを目的としている。
対象物推論のための空間情報を備えた多視点実写シーン画像を利用する新しいゼロショット3DVGフレームワークであるSeqVLMを提案する。
ScanRefer と Nr3D のベンチマーク実験では、従来のゼロショット法を4.0%、Nr3D で5.2%上回った。
論文 参考訳(メタデータ) (2025-08-28T13:15:37Z) - SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting [85.87902260102652]
本稿では, 連続3次元ガウシアン・アフラマンス推論の課題について紹介する。
次に,SeqSplatNetを提案する。SqSplatNetは,命令を直接3Dアベイランスマスクのシーケンスにマッピングするエンドツーエンドフレームワークである。
本手法は,1段階のインタラクションから,シーンレベルでの複雑なシーケンシャルなタスクへの可利用性推論を効果的に向上させる。
論文 参考訳(メタデータ) (2025-07-31T17:56:55Z) - E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models [78.1674905950243]
3次元幾何学基礎モデル(GFM)の総合ベンチマークを初めて提示する。
GFMは、単一のフィードフォワードパスで密度の高い3D表現を直接予測し、スローまたは未使用のカメラパラメータを不要にする。
我々は16の最先端GFMを評価し、タスクやドメイン間の長所と短所を明らかにした。
すべてのコード、評価スクリプト、処理されたデータは公開され、3D空間インテリジェンスの研究が加速される。
論文 参考訳(メタデータ) (2025-06-02T17:53:09Z) - LocATe: End-to-end Localization of Actions in 3D with Transformers [91.28982770522329]
LocATeは、3Dシーケンスでアクションを共同でローカライズし認識するエンドツーエンドのアプローチである。
画像やパッチの特徴を入力として考えるトランスフォーマーベースのオブジェクト検出や分類モデルとは異なり、LocATeのトランスフォーマーモデルはシーケンス内のアクション間の長期的な相関をキャプチャすることができる。
BABEL-TAL-20 (BT20) という新しい,挑戦的で,より現実的なベンチマークデータセットを導入する。
論文 参考訳(メタデータ) (2022-03-21T03:35:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。