論文の概要: Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.26148v1
- Date: Tue, 28 Jul 2026 18:00:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.443208
- Title: Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
- Title(参考訳): 生体エージェントの制御:視覚・言語ナビゲーションにおける産業規模政策の最小対面ゼロショットエージェント
- Abstract要約: 本研究では,汎用エージェントがループ自体を保持するエージェントエンボディドコントロールについて検討する。
我々は、単眼のRGBカメラと離散アクションのみを付与した3つのソフトウェアエンジニアリングハーネスを評価した。
トレーニングされたウェイポイントツールがプリミティブと共にオプションとして公開されると、ハイブリッドのfable-5エージェントはデフォルトの労力で76.7$pm$0.6%に達する。
- 参考スコア(独自算出の注目度): 27.261164150282706
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous embodied agents must sustain a long decision-making loop that involves perceiving, acting, verifying, and self-correcting over many steps. Current systems sustain this loop through task-specific workflows or embodied policies. We study a third form, agentic embodied control, in which a general-purpose agent holds the loop itself. Using zero-shot navigation as a controlled testbed, we evaluate three software-engineering agent harnesses given only a monocular RGB camera and discrete actions. Under this strictly minimal condition, replicated default-effort configurations reach 70.7$\pm$3.5% success (opus-5, mean over three runs), and fable-5 reaches 78% at maximum effort. When a trained waypoint tool is exposed alongside primitives as an optional capability, the hybrid fable-5 agent reaches 76.7$\pm$0.6% at default effort, using half the environment steps and less than one quarter of the wall time of the maximum-effort primitive run. Controlled interventions show that capability is primarily model-centered: model choice strongly changes success, harness effects are descriptive, and a forced waypoint interface helps weaker models but can hinder stronger ones. Performance nevertheless falls sharply on longer-horizon tasks, while latency and context growth limit sustained operation. These results show that agentic control is already competitive in zero-shot navigation and that models, harnesses, and interfaces offer complementary paths toward autonomous embodied agents.
- Abstract(参考訳): 自律的な実施エージェントは、多くのステップで知覚、行動、検証、自己修正を含む長い意思決定ループを維持しなければならない。
現在のシステムは、タスク固有のワークフローや、具体化されたポリシーを通じて、このループを維持している。
汎用エージェントがループ自体を保持する3つ目の形態であるエージェントエンボディドコントロールについて検討する。
ゼロショットナビゲーションを制御されたテストベッドとして使用し、単眼のRGBカメラと離散アクションのみを付与した3つのソフトウェアエンジニアリングエージェントハーネスを評価した。
この厳格に最小限の条件下では、複製されたデフォルト設定は70.7$\pm$3.5%の成功(オプス5、平均3ラン以上)に達し、ファブル5は最大で78%に達する。
トレーニング済みのウェイポイントツールがオプション機能としてプリミティブと一緒に公開されると、ハイブリッドのfable-5エージェントはデフォルトの作業で76.7$\pm$0.6%に達する。
モデル選択は成功を強く変え、ハーネス効果は記述的であり、強制的なウェイポイントインターフェースはより弱いモデルに役立つが、より強いモデルを妨げる可能性がある。
それにもかかわらず、パフォーマンスは長い水平タスクで著しく低下する一方、レイテンシとコンテキストの増大はオペレーションを持続する。
これらの結果から, エージェント制御はゼロショットナビゲーションにおいてすでに競争力があり, モデル, ハーネス, インターフェースは, 自律的エンボディエージェントへの補完経路を提供することがわかった。
関連論文リスト
- TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents [41.82249291285459]
TRACEは、モデルウェイトを変更することなく、スキルベースのエージェントの行動知識を反復的に改善する。
GPT-5.5では、TRACEは一貫性(Pass3)を34.6ポイント改善し、59.9%から94.5%に改善した。
これらの結果から,TRACEは高モデルポテンシャルを安定かつ一貫した性能向上に変換することを示した。
論文 参考訳(メタデータ) (2026-08-24T04:36:03Z) - Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies [33.432377306905735]
タスクベクトル算術は、モデルを修正するためのクローズドフォームな方法を提供するが、クローズドループロボット制御において、その振る舞いの局所性は未だ不明である。
マルチタスク・ビジョン・ランゲージ・アクション(VLA: Multitask Vision-Language-action)ポリシーから,タスク・ベクターごとのタスク・ベクター・サブトラクションのターゲット・アンド・コントロール・監査を行う。
論文 参考訳(メタデータ) (2026-08-05T10:59:53Z) - OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents [52.15259607762389]
自律型エージェントのための長距離ハーネスであるOneDayAgentを紹介する。
OneDayAgentはオープンなリクエストをマネージドな実行プロセスに変換する。
我々は104のタスクでAgentIF-OneDay上でOneDayAgentを評価する。
論文 参考訳(メタデータ) (2026-08-04T17:55:41Z) - GuardianAgentBench: Where Agents Fail and How to Guard Them [1.5223648595073074]
GuardianAgentBenchは、プロダクション対応の3つのフレームワークで評価された6つのドメインにわたる580のシナリオのベンチマークである。
最強の構成でさえ、全体的な精度は74.8%に過ぎず、2つの異なる障害体制を明らかにしている。
我々のガードレールの実装は、全てのモデルにおけるシステムプロンプトベースの防御を一貫して上回り、19.9%の障害をわずか0.5%の偽陽性率で回復させる。
論文 参考訳(メタデータ) (2026-07-23T07:05:05Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction [17.527470001317685]
本研究では,コンパクトな小言語モデル (SLM) を制御推論のために再訓練し,検証器誘導補正ループに組み込むことができるかを検討する。
ランダム化熱制御シミュレーション(それぞれ500段の30の実験)では、平均的なアクションアライメント精度が91.5%に達する。
シンボリック・リマッピングの下では95%のインレンジレートを維持しており、トークンレベルの合意が減ったにもかかわらず、堅牢な物理的規制を示している。
論文 参考訳(メタデータ) (2026-06-24T13:49:01Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym [13.424353009036068]
任意のバックトラックを伴う逐次決定課題としての2次元グリッドパズルにおける空間ジムテストパスフィニング
我々は,500回のエピソードにおいて,8つのモデル(ワンショット,ステップバイステップ,ステップバイステップ,バックトラック)を人間,ランダム,A*ベースラインに対して評価した。
論文 参考訳(メタデータ) (2026-04-10T14:05:50Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - 6GAgentGym: Tool Use, Data Synthesis, and Agentic Learning for Network Management [4.299007466612815]
6G-Forge ブートストラップによる NS-3 種子からのクローズドループ訓練軌跡の反復的自己指示生成と実験モデルに対する実行検証を行った。
得られたコーパスの微調整とオンラインクローズドループインタラクションによる強化学習により、8BオープンソースモデルはGPT-5に匹敵する全体的な成功率を達成することができる。
論文 参考訳(メタデータ) (2026-03-31T12:21:00Z) - Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits [0.0]
我々はQwen 3.5-35B-A3Bの残流上に9個のスパースオートエンコーダ(SAE)を訓練する。
私たちは5つのエージェント的行動特性を識別し、管理するためにそれらを使用します。
論文 参考訳(メタデータ) (2026-03-17T10:05:41Z) - ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving [63.980630608984605]
本稿では、ゼロサムマルコフゲームとして、駆動ポリシー(ディフェンダー)と敵エージェント(アタックラー)の相互作用を扱うクローズドループのmin-max最適化フレームワークであるADV-0を提案する。
これを実現するため,我々は動的敵の進化を反復的な選好学習とし,この最適性を効率的に近似し,アルゴリズムに依存しない解をゲームに提供する。
実験により、多様な安全クリティカルな障害を効果的に露呈し、学習方針と運動プランナーの両方の一般化可能性を大幅に向上させることが示されている。
論文 参考訳(メタデータ) (2026-03-16T12:58:31Z) - Primary-Fine Decoupling for Action Generation in Robotic Imitation [91.2899765310853]
ロボット操作動作シーケンスにおけるマルチモーダル分布は、模倣学習にとって重要な課題である。
PF-DAG(プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、PF-DAG)を提案する。
PF-DAGは、Adroit、DexArt、MetaWorldベンチマークの56タスクで最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-25T08:36:45Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control [72.43808515668947]
モバイル制御のためのトレーニング可能な階層型視覚言語エージェントであるHi-Agentを紹介する。
Hi-Agentは高レベルの推論モデルと、共同最適化された低レベルのアクションモデルを備えている。
Hi-Agentは、Android-in-the-Wild(AitW)ベンチマークで、新しいState-Of-The-Art(SOTA)87.9%タスクの成功率を達成した。
論文 参考訳(メタデータ) (2025-10-16T07:38:21Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。