論文の概要: Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs
- arxiv url: http://arxiv.org/abs/2607.28573v1
- Date: Thu, 30 Jul 2026 17:36:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.701257
- Title: Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs
- Title(参考訳): ローカルコンピュータ利用エージェントにおける推論時間スケーリングの再考:障害モードと計算トレードオフ
- Authors: Woongkyu Lee, Jungwook Choi,
- Abstract要約: 本稿では,ローカルコンピュータ利用エージェントにおける推論時間スケーリングの系統的研究について述べる。
我々の結果は、追加の計算がしばしば障害モードを変更しながらリターンを減少させることを示している。
全体として、効率的なローカルCUAには、選択的な計算割り当て、障害認識制御機構、エージェントフレームワークが必要であることが示唆された。
- 参考スコア(独自算出の注目度): 7.85315290601208
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying autonomous computer-use agents (CUAs) locally is increasingly important for privacy, cost efficiency, and practical usability, yet improving their performance under strict hardware constraints remains challenging. While recent studies show that inference-time scaling can improve frontier computer-use agents through additional computation during execution, its effectiveness for resource-constrained local models remains poorly understood. We present a systematic empirical study of inference-time scaling in local CUAs across contextual, temporal, structural, and parallel dimensions. We evaluate Qwen3-VL-8B/30B-A3B, UI-TARS-1.5-7B, and OpenCUA-7B on the OSWorld benchmark. Our results show that additional computation often yields diminishing returns while changing failure modes. Contextual scaling provides historical grounding that improves trajectory stability and task accuracy, but its gains saturate as token cost increases and failures shift from repetitive or stalled trajectories toward premature false successes. Temporal scaling similarly reduces max-step stalls, yet does not substantially improve task success, indicating that longer horizons often extend erroneous trajectories rather than correct them. We further find that structural decomposition can introduce planning and formatting overhead in local two-stage agents, while parallel scaling partially mitigates these failures at a substantial computational cost. Overall, our findings suggest that efficient local CUAs require selective compute allocation, failure-aware control mechanisms, and agentic frameworks designed around the capabilities and limitations of local models.
- Abstract(参考訳): 自律型コンピュータ利用エージェント(CUA)をローカルにデプロイすることは、プライバシ、コスト効率、実用的なユーザビリティにおいてますます重要になっている。
最近の研究では、推論時間スケーリングは、実行中に新たな計算を行うことで、フロンティアのコンピュータ利用エージェントを改善することが示されているが、リソース制約されたローカルモデルの有効性はよく分かっていない。
本稿では,文脈,時間的,構造的,並列次元にわたる局所CUAにおける推定時間スケーリングの系統的研究について述べる。
OSWorldベンチマークでは,Qwen3-VL-8B/30B-A3B,UI-TARS-1.5-7B,OpenCUA-7Bを評価した。
我々の結果は、追加の計算がしばしば障害モードを変更しながらリターンを減少させることを示している。
コンテキストスケーリングは、軌道の安定性とタスクの正確性を改善する歴史的な基盤を提供するが、トークンコストが増加し、失敗が繰り返しまたは停止した軌道から早々に失敗へと変化するにつれて、その利益は飽和する。
時間的スケーリングも同様に最大ステップのストールを減少させるが、タスクの成功を大幅に改善することはなく、長い水平線が修正するよりも間違った軌道を延長することが多いことを示している。
さらに、構造的分解は局所的な2段階エージェントの計画とフォーマットのオーバーヘッドをもたらすが、並列スケーリングはこれらの障害をある程度の計算コストで軽減する。
全体として、効率的なローカルCUAは、ローカルモデルの能力と限界を軸として設計された、選択的な計算割り当て、障害認識制御機構、エージェントフレームワークを必要とすることを示唆している。
関連論文リスト
- DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? [57.585275546688116]
VLM(Vision-Language Models)は、エンボディエージェントの高レベルプランナーとしてますます普及している。
テストタイムの計算をいつ、どこで使うかを選択することは、実際の世界にフロンティアパフォーマンスをもたらす中心である、と私たちは主張する。
我々はマルチモーダルシーンコンテキストを用いてプロンプト毎に計算を割り当てるルーティングフレームワークであるDIRECTを紹介した。
論文 参考訳(メタデータ) (2026-06-10T17:58:49Z) - C-Phase-Aware Compilation for Efficient Fault-Tolerant Quantum Execution [1.635939418192339]
本研究は,アルゴリズム構造と格子手術を直接統合したマイクロアーキテクチャ・アウェアコンパイル手法を提案する。
空間配置とルーティング制約を正確にモデル化する動的イベント駆動型スケジューリング戦略を設計する。
このアプローチはアイドルリソースを大幅に削減し、標準ベースラインと比較して59.7$times$実行時間を短縮する。
論文 参考訳(メタデータ) (2026-05-13T19:03:18Z) - Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control [33.03635235189535]
動作合成を反復的最適化に変換する時間非条件フレームワークGeCOについて紹介する。
テスト時間推論は、単純な状態に対して収束開始早期に基づいて計算を割り当てる適応的なプロセスとなり、難しい状態に対してはより長く精製する。
我々は,GeCOを標準シミュレーションベンチマークで検証し,pi0シリーズのVision-Language-Action(VLA)モデルにシームレスなスケーリングを示す。
論文 参考訳(メタデータ) (2026-03-18T15:27:17Z) - Learning from Yesterday's Error: An Efficient Online Learning Method for Traffic Demand Prediction [6.104967994062357]
FORESEE(Forecasting Online with Residual Smoothing and Ensemble Experts)は、正確で堅牢で効率的なオンライン適応フレームワークである。
これは、昨日の予測エラーを使用して、各地域の今日の予測を補正する。
バックボーンモデルを用いた7つの実世界のデータセットの実験では、ForESEEは予測精度を一貫して改善し、分散シフトが最小でもロバスト性を維持する。
論文 参考訳(メタデータ) (2026-02-25T10:19:39Z) - When Learning Hurts: Fixed-Pole RNN for Real-Time Online Training [58.25341036646294]
本研究では,再帰性極の学習がデータに有意な利点をもたらしない理由を解析的に検討し,実時間学習シナリオを実証的に提供する。
固定極ネットワークは、トレーニングの複雑さを低減し、オンラインリアルタイムタスクにより適していることを示す。
論文 参考訳(メタデータ) (2026-02-25T00:15:13Z) - R-ConstraintBench: Evaluating LLMs on NP-Complete Scheduling [0.0]
R-ConstraintBenchは、資源制約計画スケジューリング問題(RCPSP)のモデルを評価するフレームワークである。
データセンターのマイグレーション設定でベンチマークをインスタンス化し、実行可能性とエラー分析を用いて複数のLCMを評価する。
実証的には、強いモデルは優先順位のみのDAGでほぼシーリングされるが、ダウンタイム、時間的ウィンドウ、および解離的制約が相互作用すると、実現可能性のパフォーマンスは低下する。
論文 参考訳(メタデータ) (2025-08-21T03:35:58Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Faster Diffusion Action Segmentation [9.868244939496678]
時間的行動分類(TAS)はビデオ解析において不可欠な課題であり、連続したフレームを別のアクションセグメントに分割し分類することを目的としている。
拡散モデルの最近の進歩は、安定したトレーニングプロセスと高品質な生成能力により、TASタスクにおいて大きな成功を収めている。
本稿では,効率的かつ高性能なTASアルゴリズムであるEffiDiffActを提案する。
論文 参考訳(メタデータ) (2024-08-04T13:23:18Z) - FIRE: A Failure-Adaptive Reinforcement Learning Framework for Edge Computing Migrations [54.34189781923818]
FIREは、エッジコンピューティングのディジタルツイン環境でRLポリシーをトレーニングすることで、まれなイベントに適応するフレームワークである。
ImREは重要なサンプリングに基づくQ-ラーニングアルゴリズムであり、希少事象をその値関数への影響に比例してサンプリングする。
FIREは故障時にバニラRLやグリーディベースラインと比較してコストを削減できることを示す。
論文 参考訳(メタデータ) (2022-09-28T19:49:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。