論文の概要: PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions
- arxiv url: http://arxiv.org/abs/2606.14832v1
- Date: Fri, 12 Jun 2026 15:01:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.265774
- Title: PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions
- Title(参考訳): PhoneHarness: 混合GUI、CLI、ツールアクションによる電話使用エージェントのハーネス
- Abstract要約: PhoneHarnessは、検証可能なモバイル上で電話使用エージェントを研究するための混合アクションベンチマークと実行ハーネスである。
そのベンチマークであるPhoneHarness Benchは、エージェントが観測可能な副作用を持つタスクを完了したかどうかを評価する。
この結果から,信頼度の高い電話の自動化は,視覚的GUI制御だけでなく,動作面のルーティングと検証可能な実行に依存することが示唆された。
- 参考スコア(独自算出の注目度): 73.69976712292683
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Phone agents are increasingly expected to complete real mobile workflows rather than merely predict the next screen action. However, much of the current mobile-agent literature still evaluates agents primarily as GUI controllers that observe a screen, emit taps and swipes, and are scored by target app state. Real phone-use tasks are broader: they require deciding when to use app GUIs, device-side commands, or structured tools, while leaving evidence that the intended side effect actually occurred. We introduce PhoneHarness, a mixed-action benchmark and execution harness for studying phone-use agents on verifiable mobile workflows. PhoneHarness runs a device-side agent loop over GUI, CLI, and host-side tool actions, combining deterministic action routing with bounded GUI delegation and auditable execution traces. Its benchmark, PhoneHarness Bench, evaluates whether agents complete tasks with observable side effects, not only whether they produce plausible final answers. On the annotated evaluation split, PhoneHarness reaches a 75.0% pass rate, outperforming the strongest non-PhoneHarness settings by 12.9 percentage points. PhoneHarness and PhoneHarness Bench therefore play distinct but mutually dependent roles: the harness makes mixed phone workflows executable, while the benchmark measures whether agents can use that harness reliably and safely. Our findings suggest that reliable phone automation depends on action-surface routing and verifiable execution, not only visual GUI control.
- Abstract(参考訳): 電話エージェントは、次の画面アクションを単に予測するのではなく、実際のモバイルワークフローを完了することがますます期待されている。
しかし、現在のモバイルエージェントの文献の多くは、エージェントを主にGUIコントローラとして評価しており、画面を観察し、タップとスワイプを出力し、ターゲットのアプリ状態によってスコア付けされている。
アプリケーションGUI、デバイスサイドコマンド、構造化ツールをいつ使うかを決め、意図した副作用が実際に発生した証拠を残す必要がある。
我々はPhoneHarnessを紹介した。PhoneHarnessは、携帯電話用エージェントを検証可能なモバイルワークフローで研究するための混合アクションベンチマークと実行ハーネスである。
PhoneHarnessは、デバイス側エージェントループをGUI、CLI、ホスト側ツールアクション上で実行し、決定論的アクションルーティングと境界GUIデリゲートと監査可能な実行トレースを組み合わせる。
そのベンチマークであるPhoneHarness Benchは、エージェントが観測可能な副作用を持つタスクを完了したかどうかを評価する。
注釈付き評価分割では、PhoneHarnessは75.0%のパス率に達し、PhoneHarness以外の最強設定を12.9%上回った。
PhoneHarnessとPhoneHarness Benchは異なるが相互に依存する役割を担っている。
この結果から,信頼度の高い電話の自動化は,視覚的GUI制御だけでなく,動作面のルーティングと検証可能な実行に依存することが示唆された。
関連論文リスト
- EchoPath: Execution-Level Replayable Memory for GUI Agents [45.101663136838916]
本稿では,アーチファクト検証されたGUIトラジェクトリを標準化されたパラメータ制御型コール可能なメモリに変換する,モデルに依存しないハーネスであるEchoPathを紹介する。
各メモリにはタスクインテントキー、アプリケーションと状態の事前条件、フレキシブルな入力パラメータ、GUIエビデンス、バリデーション証明、ライフサイクル状態が格納される。
実際のコンピュータ使用タスクの実験では、EchoPathは中央値トークンのコストを90%以上削減し、中央値の実行時間を約60%削減した。
論文 参考訳(メタデータ) (2026-09-15T04:56:17Z) - MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks [37.73689537216401]
モバイルプランニングエージェントのツールコールと計画能力を評価するための,インタラクティブでステートフルでツール中心のベンチマークである textbfMobilePA-Bench を提案する。
MobilePA-Benchは、ライブアプリケーションデータベースを保持し、構造化されたフィードバックを返す実行可能なサンドボックスで動作し、13ドルの機能ドメインと212ドルのリアルなモバイルツールにまたがる。
対話型関数呼び出しサンドボックスとエビデンスベースの検証を組み合わせることで、MobilePA-Benchは実用的な診断ベンチマークとエージェント強化学習のための対話型基盤の両方として機能する。
論文 参考訳(メタデータ) (2026-08-24T09:38:24Z) - PalmClaw: A Native On-Device Agent Framework for Mobile Phones [16.173016265644673]
textbfPalmClawは、携帯電話上で動作し、セッション、メモリ、スキル、ツール、エージェントループを直接デバイス上で管理するオープンソースのエージェントフレームワークである。
PalmClawはデバイス機能を、明示的な引数、構造化された結果、明確に定義された実行バウンダリを備えたデバイスツールとして公開する。
実験では、タスクの成功率が11.5%向上し、最強のベースラインよりも94.9%の完了時間が短縮された。
論文 参考訳(メタデータ) (2026-07-14T17:58:57Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - PhoneBuddy: Training Open Models for Agentic Phone Use [104.23243994660936]
PhoneBuddyは、エージェント電話用のトレーニングレシピとオープンモデルラインである。
実際のGUI使用構造からモックアプリを再構築する、実アプリケーション環境とモックアプリ環境であるPhoneWorldを組み合わせる。
PhoneBuddyはまず、両方の環境で収集されたトラジェクトリから、共有された教師付き微調整ステージを構築し、その後、実アプリケーションRLと混合RLを比較した。
論文 参考訳(メタデータ) (2026-06-22T08:57:54Z) - WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces [27.11445886768225]
WeaveBenchは,8つの実世界の作業領域に114のタスクを持つ,長期にわたるハイブリッドインターフェースベンチマークである。
デプロイされたCLIエージェントランタイム内の実際のUbuntuデスクトップ上でこれらのタスクを評価し、最小限のデスクトップコントロールプラグインで拡張します。
フロンティアのモデルと実行時のペアリング全体では、最高のPassRateは41.2%にしか達せず、ベンチマークは飽和状態には程遠い。
論文 参考訳(メタデータ) (2026-06-08T12:39:23Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Computer-Use Agents as Judges for Generative User Interface [142.75272102498806]
ComputerUse Agents (CUA) は、グラフィカルユーザインタフェース (GUI) を通じてデジタル環境を自律的に操作する能力が高まっている。
ほとんどのGUIは、人間が効率的にタスクを実行するのに不要な人間指向の動作を採用するために設計されている。
CUA は Coder でGUI の自動設計を支援することができるだろうか?
論文 参考訳(メタデータ) (2025-11-19T16:00:02Z) - GTA1: GUI Test-time Scaling Agent [97.58177633084915]
グラフィカルユーザインタフェース(GUI)は、ユーザ命令をアクションプロポーザルに順次分解することで、プラットフォーム(例えばLinux)間で自律的にタスクを完了させる。
本稿では,前述の textbfGUI textbfTest-time Scaling textbfAgent,すなわち GTA1 の課題について検討する。
論文 参考訳(メタデータ) (2025-07-08T08:52:18Z) - MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment [63.62778707277929]
MobileGUI-RLは、オンライン環境でGUIエージェントをトレーニングするスケーラブルなフレームワークである。
自己探索とフィルタリングを通じて学習可能なタスクのカリキュラムを合成する。
GRPOをGUIナビゲーションに適応させ、軌道認識の利点と複合報酬を付与する。
論文 参考訳(メタデータ) (2025-07-08T07:07:53Z) - MAPLE: A Mobile Agent with Persistent Finite State Machines for Structured Task Reasoning [46.18718721121415]
アプリケーションインタラクションをFSM(Finite State Machine)として抽象化する,状態認識型マルチエージェントフレームワークMAPLEを提案する。
それぞれのUI画面を離散状態として、ユーザアクションをトランジションとしてモデル化し、FSMがアプリケーション実行の構造化された表現を提供できるようにします。
MAPLEは、計画、実行、検証、エラー回復、知識保持という4段階のタスク実行に責任を持つ特殊エージェントで構成されている。
論文 参考訳(メタデータ) (2025-05-29T16:08:51Z) - LlamaTouch: A Faithful and Scalable Testbed for Mobile UI Task Automation [8.998467488526327]
本稿では、デバイス上でのモバイルUIタスク実行と、忠実でスケーラブルなタスク評価のためのテストベッドであるLlamaTouchを提案する。
LlamaTouchは、エージェントが手動でアノテートされた本質的なアプリケーション/システム状態をすべてトラバースするかどうかのみを評価する、新しい評価アプローチを採用している。
LlamaTouchはまた、タスクアノテーションと新しいモバイルエージェントの統合を可能にする。
論文 参考訳(メタデータ) (2024-04-12T15:39:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。