論文の概要: Are We There Yet? Assessing Computer-Use Agents for Blind Users' Accessible Interaction with Desktop Applications
- arxiv url: http://arxiv.org/abs/2609.00524v1
- Date: Tue, 01 Sep 2026 00:44:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.176361
- Title: Are We There Yet? Assessing Computer-Use Agents for Blind Users' Accessible Interaction with Desktop Applications
- Title(参考訳): コンピュータ利用エージェントによるデスクトップアプリケーションとのアクセシブルインタラクションの評価
- Authors: Satwik Ram Kodandaram, Monalika Padma Reddy, Xiaojun Bi, Jiawei Zhou, I. V. Ramakrishnan, Vikas Ashok,
- Abstract要約: 画面読み取り可能なCUAプロトタイプであるOLLAを用いて,視覚障害者8名を対象に3週間の日誌調査を行った。
スクリーンショット、UIツリー、モデルレスポンス、アクショントレースを備えた12のアプリケーションで1,258のコマンドを収集します。
我々は、GPT-5をデプロイ中に評価し、4つの追加モデルで同じコマンドを再実行し、GPT-5は52.5%の最高成功率を達成した。
- 参考スコア(独自算出の注目度): 14.052820982565668
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents are emerging as a paradigm for agentic human-AI interaction, combining language reasoning with multi-modal interface grounding to operate GUIs. Yet their effectiveness for blind screen-reader users in real-world desktop workflows remains unclear. We present a three-week diary study with 8 blind users using OLLA, a screen-reader-accessible CUA prototype, collecting 1,258 commands across 12 applications with screenshots, UI trees, model responses, and action traces. We evaluate GPT-5 during deployment and re-execute the same commands with four additional models. GPT-5 achieved the highest success rate at 52.5%. Trace analysis reveals grounding, planning, constraint-tracking, and termination failures, while interviews reveal beyond-automation needs.
- Abstract(参考訳): エージェント・ヒューマン・AIインタラクションのパラダイムとしてコンピュータ・ユース・エージェントが登場し、言語推論とGUIを操作するためのマルチモーダル・インタフェースが組み合わさっている。
しかし、実際のデスクトップワークフローにおけるブラインドスクリーンリーダーユーザに対する効果は、まだ不明である。
画面読み取り可能なCUAプロトタイプであるOLLAを用いて,スクリーンショット,UIツリー,モデル応答,アクショントレースを含む12のアプリケーションに対して1,258のコマンドを収集する。
デプロイ中のGPT-5を評価し、4つの追加モデルで同じコマンドを再実行した。
GPT-5は52.5%の最高成功率を記録した。
トレース分析は、基盤、計画、制約追跡、終了障害を明らかにし、インタビューは自動化以上のニーズを明らかにしている。
関連論文リスト
- PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents [32.98769345205729]
PIRA-Benchは、マルチモーダルな大規模言語モデル(MLLM)を、連続的、弱い教師付き視覚入力で評価するための新しいベンチマークである。
本稿では,複数のタスクスレッドを管理し,誤った視覚的入力を処理する汎用MLLMを実現する,メモリ対応の状態追跡フレームワークであるPIRFベースラインを提案する。
論文 参考訳(メタデータ) (2026-03-09T06:41:32Z) - Computer-Use Agents as Judges for Generative User Interface [142.75272102498806]
ComputerUse Agents (CUA) は、グラフィカルユーザインタフェース (GUI) を通じてデジタル環境を自律的に操作する能力が高まっている。
ほとんどのGUIは、人間が効率的にタスクを実行するのに不要な人間指向の動作を採用するために設計されている。
CUA は Coder でGUI の自動設計を支援することができるだろうか?
論文 参考訳(メタデータ) (2025-11-19T16:00:02Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction [69.57190742976091]
Aguvisは、自律的なGUIエージェントのためのビジョンベースのフレームワークである。
クロスプラットフォームのインタラクションを標準化し、内部モノローグによる構造化推論を取り入れている。
オフラインおよび実世界のオンラインベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-05T18:58:26Z) - Visual Grounding Methods for Efficient Interaction with Desktop Graphical User Interfaces [1.3107174618549584]
Instruction Visual Grounding (IVG) はグラフィカルユーザインタフェース (GUI) におけるオブジェクト識別のためのマルチモーダルアプローチである
本稿では、オブジェクト検出モデルであるLarge Language Model(LLM)とOCRモジュールを組み合わせたIVGocrと、エンド・ツー・エンドのグラウンド化にマルチモーダルアーキテクチャを用いたIVGdirectを提案する。
私たちの最終テストデータセットは、将来の研究をサポートするために公開されています。
論文 参考訳(メタデータ) (2024-05-05T19:10:19Z) - First Contact: Unsupervised Human-Machine Co-Adaptation via Mutual
Information Maximization [112.40598205054994]
我々はこのアイデアを、インターフェースを最適化するための完全に教師なしの目的として定式化する。
タイピング,シミュレートされたロボットの制御,ゲームプレイなど,様々なキーボードとアイアイのインタフェースを運用しているユーザの540K例について,観察的研究を行った。
以上の結果から,我々の相互情報スコアは,様々な領域における真真正タスク完了メトリクスの予測値であることが示唆された。
論文 参考訳(メタデータ) (2022-05-24T21:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。