論文の概要: Invisible in Space, Visible in Time: Motion Vision CAPTCHA against GUI Agents
- arxiv url: http://arxiv.org/abs/2609.27461v1
- Date: Wed, 23 Sep 2026 07:27:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.931177
- Title: Invisible in Space, Visible in Time: Motion Vision CAPTCHA against GUI Agents
- Title(参考訳): Invisible in Space, Visible in Time: Motion Vision CAPTCHA against GUI Agents
- Abstract要約: Motion Vision CAPTCHA (MVCAP) は、階層型モーションベースのCAPTCHAフレームワークである。
MVCAPは、コヒーレントな動き、構造的な動き、生物学的動きの3つの段階においてインスタンス化される。
我々は、人間、ブラウザ利用エージェント、ネイティブコンピュータ利用エージェント、および追加のオフラインVQA設定を評価する。
- 参考スコア(独自算出の注目度): 99.41302832667334
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most existing visual CAPTCHAs remain spatially solvable: the required information is exposed by static appearance, local structure, and interface state. This assumption is weakened by advances in multimodal large language models (MLLMs) and Graphical User Interface (GUI) agents, which exhibit strong visual perception, reasoning, and browser interaction capabilities. We propose Motion Vision CAPTCHA (MVCAP), a hierarchical motion-based CAPTCHA framework in which target semantics are instantiated as motion-defined foreground structures and become recoverable only through temporal segregation from a dynamically evolving background. Built on this shared principle, MVCAP is instantiated in three perceptually progressive levels: coherent motion, structural motion, and biological motion. To evaluate this framework, we introduce MVCAP-Bench, a browser-based benchmark with 600 live CAPTCHA instances, together with a matched foreground-only control benchmark, MVCAP-Bench-FG. We evaluate humans, Browser Use agents, native computer use agents, and a supplementary offline VQA setting derived from the same instances. Results reveal a substantial human--agent gap: on the full MVCAP-Bench, human accuracy reaches 99.6%, whereas the best GUI agent achieves only 16.8%, close to the six-way chance level. The foreground-only control further shows that the key difficulty comes from dynamic background camouflage rather than answer format or browser interaction alone. These findings identify a measurable human--agent perception gap and position MVCAP-Bench as a benchmark for studying motion-defined perception in current agents.
- Abstract(参考訳): 既存のほとんどのビジュアルCAPTCHAは空間的に解決可能であり、必要な情報は静的な外観、局所構造、インターフェース状態によって露呈される。
この仮定は、マルチモーダルな大規模言語モデル(MLLM)とグラフィカルユーザインタフェース(GUI)エージェントの進歩によって弱まり、強力な視覚認識、推論、ブラウザのインタラクション能力を示す。
動作定義された前景構造としてターゲットセマンティクスをインスタンス化し,動的に変化する背景からの時間的分離によってのみ回復可能な階層型モーションベースCAPTCHAフレームワークであるMVCAPを提案する。
この共通原理に基づいて、MVCAPはコヒーレントな動き、構造的な動き、生物学的動きの3つの段階においてインスタンス化される。
このフレームワークを評価するために、600のライブCAPTCHAインスタンスを持つブラウザベースのベンチマークMVCAP-Benchと、一致するフォアグラウンドのみの制御ベンチマークMVCAP-Bench-FGを紹介する。
我々は、人間、ブラウザ利用エージェント、ネイティブコンピュータ利用エージェント、および同じインスタンスから派生した追加のオフラインVQA設定を評価する。
完全なMVAP-Benchでは、人間の精度は99.6%に達し、最高のGUIエージェントは16.8%しか達成していない。
フォアグラウンドのみの制御は、応答形式やブラウザのインタラクションのみでなく、動的バックグラウンドカモフラージュによっても重要な困難が生じることを示している。
これらの結果から,現在のエージェントにおける動作定義知覚の指標として,計測可能な人間-エージェントの知覚ギャップとMVAP-Benchの位置が同定された。
関連論文リスト
- CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training [18.35670595652216]
ReCAPはCAPTCHA対応のネイティブGUIエージェントで、現代的なインタラクティブなCAPTCHA課題を堅牢に解決することができる。
我々は,大規模CAPTCHAインタラクショントラジェクトリを生成する自動データ収集とキュレーションパイプラインを開発した。
CAPTCHAの解法は、しばしば多段階の相互作用と中間ミスからの回復を必要とするため、失敗トラジェクトリを利用して自己補正データを構築する。
ホールドアウトテストセット全体で、ReCAPはCAPTCHA解決の成功を約30%から80%に改善し、一般的なGUIエージェントベンチマークでは高いパフォーマンスを維持している。
論文 参考訳(メタデータ) (2026-03-23T23:35:59Z) - Next-Gen CAPTCHAs: Leveraging the Cognitive Gap for Scalable and Diverse GUI-Agent Defense [39.68941971572086]
我々は次世代のWebを高度なエージェントに対してセキュアにするためのスケーラブルな防御フレームワークであるNext-Gen CAPTCHAを紹介する。
静的データセットとは異なり、我々のベンチマークは堅牢なデータ生成パイプラインの上に構築されています。
我々は、対話的知覚、記憶、意思決定、行動において、永続的な人間エージェント「認知ギャップ」を利用する。
論文 参考訳(メタデータ) (2026-02-09T18:55:33Z) - HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval [11.757493828625869]
人間ビジョン駆動(Human Vision-Driven, HVD)モデルは、人間の視覚的な焦点を捉え、最先端のパフォーマンスを達成する。
本フレームワークは,2つのキーコンポーネントから構成される粗大なアライメント機構を確立する。
5つのベンチマークの実験では、HVDは人間のような視覚的焦点をキャプチャするだけでなく、最先端のパフォーマンスも達成している。
論文 参考訳(メタデータ) (2026-01-22T17:57:42Z) - See, Think, Act: Online Shopper Behavior Simulation with VLM Agents [58.92444959954643]
本稿では,視覚情報,特にWebページスクリーンショットのVLMによる動作シミュレーションへの統合について検討する。
我々は,協調行動予測と合理化生成にSFTを用いて,相互作用の完全な文脈を条件づける。
推論能力をさらに強化するため,RLを階層的な報酬構造と統合し,難易度因子によって拡張する。
論文 参考訳(メタデータ) (2025-10-22T05:07:14Z) - Spatial CAPTCHA: Generatively Benchmarking Spatial Reasoning for Human-Machine Differentiation [15.668734718800065]
本研究では,人間とMLLMの空間的推論における基本的差異を生かした,新しい人間検証フレームワークを提案する。
現代のAIに弱い低レベルの知覚タスクに依存する既存のCAPTCHAとは異なり、空間CAPTCHAは幾何学的推論、視点取り、精神的回転を必要とする動的質問を生成する。
対応するベンチマークであるSpatial-CAPTCHA-Benchでは、人間が10の最先端MLLMをはるかに上回り、最高のモデルは31.0%のPass@1精度しか達成していないことが示されている。
論文 参考訳(メタデータ) (2025-10-04T16:19:21Z) - Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents [23.715342148854006]
Open CaptchaWorldは、MLLMを使用したエージェントの視覚的推論とインタラクション能力を評価するために特別に設計された、Webベースのベンチマークとプラットフォームである。
その結果,Browser-Use Openai-o3 による成功率は 40.0% である。
これはOpen CaptchaWorldを、現在のマルチモーダルエージェントの限界を診断し、より堅牢なマルチモーダル推論システムの開発を導くための重要なベンチマークとして強調している。
論文 参考訳(メタデータ) (2025-05-30T17:59:55Z) - CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation [61.68049335444254]
MLLM(Multimodal large language model)は、人間のような自律型言語エージェントが現実世界の環境と相互作用する可能性を示している。
包括的環境認識(CEP)と条件付き行動予測(CAP)の2つの新しいアプローチを備えた包括的認知型LLMエージェントCoCo-Agentを提案する。
AITW と META-GUI ベンチマークにおいて,我々のエージェントは実シナリオで有望な性能を示す新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2024-02-19T08:29:03Z) - Slow-Fast Visual Tempo Learning for Video-based Action Recognition [78.3820439082979]
アクション・ビジュアル・テンポ(Action visual tempo)は、アクションのダイナミクスと時間スケールを特徴付ける。
以前の方法は、複数のレートで生のビデオをサンプリングするか、階層的にバックボーンの特徴をサンプリングすることによって、視覚的テンポをキャプチャする。
単一層における低レベルバックボーン特徴からアクション・テンポを抽出するための時間相関モジュール(TCM)を提案する。
論文 参考訳(メタデータ) (2022-02-24T14:20:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。