論文の概要: Flow-A11y: Flow-Aware Accessibility Testing
- arxiv url: http://arxiv.org/abs/2607.03100v1
- Date: Fri, 03 Jul 2026 08:36:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.520209
- Title: Flow-A11y: Flow-Aware Accessibility Testing
- Title(参考訳): Flow-A11y: Flow-Awareアクセシビリティテスト
- Abstract要約: 本稿では,フロー認識型アクセシビリティテストシステムであるFlow-A11yについて述べる。
Flow-A11yは一般的なブラウザエージェント監査の10倍以上のオーラクル契約を実現していることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern web applications increasingly expose accessibility barriers through interaction flows rather than static page snapshots. Keyboard traps, focus loss, modal leakage, delayed status updates, dynamic controls, and changing page regions often become observable only after users perform concrete actions. These behaviors are directly related to dynamic WCAG criteria, yet they remain difficult to automate because their assessment depends on runtime interaction evidence and is still commonly performed through manual inspection. We present Flow-A11y, a flow-aware accessibility testing system for interaction-dependent WCAG criteria. Given a target page and a natural-language scenario, Flow-A11y executes the flow in a real browser, records an ordered runtime trace, constructs criterion-specific evidence packets, gates unsupported judgments, and emits auditable findings grounded in resolvable runtime evidence. Evaluated on 19 real public-web scenarios covering 45 dynamic WCAG criteria, Flow-A11y achieves over ten times higher oracle agreement than a generic browser-agent audit, while its evidence-calibration layer improves fail precision from 23.5% to 41.4% and eliminates invalid evidence references. These results show that runtime traces provide actionable evidence for assessing interaction-dependent accessibility behavior. They demonstrate a practical path toward automating dynamic WCAG criteria that page-level scanners cannot assess and that have traditionally required manual evaluation.
- Abstract(参考訳): 現代のWebアプリケーションは、静的なページスナップショットではなく、インタラクションフローを通じてアクセシビリティ障壁を公開する傾向にある。
キーボードトラップ、フォーカスロス、モーダルリーク、状態更新の遅れ、動的コントロール、ページ領域の変更は、ユーザが具体的なアクションを実行した後のみ観測可能である。
これらの動作は動的WCAG基準に直接関係しているが、実行時の相互作用の証拠に依存するため自動化が困難であり、手作業による検査が一般的である。
本稿では,フロー認識型アクセシビリティテストシステムであるFlow-A11yについて述べる。
ターゲットページと自然言語のシナリオが与えられたFlow-A11yは、実際のブラウザでフローを実行し、順序付けられたランタイムトレースを記録し、クレーター固有のエビデンスパケットを構築し、ゲートなしの判断を行い、解決可能なランタイムエビデンスに基礎を置いた監査可能な結果を出力する。
45の動的WCAG基準をカバーする19の実際のパブリックウェブシナリオに基づいて評価され、Flow-A11yは一般的なブラウザエージェント監査の10倍以上のオラクル合意を達成する一方、エビデンス校正層は失敗の精度を23.5%から41.4%に改善し、無効な証拠参照を排除している。
これらの結果は、実行時トレースが相互作用に依存したアクセシビリティ動作を評価するための実用的な証拠を提供することを示している。
ページレベルのスキャナでは評価できない、従来は手動による評価を必要とするという動的WCAG基準の自動化に向けた実践的な道筋を示す。
関連論文リスト
- ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - DocOS: Towards Proactive Document-Guided Actions in GUI Agents [54.27655693145045]
textbfDocOSは、完全にインタラクティブな環境で文書誘導問題解決を評価するために設計されたベンチマークである。
実験の結果、エージェントはプロアクティブ検索中に関連情報を確実に見つけるのに苦労し、検索した指示を忠実に正確な行動に移すのに失敗することが判明した。
論文 参考訳(メタデータ) (2026-05-18T08:36:04Z) - Indirect Prompt Injection in the Wild: An Empirical Study of Prevalence, Techniques, and Objectives [15.03910974112065]
LLMは、Webコンテンツを閲覧、検索、要約、動作させるシステムに統合されつつある。
これにより、サイトオーナー、コントリビュータ、および敵が直接Webリソースに命令を埋め込むことができる。
本稿では,WebページやHTTP応答における間接的インジェクションの大規模解析について紹介する。
論文 参考訳(メタデータ) (2026-04-29T21:09:21Z) - TraceScope: Interactive URL Triage via Decoupled Checklist Adjudication [14.375064108289115]
私たちは、このワークフローを大規模に運用する、分離されたトリアージパイプラインであるTraceScopeを紹介します。
サンドボックス操作エージェントは、オブザーバ効果を防止し、安全性を確保するため、ページ動作を誘発する視覚的モチベーションによってガイドされた実際のGUIブラウザを駆動する。
MITRE ATT&CKチェックリストを検証するために要求の証拠を照会し、妥協の指標(IOC)を抽出した監査可読レポートを生成する。
我々の評価によると、TraceScopeは現実世界のシナリオでも優れた性能を示し、最先端の防御が特定できない高度なフィッシングの試みをうまく検出する。
論文 参考訳(メタデータ) (2026-04-23T16:31:42Z) - AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation [71.49152943451328]
我々は,AJ-Benchベンチマークを導入し,ドメイン検索,データシステム,グラフィカルユーザインタフェースの3つの領域にまたがるエージェント・アズ・ア・Judgeを評価する。
実験ではLLM-as-a-Judgeベースラインよりも一貫したパフォーマンス向上を示し、エージェントベースの検証においてかなりオープンな課題を明らかにした。
論文 参考訳(メタデータ) (2026-04-20T13:23:38Z) - Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes [37.92248202525651]
本稿では,低レベルの物理的実行から高レベルのユーザ意図理解を分離するためのDual-Stage Intent-Aware (DS-IA)フレームワークを提案する。
試験の結果、DS-IAは58.56%(ベースラインを28%以上上回る)のエクサクトマッチ(EM)を達成し、無効命令の拒否率を87.04%に改善した。
論文 参考訳(メタデータ) (2026-03-17T07:38:39Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - PATHWAYS: Evaluating Investigation and Context Discovery in AI Web Agents [0.0]
PATHWAYSは250のマルチステップ決定タスクのベンチマークである。
Webベースのエージェントが、隠れたコンテキスト情報を発見し、正しく使用できるかをテストする。
論文 参考訳(メタデータ) (2026-02-05T06:24:23Z) - BLADE: Behavior-Level Anomaly Detection Using Network Traffic in Web Services [7.024862094862467]
BLADEは、Webサービスのための新しい教師なしトラフィック異常検知システムである。
BLADEはフローオートエンコーダを利用して潜在特徴表現を学習し、フロー毎の再構成損失を算出する。
BLADEはカスタムデータセットとCIC-IDS 2017データセットの両方で広く評価されている。
論文 参考訳(メタデータ) (2025-11-07T12:25:39Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。