論文の概要: A11YN: aligning LLMs for accessible web UI code generation
- arxiv url: http://arxiv.org/abs/2510.13914v1
- Date: Wed, 15 Oct 2025 06:42:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-17 21:15:14.537835
- Title: A11YN: aligning LLMs for accessible web UI code generation
- Title(参考訳): A11YN: アクセス可能なWeb UIコード生成のためのLLMの整列
- Authors: Janghan Yoon, Jaegwan Cho, Junhyeok Kim, Jiwan Chung, Jaehyun Jeon, Youngjae Yu,
- Abstract要約: A11ynは、アクセシビリティに準拠したWeb UIを確実に生成するために、コード生成の大きな言語モデルを整列させる最初の方法である。
A11ynは、Web Content Accessibility Guidelines(WCAG)の違反を罰する新しい報酬関数を最適化する
評価のために、パブリックWebページから300の現実世界のWeb UIリクエストをグラウンドし、手動でキュレートしたベンチマークであるRealUIReq-300を紹介する。
- 参考スコア(独自算出の注目度): 23.43138311599752
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) have recently demonstrated strong capabilities in generating functional and aesthetic web interfaces directly from instructions. However, these models often replicate accessibility flaws from their training data, resulting in interfaces that exclude users with diverse needs and contexts. To address this gap, we introduce A11yn, the first method that aligns code-generating LLMs to reliably produce accessibility-compliant web UIs. A11yn optimizes a novel reward function that penalizes violations of the Web Content Accessibility Guidelines (WCAG), with penalties scaled to the severity of each violation as identified by an accessibility testing engine. To support training, we construct UIReq-6.8K, a dataset of 6,800 diverse instructions for web UI generation. For evaluation, we introduce RealUIReq-300, a benchmark of 300 real-world web UI requests grounded and manually curated from public web pages, spanning a broad range of use cases. Empirical results show that A11yn significantly outperforms strong baselines, lowering the Inaccessibility Rate by 60% over the base model while preserving semantic fidelity and visual quality of generated UIs. These findings demonstrate that accessibility can be systematically optimized within LLMs, showing the feasibility of aligning code generation for accessibility.
- Abstract(参考訳): 大規模言語モデル(LLM)は、最近、インストラクションから直接機能的および美的なWebインターフェースを生成する強力な能力を示した。
しかし、これらのモデルは、しばしばトレーニングデータからアクセシビリティの欠陥を再現し、様々なニーズやコンテキストを持つユーザーを除外するインターフェースをもたらす。
このギャップに対処するために,コード生成LLMを整列させてアクセシビリティに適合したWeb UIを確実に生成する最初の方法であるA11ynを紹介する。
A11ynは、Web Content Accessibility Guidelines(WCAG)の違反を罰する、新しい報酬関数を最適化する。
トレーニングをサポートするために、Web UI生成のための6,800の多様な命令からなるデータセットであるUIReq-6.8Kを構築した。
評価のために、RealUIReq-300を紹介した。これは300の現実世界のWeb UIリクエストのベンチマークで、公開Webページから手動で作成され、幅広いユースケースにまたがる。
実験の結果、A11ynは強力なベースラインをはるかに上回り、ベースモデルよりもアクセシビリティ率を60%低下させ、セマンティックな忠実さとUIの視覚的品質を保った。
これらの結果は、アクセシビリティをLLM内で体系的に最適化できることを示し、アクセシビリティのためのコード生成の整合性を示す。
関連論文リスト
- Enhanced Web Payload Classification Using WAMM: An AI-Based Framework for Dataset Refinement and Model Evaluation [0.0]
WAMMは、ルールベースのシステムの限界を明らかにするために設計された、AI駆動のマルチクラスWeb攻撃検出フレームワークである。
XGBoostはマイクロ秒レベルの推論で99.59%の精度に達し、ディープラーニングモデルはノイズ増大の下で劣化する。
これらの発見は、広くデプロイされたルールベースの防御のギャップを明らかにし、効率的な機械学習モデルと組み合わせることで、実運用のWAF環境に適したWeb攻撃検出に対するよりレジリエントでリアルタイムなアプローチを可能にすることを実証している。
論文 参考訳(メタデータ) (2025-12-29T17:10:36Z) - WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning [24.178675410636135]
実世界のポータルサイトから収集した45.1kのWebページの大規模なベンチマークを示す。
また、最終レンダリングページからレイアウトとスタイルの整合性を測定する新しい評価指標を提案する。
論文 参考訳(メタデータ) (2025-10-05T08:47:39Z) - IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video? [56.33950760097989]
IWR-Benchは、ビデオからインタラクティブなWebページ再構築におけるLVLM(Large Vision-Language Models)の機能を評価するための新しいベンチマークである。
IWR-Benchは100の現実世界のウェブサイトから1,001のアクションで1,3の精巧にキュレートされたタスクで構成されている。
このベンチマークは、ビデオとアセットからインタラクションロジックを推論する包括的なマルチモーダル推論と、このロジックを関数コードに変換するための高度なコード生成という、2つの基本的な課題に関するモデルを評価する。
論文 参考訳(メタデータ) (2025-09-29T12:38:06Z) - ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search [53.40810298627443]
ReGUIDEは、MLLMが自己生成的推論と空間認識的批判を通じてデータを効率的に学習することを可能にするWebグラウンドのためのフレームワークである。
実験により、ReGUIDEは複数のベンチマークでWebグラウンド性能を大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-05-21T08:36:18Z) - Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI [0.0]
この研究は、自動車用UIの理解と操作を容易にするビジョン言語フレームワークを導入している。
この分野での研究を支援するために、AutomotiveUI-Bench-4Kもリリースされた。
Molmo-7B ベースのモデルはローランド適応 (LoRa) を用いて微調整され、生成した推論と視覚的グラウンドと評価能力が組み込まれている。
論文 参考訳(メタデータ) (2025-05-09T09:01:52Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining [67.87810796668981]
インフォメーション・インフォメーション・インフォメーション・クロッピング(ISC)と自己精製デュアルラーニング(SRDL)
Irisは850KのGUIアノテーションだけで、複数のベンチマークで最先端のパフォーマンスを実現している。
これらの改善は、WebとOSエージェントの両方の下流タスクで大幅に向上した。
論文 参考訳(メタデータ) (2024-12-13T18:40:10Z) - Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach [56.55633052479446]
Webスケールのビジュアルエンティティ認識は、クリーンで大規模なトレーニングデータがないため、重大な課題を呈している。
本稿では,ラベル検証,メタデータ生成,合理性説明に多モーダル大言語モデル(LLM)を活用することによって,そのようなデータセットをキュレートする新しい手法を提案する。
実験により、この自動キュレートされたデータに基づいてトレーニングされたモデルは、Webスケールの視覚的エンティティ認識タスクで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2024-10-31T06:55:24Z) - EDGE: Enhanced Grounded GUI Understanding with Enriched Multi-Granularity Synthetic Data [15.801018643716437]
本稿では,大規模視覚言語モデル(LVLM)のGUI理解と対話能力を,データ駆動型アプローチにより向上することを目的とする。
本稿では,Web上のWebページから大規模で粒度の高いトレーニングデータを自動的に生成する汎用データ合成フレームワークEDGEを提案する。
提案手法は,手動アノテーションへの依存を著しく低減し,研究者がWeb上で利用可能な膨大な公開リソースを活用して作業を進めることを可能にする。
論文 参考訳(メタデータ) (2024-10-25T10:46:17Z) - Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation [67.18144414660681]
オンラインビジョン・アンド・ランゲージナビゲーション(VLN)のためのFSTTA(Fast-Slow Test-Time Adaptation)アプローチを提案する。
提案手法は,4つのベンチマークにおいて顕著な性能向上を実現する。
論文 参考訳(メタデータ) (2023-11-22T07:47:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。