論文の概要: Towards Better Semantic Understanding of Mobile Interfaces
- arxiv url: http://arxiv.org/abs/2210.02663v1
- Date: Thu, 6 Oct 2022 03:48:54 GMT
- ステータス: 処理完了
- システム内更新日: 2022-10-07 15:16:55.957048
- Title: Towards Better Semantic Understanding of Mobile Interfaces
- Title(参考訳): モバイルインタフェースの意味理解向上に向けて
- Authors: Srinivas Sunkara, Maria Wang, Lijuan Liu, Gilles Baechler, Yu-Chung
Hsiao, Jindong (JD) Chen, Abhanshu Sharma and James Stout
- Abstract要約: UI要素の機能の理解を深めることを目的とした,約500万のユニークなアノテーションを備えた,人間アノテーション付きデータセットをリリースしています。
このデータセットは、モバイルUIの大規模なデータセットであるRICOのイメージとビュー階層を拡張している。
また、画像のみの入力とマルチモーダル入力を用いたモデルもリリースし、様々なアーキテクチャを実験し、新しいデータセットでマルチモーダル入力を使用することの利点について検討する。
- 参考スコア(独自算出の注目度): 7.756895821262432
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Improving the accessibility and automation capabilities of mobile devices can
have a significant positive impact on the daily lives of countless users. To
stimulate research in this direction, we release a human-annotated dataset with
approximately 500k unique annotations aimed at increasing the understanding of
the functionality of UI elements. This dataset augments images and view
hierarchies from RICO, a large dataset of mobile UIs, with annotations for
icons based on their shapes and semantics, and associations between different
elements and their corresponding text labels, resulting in a significant
increase in the number of UI elements and the categories assigned to them. We
also release models using image-only and multimodal inputs; we experiment with
various architectures and study the benefits of using multimodal inputs on the
new dataset. Our models demonstrate strong performance on an evaluation set of
unseen apps, indicating their generalizability to newer screens. These models,
combined with the new dataset, can enable innovative functionalities like
referring to UI elements by their labels, improved coverage and better
semantics for icons etc., which would go a long way in making UIs more usable
for everyone.
- Abstract(参考訳): モバイルデバイスのアクセシビリティと自動化機能の改善は、無数のユーザーの日常生活に大きな影響を与える可能性がある。
この方向に研究を刺激するため、UI要素の機能の理解を高めることを目的とした、約500万のユニークなアノテーションを備えた人間アノテーション付きデータセットをリリースする。
このデータセットは、モバイルUIの大規模なデータセットであるRICOのイメージとビュー階層を拡張し、その形状とセマンティクスに基づいたアイコンのアノテーションと、異なる要素と対応するテキストラベルの関連付けにより、UI要素の数とそれらに割り当てられたカテゴリが大幅に増加する。
画像のみの入力とマルチモーダル入力を用いたモデルもリリースし、様々なアーキテクチャを実験し、新しいデータセットでマルチモーダル入力を使用することの利点について検討する。
我々のモデルは、目に見えないアプリの評価セットで強力な性能を示し、新しい画面への一般化性を示している。
これらのモデルと新しいデータセットを組み合わせることで、ラベルによるUI要素の参照、アイコンのカバレッジの改善、セマンティクスの改善といった革新的な機能を実現することができる。
関連論文リスト
- UI Semantic Group Detection: Grouping UI Elements with Similar Semantics
in Mobile Graphical User Interface [10.80156450091773]
UI要素のグループ化に関する既存の研究は、主に単一のUI関連ソフトウェアエンジニアリングタスクに焦点を当てており、そのグループは外観と機能が異なる。
類似のセマンティクスで隣接したテキストと非テキスト要素をパックするセマンティクスコンポーネントグループを提案する。
UIページ上のセマンティックコンポーネント群を認識するために,我々は,堅牢で深層学習に基づく視覚検出システムであるUISCGDを提案する。
論文 参考訳(メタデータ) (2024-03-08T01:52:44Z) - Interfacing Foundation Models' Embeddings [136.93591492633607]
FINDはファウンデーションモデルの埋め込みを調整するための汎用インターフェースである。
これは、同じアーキテクチャと重みの下で、検索、セグメンテーション、textitetc.にまたがる様々なタスクに適用される。
インターリーブされた埋め込み空間を考慮して,COCOデータセットに新たなトレーニングと評価アノテーションを導入したFIND-Benchを導入する。
論文 参考訳(メタデータ) (2023-12-12T18:58:02Z) - StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized
Image-Dialogue Data [129.92449761766025]
本稿では,視覚的インストラクションチューニングのための画像と対話を同期的に合成する新しいデータ収集手法を提案する。
このアプローチは生成モデルのパワーを活用し、ChatGPTとテキスト・ツー・イメージ生成モデルの能力とを結合する。
本研究は,各種データセットを対象とした総合的な実験を含む。
論文 参考訳(メタデータ) (2023-08-20T12:43:52Z) - infoVerse: A Universal Framework for Dataset Characterization with
Multidimensional Meta-information [68.76707843019886]
infoVerseは、データセットの特徴付けのための普遍的なフレームワークである。
infoVerseは、様々なモデル駆動メタ情報を統合することで、データセットの多次元特性をキャプチャする。
実世界の3つのアプリケーション(データプルーニング、アクティブラーニング、データアノテーション)において、infoVerse空間で選択されたサンプルは、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2023-05-30T18:12:48Z) - Modeling Entities as Semantic Points for Visual Information Extraction
in the Wild [55.91783742370978]
文書画像から鍵情報を正確かつ堅牢に抽出する手法を提案する。
我々は、エンティティを意味的ポイントとして明示的にモデル化する。つまり、エンティティの中心点は、異なるエンティティの属性と関係を記述する意味情報によって豊かになる。
提案手法は,従来の最先端モデルと比較して,エンティティラベルとリンクの性能を著しく向上させることができる。
論文 参考訳(メタデータ) (2023-03-23T08:21:16Z) - Spotlight: Mobile UI Understanding using Vision-Language Models with a
Focus [9.401663915424008]
本稿では,UIのスクリーンショットと画面上の関心領域のみを入力とする視覚言語モデルを提案する。
実験の結果,本モデルではいくつかのUIタスクにおいてSoTA結果が得られ,従来手法よりも優れていたことが判明した。
論文 参考訳(メタデータ) (2022-09-29T16:45:43Z) - Fashionformer: A simple, Effective and Unified Baseline for Human
Fashion Segmentation and Recognition [80.74495836502919]
本研究では,共同ファッションセグメンテーションと属性認識に着目した。
本稿では,セグメンテーションのためのオブジェクトクエリと属性予測のための属性クエリを紹介する。
属性ストリームのために,よりきめ細かい特徴を探索する新しいマルチレイヤレンダリングモジュールを設計する。
論文 参考訳(メタデータ) (2022-04-10T11:11:10Z) - UIBert: Learning Generic Multimodal Representations for UI Understanding [12.931540149350633]
大規模な未ラベルUIデータに対する新しい事前学習タスクによって訓練されたトランスフォーマーベースの共同画像テキストモデルを提案する。
私たちの重要な直感は、UIの異種機能は自己整合である、つまり、UIコンポーネントのイメージとテキスト機能は、相互に予測可能である、ということです。
この自己アライメントを利用した5つの事前学習タスクを提案する。
UIBertは、最大9.26%の精度で強力なマルチモーダルベースラインを上回ります。
論文 参考訳(メタデータ) (2021-07-29T03:51:36Z) - Multimodal Icon Annotation For Mobile Applications [11.342641993269693]
本稿では、画素とビュー階層の利点を組み合わせた、新しいディープラーニングに基づくマルチモーダルアプローチを提案する。
リコで最もよく使われている29個のアイコンを手動でアノテートすることで、提供されたユーティリティを示すために、高品質なUIデータセットを作成します。
論文 参考訳(メタデータ) (2021-07-09T13:57:37Z) - ActionBert: Leveraging User Actions for Semantic Understanding of User
Interfaces [12.52699475631247]
ActionBertと呼ばれる新しいトレーニング済みのUI表現モデルを紹介します。
本手法は,ユーザインタラクショントレースにおける視覚的,言語的,ドメイン特有の特徴を活用し,uiとそのコンポーネントの汎用的な特徴表現を事前学習するように設計されている。
実験により、提案するactionbertモデルは、下流タスク全体のマルチモーダルベースラインを最大15.5%上回ることがわかった。
論文 参考訳(メタデータ) (2020-12-22T20:49:52Z) - Disentangled Graph Collaborative Filtering [100.26835145396782]
Disentangled Graph Collaborative Filtering (DGCF)は、インタラクションデータからユーザとアイテムの情報表現を学ぶための新しいモデルである。
ユーザ・イテムのインタラクション毎に意図を超越した分布をモデル化することにより、インテント・アウェアなインタラクショングラフと表現を反復的に洗練する。
DGCFはNGCF、DisenGCN、MacridVAEといった最先端モデルよりも大幅に改善されている。
論文 参考訳(メタデータ) (2020-07-03T15:37:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。