論文の概要: Solaris: Towards Interfaces That Are Generated, Not Coded
- arxiv url: http://arxiv.org/abs/2609.00776v1
- Date: Tue, 01 Sep 2026 06:10:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.41032
- Title: Solaris: Towards Interfaces That Are Generated, Not Coded
- Title(参考訳): Solaris: コードではなく生成するインターフェースを目指して
- Authors: Yuval Alaluf, Omri Avrahami, Guy Bukchin Leshem, Michal Geyer, Kfir Goldberg, Elad Richardson, Diego Alarcón, Alejandro Alvarez, Cole Garry, Anastasis Germanidis, Tenaya Goldsen, Corina Gurau, Robin Kahlow, Joel Kwartler, Kathleen Lewis, Alejandro Matamala Ortiz, Eugene McMahon, Thon Prom, Sarah Saltonstall-Wurm, Jamie Umpherson, Hudson Yeo,
- Abstract要約: ユーザアクションに応答して,インタラクティブなUIを直接フレーム単位で生成するインターフェースワールドモデルであるSolarisを紹介する。
Solarisはマウスの相互作用を条件付け信号として扱い、対話的な速度で結果の視覚状態を自己回帰的に合成する。
言語モデルは、ユーザ意図を解釈し、インタラクションがどのように生成された環境に影響を与えるかを指定することで、視覚世界モデルを補完する。
- 参考スコア(独自算出の注目度): 61.80943145058668
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Digital interfaces are traditionally implemented through intermediate representations such as code, requiring their appearance and behavior to be specified in advance. We introduce Solaris, an interface world model that instead generates an interactive UI directly, frame by frame, in response to user actions. Solaris treats mouse interactions as conditioning signals and autoregressively synthesizes the resulting visual state at interactive speeds. To enable real-time generation while maintaining visual coherence over extended interactions, we combine autoregressive frame generation with few-step distillation and training on the model's own outputs. A language model complements the visual world model by interpreting user intent and specifying how interactions should affect the generated environment, separating high-level reasoning from visual rendering. By generating both the appearance and behavior of an interface dynamically, Solaris enables open-ended interactions that need not be explicitly programmed in advance. We view interface world models as a step toward a new paradigm for software, where interfaces are generated and adapted continuously around user intent rather than implemented as fixed collections of predefined states and
- Abstract(参考訳): デジタルインターフェースは伝統的にコードなどの中間表現を通じて実装されており、その外観や振る舞いを事前に指定する必要がある。
ユーザアクションに応答して,インタラクティブなUIを直接フレーム単位で生成するインターフェースワールドモデルであるSolarisを紹介する。
Solarisはマウスの相互作用を条件付け信号として扱い、対話的な速度で結果の視覚状態を自己回帰的に合成する。
拡張相互作用に対する視覚的コヒーレンスを維持しながらリアルタイムに生成を可能にするために, 自己回帰フレーム生成と数ステップの蒸留とモデル自身の出力のトレーニングを組み合わせる。
言語モデルは、ユーザ意図を解釈し、インタラクションがどのように生成された環境に影響を与えるかを定義し、視覚的レンダリングから高レベルの推論を分離することで、視覚世界モデルを補完する。
インターフェイスの外観と動作の両方を動的に生成することにより、Solarisは事前に明示的にプログラムする必要のないオープンなインタラクションを可能にする。
インターフェースは事前に定義された状態の固定されたコレクションとして実装されるのではなく、ユーザ意図に基づいて連続的に生成され、適応される。
関連論文リスト
- Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages [22.804937497354754]
複雑なインタラクションを伴う対話型Webページのコード生成を評価する最初のベンチマークであるWebIGBenchを紹介する。
手動で設計したインタラクションパスとUI自動化を組み合わせることで、現実世界のWebサイトから103の複雑なWebページを収集しました。
このベンチマークは、851の異なるインタラクティブアクションを含む5つの一般的なインタラクティブアクションタイプ(例えば、クリック、入力)をカバーする。
論文 参考訳(メタデータ) (2026-05-29T05:45:50Z) - From Static to Interactive: Adapting Visual in-Context Learners for User-Driven Tasks [5.208702297063032]
我々は静的な視覚的インコンテキスト学習者をユーザ駆動システム、すなわちInteractive DeLVMに変換する。
本研究は,ユーザ中心のビジュアルインコンテキスト学習における静的タスク適応と流体相互作用のギャップを埋めるものである。
論文 参考訳(メタデータ) (2026-04-08T07:13:56Z) - MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines [55.641812280108574]
ユーザアクションによって継続的に更新され,世代別ロールアウトを通じてクエリされるシステムに,明示的な外部メモリを導入する。
この設計により、ユーザーは編集可能なメモリ表現を通じて環境構造を直接、編集可能な制御を行うことができる。
コヒーレントな視点と一貫したクロスプレイヤーインタラクションを備えた、リアルタイムマルチプレイヤーロールアウトに自然に拡張する。
論文 参考訳(メタデータ) (2026-03-03T18:58:17Z) - Generative Interfaces for Language Models [70.25765232527762]
ユーザインタフェース(UI)を積極的に生成することにより,大規模言語モデル(LLM)がユーザクエリに応答するパラダイムを提案する。
本フレームワークは,ユーザクエリをタスク固有のUIに変換するために,構造化インターフェース固有の表現と反復的洗練を活用している。
その結果、生成的インタフェースは人間の嗜好を最大72%改善し、会話的インタフェースよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-08-26T17:43:20Z) - Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction [69.57190742976091]
Aguvisは、自律的なGUIエージェントのためのビジョンベースのフレームワークである。
クロスプラットフォームのインタラクションを標準化し、内部モノローグによる構造化推論を取り入れている。
オフラインおよび実世界のオンラインベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-05T18:58:26Z) - VIRT: Improving Representation-based Models for Text Matching through
Virtual Interaction [50.986371459817256]
本稿では,VIRT と呼ばれる新しいtextitVirtual InteRacTion 機構を提案する。
VIRTは、表現ベースのエンコーダに、対話ベースのモデルのように振舞いを模倣する仮想インタラクションを実行するよう要求する。
論文 参考訳(メタデータ) (2021-12-08T09:49:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。