論文の概要: Enabling Creative Exploration for Vibe Design Agents
- arxiv url: http://arxiv.org/abs/2609.15078v1
- Date: Mon, 14 Sep 2026 05:49:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.111296
- Title: Enabling Creative Exploration for Vibe Design Agents
- Title(参考訳): 生体デザインエージェントのための創造的探索法の開発
- Abstract要約: 有用なデザインエージェントは、1つの有効なページを生成する以上のことをすべきです。
トークンレベルの温度の上昇は、美的な決定と構文に敏感なコードを同時に変更するため、鈍い解決策である。
代わりに、設計の方向性を明確な中間決定とする推論アーキテクチャを通じて、実装から調査を分離します。
- 参考スコア(独自算出の注目度): 13.128286238311732
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vibe design agents turn natural-language briefs into rendered interfaces and frontend code. Yet a useful design agent should do more than produce one valid page: it should help users explore coherent alternatives. Increasing token-level temperature is a blunt solution because it varies aesthetic decisions and syntax-sensitive code at the same time. We instead separate exploration from implementation through an inference architecture that makes design direction an explicit intermediate decision. Inspired by Verbalized Sampling, a pre-pass proposes structured design specifications with typicality scores, an external selector samples one, and the downstream generator realizes the selected specification together with the original request under fixed settings. We apply this approach to UI themes and visual-asset prompts. Across 168 prompts, with 1,255 paired comparisons per temperature for each intervention, theme sampling broadens observed selection coverage and screenshot variation, while LLM-judge preferences vary across interventions, prompt complexity, and viewport. In an online experiment with more than 300,000 tasks, the observed code-export increase remains statistically uncertain, while fewer negative feedback events coexist with more correction interactions and modest operational costs. Together, these findings identify structured design specifications as a practical control point for exploring alternative UI concepts while keeping downstream generation settings fixed.
- Abstract(参考訳): Vibeデザインエージェントは、自然言語のブリーフィングをレンダリングされたインターフェイスやフロントエンドコードに変換する。
しかし、便利なデザインエージェントは、1つの有効なページを作る以上のことをすべきである。
トークンレベルの温度の上昇は、美的な決定と構文に敏感なコードを同時に変更するため、鈍い解決策である。
代わりに、設計の方向性を明確な中間決定とする推論アーキテクチャを通じて、実装から調査を分離します。
Verbalized Smplingにインスパイアされた事前パスは、典型的なスコアを持つ構造化設計仕様、外部セレクタが1つをサンプリングし、下流ジェネレータは、元の要求と固定された設定で選択された仕様を実現する。
このアプローチをUIテーマとビジュアルアセスメントプロンプトに適用する。
168を超えるプロンプトは、各介入ごとに1,255対の温度比較を行い、テーマサンプリングは、観察された選択カバレッジとスクリーンショットのバリエーションを拡大する一方、LLM-judgeの選好は介入、複雑さ、ビューポートによって異なる。
30万以上のタスクによるオンライン実験では、観測されたコードエクスポートの増加は統計的に不確実なままであり、一方で、より多くの修正インタラクションと控えめな運用コストと共存する負のフィードバックイベントが少ない。
これらの知見は、下流生成設定を固定しつつ、代替UI概念を探索するための実用的な制御ポイントとして構造化設計仕様を特定した。
関連論文リスト
- Secret MCP: Evidence-Bounded and Context-Isolated Design Specification Generation from Web Screenshots [0.0]
Secret MCPは、公開Web参照ごとに1つの監査可能な設計仕様を生成する。
文書構造、相互作用論理、応答性規則、そして推測から観察を区別するために必要となる証明。
論文 参考訳(メタデータ) (2026-08-24T14:32:52Z) - UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution [8.271561163238383]
UniEvo-RS (UniEvo-RS) は、代表的模範駆動型プロトタイプ進化を備えた、オムニプロンプト統合RSセグメンテーションフレームワークである。
テキスト駆動型および視覚駆動型プロンプトを単一のアーキテクチャ内で統合するマルチインストラクションプロンプトデータセットを構築した。
マニュアルアノテーションと例題の初期の予測とを対比することにより、UniEvo-RSは予測エラーを正と負のプロトタイプに蒸留する。
論文 参考訳(メタデータ) (2026-08-04T16:39:34Z) - TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization [6.670146926866281]
我々は、自然言語設計意図と反復的トポロジ最適化を結びつけるマルチエージェントAIフレームワークTO-Agentsを提案する。
このフレームワークは、人間が提供する問題記述を検証されたソルバ入力に変換し、トポロジ最適化ソルバを実行し、結果の3Dトポロジをレンダリングする。
本研究では,カンチレバービームベンチマークと携帯電話対応製品設計という,長期にわたる2つの設計課題に関するフレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-05-20T18:32:56Z) - DeepPresenter: Environment-Grounded Reflection for Agentic Presentation Generation [75.7505732466149]
DeepPresenterは多様なユーザ意図に適応するエージェントフレームワークである。
DeepPresenterは、中間のスライドアーティファクトを自律的に計画し、レンダリングし、修正する。
論文 参考訳(メタデータ) (2026-02-26T10:26:48Z) - Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation [63.042451267669485]
Inference-time Scaling のための Prompt Redesign を提案する。これは、拡張された視覚世代に対応するために、推論中にプロンプトを適応的に修正するフレームワークである。
そこで我々は,素早い属性と生成した視覚の微粒化レベルでのアライメントを評価する,新しい検証手法である要素レベルの事実補正を導入する。
テキスト・ツー・イメージ・ベンチマークとテキスト・ツー・ビデオ・ベンチマークによる実験により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2025-12-03T07:54:05Z) - Inference-Time Personalized Alignment with a Few User Preference Queries [24.28598841525897]
生成モデルの応答とユーザの好みを一致させる問題について検討する。
提案するUserAlignは,複数クエリによるユーザの好みを,ペアの応答比較として提案する。
論文 参考訳(メタデータ) (2025-11-04T20:07:03Z) - GTA1: GUI Test-time Scaling Agent [97.58177633084915]
グラフィカルユーザインタフェース(GUI)は、ユーザ命令をアクションプロポーザルに順次分解することで、プラットフォーム(例えばLinux)間で自律的にタスクを完了させる。
本稿では,前述の textbfGUI textbfTest-time Scaling textbfAgent,すなわち GTA1 の課題について検討する。
論文 参考訳(メタデータ) (2025-07-08T08:52:18Z) - Continual Adaptation: Environment-Conditional Parameter Generation for Object Detection in Dynamic Scenarios [54.58186816693791]
環境は時間と空間によって常に変化し、クローズドセットの仮定に基づいて訓練された物体検出器にとって重要な課題となる。
そこで本研究では,微調整過程をパラメータ生成に変換する機構を提案する。
特に,2経路LoRAベースのドメイン認識アダプタを最初に設計し,特徴をドメイン不変およびドメイン固有コンポーネントに分解する。
論文 参考訳(メタデータ) (2025-06-30T17:14:12Z) - Token-Level Prompt Mixture with Parameter-Free Routing for Federated Domain Generalization [51.562474873972086]
Federated Domain Generalization (FedDG)は、異種データを持つ分散クライアントからグローバルに一般化可能なモデルを学ぶことを目的としている。
近年の研究では、単一のグローバルなプロンプトを学習することで、FedDGの視覚言語モデル(VLM)を適応させる素早い学習が導入されている。
本稿では,FedDGのためのパラメータフリールーティングフレームワークであるTRIPを提案する。
論文 参考訳(メタデータ) (2025-04-29T11:06:03Z) - A Refreshed Similarity-based Upsampler for Direct High-Ratio Feature Upsampling [54.05517338122698]
一般的な類似性に基づく機能アップサンプリングパイプラインが提案されている。
本稿では,セマンティック・アウェアとディテール・アウェアの両方の観点から,明示的に制御可能なクエリキー機能アライメントを提案する。
我々は,モーザイクアーティファクトを緩和する上ではシンプルだが有効であるHR特徴に対して,きめ細かな近傍選択戦略を開発する。
論文 参考訳(メタデータ) (2024-07-02T14:12:21Z) - Transforming the Interactive Segmentation for Medical Imaging [34.57242805353604]
本研究の目的は,人間のパフォーマンスに遅れる難易度の高い構造物の自動セグメンテーションをインタラクティブに洗練することである。
対話型(TIS)のための新しいトランスフォーマーアーキテクチャを提案する。
提案アーキテクチャはトランスフォーマーデコーダの変種で構成されており,アテンション機構と機能比較を自然に行う。
論文 参考訳(メタデータ) (2022-08-20T03:28:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。