論文の概要: InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
- arxiv url: http://arxiv.org/abs/2604.27419v1
- Date: Thu, 30 Apr 2026 04:49:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.9266
- Title: InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
- Title(参考訳): InteractWeb-Bench: 対話型Webサイト生成におけるマルチモーダルエージェントのBlind実行は可能か?
- Authors: Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang,
- Abstract要約: 実世界の開発は、非専門家からの曖昧で低品質な命令とモデル理解のセマンティックなミスアライメントという、重要なボトルネックによって制約されている。
InactWeb-Benchは、未経験の低コードユーザ条件下でWebサイト生成のための最初のマルチモーダル対話型ベンチマークである。
- 参考スコア(独自算出の注目度): 20.180246350877045
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the advancement of multimodal large language models (MLLMs) and coding agents, the website development has shifted from manual programming to agent-based project-level code synthesis. Existing benchmarks rely on idealized assumptions, especially for well-structured, information-rich inputs and static execution settings. In contrast, real-world development is constrained by a critical bottleneck: the semantic misalignment between ambiguous, low-quality instructions from non-expert users and model understanding, which results in a failure mode that we term blind execution. To address this gap, we introduce InteractWeb-Bench, the first multimodal interactive benchmark for website generation under non-expert low-code user conditions. InteractWeb-Bench introduces four types of user agents and persona-driven instruction perturbations to systematically simulate diverse user behaviors, including ambiguity, redundancy, and contradiction, grounded in requirement engineering defect taxonomies. We develop an interactive execution environment for agents, featuring a unified action space comprising Clarify, Implement, Verify, and Submit, enabling iterative intent refinement, code synthesis, and visual feedback-based validation. Extensive experiments and analysis reveal that frontier MLLM-based agents remain trapped in blind execution, exposing limitations in intent recognition and adaptive interaction.
- Abstract(参考訳): MLLM(Multimodal large language model)とコーディングエージェントの進歩により、Webサイトの開発は手動プログラミングからエージェントベースのプロジェクトレベルのコード合成へと移行した。
既存のベンチマークは、特に構造化された情報豊富な入力と静的な実行設定において、理想的な仮定に依存している。
対照的に、現実世界の開発は、非専門家からの曖昧で低品質な命令とモデル理解とのセマンティックなミスアライメントという重大なボトルネックによって制約されている。
このギャップに対処するために、InteractWeb-Benchは、未経験の低コードユーザ条件下でWebサイト生成のための最初のマルチモーダル対話型ベンチマークである。
InteractWeb-Benchは、4種類のユーザエージェントとペルソナ駆動の命令摂動を導入し、曖昧さ、冗長性、矛盾など多様なユーザの振る舞いを体系的にシミュレートする。
我々は,Clarify,Implement,Verify,Submitからなる統合されたアクション空間を特徴とするエージェントの対話型実行環境を開発し,反復的意図の洗練,コード合成,視覚的フィードバックに基づく検証を可能にする。
大規模な実験と分析により、フロンティアMLLMをベースとしたエージェントは、意図認識と適応的相互作用の制限を露呈し、盲目的実行に閉じ込められていることが明らかとなった。
関連論文リスト
- WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models [40.87133775066985]
我々はWebエンジニアリング能力のライフサイクルを統一的に評価するマルチモーダル・ベンチマークであるWebを紹介した。
Webは3つの入力モード(テキスト、画像)と3つのタスクタイプ(生成、編集、修復)にまたがる
評価のために,チェックリストに誘導されたLDM-as-a-Judgeプロトコルを採用し,実際のブラウザで自動生成されたWebサイトを生成するための新しいエージェント-as-a-Judgeパラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-20T13:09:38Z) - FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback [92.67587639164908]
マルチモーダルフィードバックを備えたフロントエンドコード生成のベンチマークであるFronTalkを紹介する。
我々は、フロントエンド開発タスクに集中し、100のマルチターン対話のコレクションであるFronTalkをキュレートする。
20モデルの評価は、文献で体系的に調査されていない2つの重要な課題を明らかにしている。
論文 参考訳(メタデータ) (2025-12-05T23:28:09Z) - WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality [62.43165871914528]
我々は、Web開発におけるLCM-as-a-judgeのパフォーマンスを評価するための体系的なベンチマークであるWebDevJudgeを紹介する。
WebDevJudgeは、構造化およびクエリグラウンドのルーリックで注釈付けされた、ペア化されたWeb実装よりも人間の好みラベルで構成されている。
詳細な分析によると、このギャップは、機能的同値性認識の失敗、タスク実現可能性の検証、バイアス軽減など、基本的なモデル上の制限に由来する。
論文 参考訳(メタデータ) (2025-10-21T12:16:04Z) - Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting [92.57796055887995]
本稿では,言語モデルエージェントの強化学習から後視体験のリプレイに適応するプロンプトフレームワークECHOを紹介する。
ECHOは失敗した試みで達成できた代替目標のために最適化された軌道を生成する。
我々は、テキストベースのナビゲーションと計画ベンチマークであるXMiniGridのステートフルバージョンと、協調的な情報収集企業シミュレーションであるPeopleJoinQAについて、ECHOを評価した。
論文 参考訳(メタデータ) (2025-10-11T18:11:09Z) - Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping [57.024913536420264]
MLLM(Multimodal Large Language Models)は、設計からコードへのタスクにおいて顕著な性能を示す。
本稿では,インタラクティブなWebページを生成する上で,MLLMを初めて体系的に研究する。
論文 参考訳(メタデータ) (2024-11-05T17:40:03Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z) - On the Multi-turn Instruction Following for Conversational Web Agents [83.51251174629084]
本稿では,ユーザと環境の両方で複数回にまたがる高度なインタラクションを必要とする,対話型Webナビゲーションの新たなタスクを紹介する。
本稿では,メモリ利用と自己回帰技術を用いた自己反射型メモリ拡張計画(Self-MAP)を提案する。
論文 参考訳(メタデータ) (2024-02-23T02:18:12Z) - Signifiers as a First-class Abstraction in Hypermedia Multi-Agent
Systems [0.6595290783361959]
我々は、Webベースのマルチエージェントシステムにおいて、シグニケータを第一級の抽象化として導入するために、Affordance TheoryとHuman-Computer Interactionの概念と方法を構築した。
我々は,情報利用の促進を目的とした,ハイパーメディア環境におけるシグニチャの文脈曝露に関する形式モデルを定義した。
論文 参考訳(メタデータ) (2023-02-14T10:54:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。