論文の概要: How Well Can AI Generate Backlogs from App Mockups?
- arxiv url: http://arxiv.org/abs/2607.22902v1
- Date: Fri, 24 Jul 2026 20:40:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.924566
- Title: How Well Can AI Generate Backlogs from App Mockups?
- Title(参考訳): アプリモックアップからバックログを生成するにはどうすればよいか?
- Authors: Andrea Lezcano Airaldi, Lourdes Romera, Walid Maalej,
- Abstract要約: ビジュアルアプリのモックアップからバックログを生成するためのマルチモーダルアプローチを提案する。
2つの国で7つのアプリ開発プロジェクトを調査し、その結果について開発者にインタビューした。
- 参考スコア(独自算出の注目度): 5.513644888428808
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Creating sprint backlogs requires considerable effort, as items such as epics, user stories, and tasks can be missed or inconsistently specified. We propose a multimodal approach to support backlog generation from visual app mockups, an artifact available at early project stages. We evaluate three prompting strategies on GPT-4o: a zero-shot baseline, Compositional Chain-of-Thought (CCoT) for vision-language reasoning, and a persona-driven prompt. We study seven app development projects across two countries and interview developers about the results. Overall, we observed that the baseline prompt favours recall over precision, whereas CCoT is more balanced, achieving average F1 scores of 52-66% for epics and user stories. Tasks were more challenging to generate accurately. Precision gains were most consistent when adding architectural context, particularly for backend tasks (precision gains up to 35%). Interviews with developers revealed that up to 26% of false positives were still considered useful, reflecting the creative and open-ended nature of backlog creation. To capture this, we propose a new measure called Revised Recall, which complements ground-truth evaluation with developer assessments. Our findings suggest that hybrid prompting with architectural context can assist backlog generation from early mockups, though results vary by item type and developer oversight remains necessary.
- Abstract(参考訳): エピックやユーザストーリ,タスクの欠落や一貫性のない指定など,スプリントバックログの作成にはかなりの労力を要する。
ビジュアルアプリモックアップからバックログを生成するためのマルチモーダルなアプローチを提案する。
GPT-4oでは,ゼロショットベースライン,視覚言語推論のためのコンポジション連鎖(CCoT),ペルソナ駆動プロンプトの3つのプロンプトが評価された。
2つの国で7つのアプリ開発プロジェクトを調査し、その結果について開発者にインタビューした。
総じて,ベースラインは精度よりもリコールが望ましいが,CCoTはバランスが良く,エピックやユーザストーリーの平均F1スコアは52-66%であった。
タスクは、正確に生成することがより困難だった。
特にバックエンドタスク(精度は最大35%まで向上する)では、アーキテクチャのコンテキストを追加する場合、精度の向上が最も一貫性があった。
開発者へのインタビューでは,バックログ作成の創造的かつオープンな性質を反映して,偽陽性の最大26%が依然として有用だと見なされていることが明らかになった。
そこで本稿では,提案手法であるRevised Recallを提案する。
この結果から,アーキテクチャのコンテキストによるハイブリッドなプロンプトは,初期モックアップからのバックログ生成を支援することが示唆された。
関連論文リスト
- Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution [5.10403054516716]
既存のデータセットは、分離された単一のプルリクエスト(PR)タスクのパフォーマンスをステートレスな方法で評価する。
本稿では,SWE-STEPSのデータセット生成を支援する自動コーディングタスク生成フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-03T13:44:40Z) - FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback [92.67587639164908]
マルチモーダルフィードバックを備えたフロントエンドコード生成のベンチマークであるFronTalkを紹介する。
我々は、フロントエンド開発タスクに集中し、100のマルチターン対話のコレクションであるFronTalkをキュレートする。
20モデルの評価は、文献で体系的に調査されていない2つの重要な課題を明らかにしている。
論文 参考訳(メタデータ) (2025-12-05T23:28:09Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation [5.6001617185032595]
プログラムデータと自然言語データの両方で事前訓練された大きな言語モデルは、コード指向のタスクでうまく機能する傾向にある。
我々は,パラメータ効率,量子化低ランクのオープンソースLarge Language Model (LLM) をコンシューマグレードハードウェア上で微調整し,レビューコメント生成を改善する。
論文 参考訳(メタデータ) (2024-11-15T12:01:38Z) - MaFeRw: Query Rewriting with Multi-Aspect Feedbacks for Retrieval-Augmented Large Language Models [22.50450558103786]
現実世界のRAGシステムでは、現在のクエリは会話コンテキストからの音声楕円とあいまいな参照を含むことが多い。
本稿では,検索プロセスと生成結果の両方からマルチアスペクトフィードバックを統合することにより,RAG性能を向上させる新しいクエリ書き換え手法MaFeRwを提案する。
2つの対話型RAGデータセットの実験結果から、MaFeRwはベースラインよりも優れた生成指標と安定したトレーニングを達成できることが示された。
論文 参考訳(メタデータ) (2024-08-30T07:57:30Z) - RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in
Long-Horizon Generation [28.08775951425144]
思考の連鎖を反復的に修正することで、大きな言語モデルの推論と生成能力が大幅に向上する。
特に,提案手法では,タスククエリに関連する情報を検索して,各思考ステップを一つずつ修正する。
RATをGPT-3.5、GPT-4、CodeLLaMA-7bに適用すると、様々な長距離生成タスクのパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2024-03-08T13:42:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。