論文の概要: PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback
- arxiv url: http://arxiv.org/abs/2608.30241v1
- Date: Mon, 31 Aug 2026 04:52:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.224127
- Title: PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback
- Title(参考訳): PaperBanana-Interact:Multi-Turn Human Feedbackを用いたサイエントダイアグラム再構成
- Authors: Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang, Yale Song, Yiwen Song, Rui Meng, Tomas Pfister, Nanyun Peng,
- Abstract要約: ユーザ要求3,518の注釈付き292個の画像を含むマルチターンダイアグラム生成のためのベンチマークを提案する。
PaperBananaBenchは不満足な要件を特定し、kを自然言語のフィードバックに変換する。
本稿では,内部の批判と修正のループを通じて図を洗練するマルチエージェントシステムPaperBanana-Interactを紹介する。
- 参考スコア(独自算出の注目度): 101.62446136707372
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent efforts have aimed to automate scientific diagram generation from paper content (Lin et al., 2026; Zhu et al., 2026a). However, fully satisfying an author's visual and communicative preferences in a single turn is challenging: in our formative user study (N = 14), all participants requested further revisions after viewing an initial draft, and 86% of them rated the refined diagrams as more satisfactory. Despite the clear demand, the multi-turn workflow remains largely underexplored. To bridge this gap, we present MTPaperBananaBench, a benchmark for multi-turn diagram generation containing 292 images annotated with 3,518 user requirements. To reduce expensive human studies and enable scalable benchmarking, we construct a user simulator that, at each turn, identifies unsatisfied requirements and converts k of them into natural language feedback. Evaluating both requirement satisfaction and overall diagram quality reveals two key failure modes shared across baseline multiturn systems: (1) quality drift, where diagram quality progressively declines over turns, and (2) forgetting, where previously implemented features are lost in subsequent turns. To address these issues, we introduce PaperBanana-Interact, a multi-agent system that refines diagrams via an internal critique-and-refine loop. PaperBanana-Interact consistently improves rather than degrades diagram quality across turns, outperforming baselines by 11.9-18.6 points in quality score and reducing forgetting by 3.7-6.2 points.
- Abstract(参考訳): 最近の研究は、論文の内容から科学図を生成することを目的としている(Lin et al , 2026; Zhu et al , 2026a)。
しかし、著者の視覚的、コミュニケーション的嗜好を1ターンで完全に満たすことは困難である: フォーマティブなユーザスタディ(N = 14)では、最初のドラフトを見た後、すべての参加者がさらなるリビジョンを要求し、そのうち86%が洗練された図をより満足できるものとして評価している。
明確な要求にもかかわらず、マルチターンのワークフローはほとんど探索されていない。
MTPaperBananaBenchは,ユーザ要求3,518の注釈付き292個の画像を含むマルチターンダイアグラム生成のベンチマークである。
コストのかかる人間の研究を削減し、スケーラブルなベンチマークを可能にするために、各ターンで不満足な要求を特定し、kを自然言語のフィードバックに変換するユーザシミュレータを構築した。
要求満足度と全体的なダイアグラム品質を評価することで,(1) 品質ドリフト,(2) ダイアグラムの品質がターンとともに徐々に低下する,(2) 忘れる,という2つの重要な障害モードが,ベースラインマルチターンシステム間で共有されていることが明らかになった。
これらの問題に対処するために、内部の批判と再定義のループを通して図を洗練するマルチエージェントシステムPaperBanana-Interactを導入する。
PaperBanana-Interactは、ターンごとにダイアグラムの品質を低下させるよりも一貫して改善し、ベースラインを11.9-18.6ポイント上回り、忘れを3.7-6.2ポイント下回る。
関連論文リスト
- Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge [26.80223000446421]
本稿では,第3回AI for Math WorkshopにおけるChallenge Track3: SeePhys Proへのアプローチを紹介する。
課題は、学生レベルの物理学の質問に答えることであり、その言葉と数字は部分的に、あるいは全体像として与えられるかもしれない。
本研究は,図形コンテンツをソルバ可読テキストとして再表現する視覚情報抽出段階と,異種3つのソルバを編成する推論段階である。
論文 参考訳(メタデータ) (2026-07-24T03:44:30Z) - NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1) [115.35873876159131]
NTIRE 2026 Challenge on the 3rd Restore Any Image Model in the Wildについて概説する。
この挑戦には200近い登録と2500以上の応募が集まった。
トップパフォーマンスの手法は、プロのIQAにおける芸術の状態を著しく向上させた。
論文 参考訳(メタデータ) (2026-04-14T09:44:35Z) - EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content [19.131221541276332]
大規模な言語モデルを評価するためのベンチマークであるEduIllustrateを提案する。
このベンチマークは、5つの被験者と3つのグレードレベルにまたがる230の課題からなる。
Gemini 3.0 Pro Previewは87.8%、Kim-K2.5は最高のコスト効率を実現している。
論文 参考訳(メタデータ) (2026-04-06T08:58:31Z) - Iterative Refinement Improves Compositional Image Generation [47.116050084875106]
Text-to-image (T2I)モデルは、複数のオブジェクト、リレーション、属性を同時に扱う必要がある複雑なプロンプトと競合する。
本稿では,T2Iモデルを複数のステップで段階的に改良する反復的テストタイム戦略を提案する。
われわれのアプローチは単純で、外部ツールや事前は必要とせず、幅広い画像生成器や視覚言語モデルに柔軟に適用できる。
論文 参考訳(メタデータ) (2026-01-21T18:59:40Z) - COMPOSE: Hypergraph Cover Optimization for Multi-view 3D Human Pose Estimation [58.47973015036709]
スパース多視点からの3次元ポーズ推定は、行動認識、スポーツ分析、人間とロボットの相互作用にとって重要な課題である。
ハイパーグラフ問題として多視点ポーズ対応マッチングを定式化する新しいフレームワークComposEを提案する。
COMPOSEは,従来の最適化手法よりも平均23%,自己教師付きエンドツーエンド学習手法より最大11%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-01-14T18:50:17Z) - PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies [16.537126902822127]
PRISMM-Benchは、科学論文において、実際のレビュアーがフラッグした不整合に基づいた最初のベンチマークである。
不整合同定、治療、ペアマッチングという3つのタスクを設計し、不整合の検出、修正、推論を行うモデルの能力を評価する。
我々は、大きなオープンウェイトモデル(GLM-4.5V 106B、InternVL3 78B)やプロプライエタリモデル(Gemini 2.5 Pro、GPT-5)を含む21のLMMをベンチマークした。
論文 参考訳(メタデータ) (2025-10-18T13:46:26Z) - NEVIS'22: A Stream of 100 Tasks Sampled from 30 Years of Computer Vision
Research [96.53307645791179]
我々は,100以上の視覚的分類タスクのストリームからなるベンチマークであるNever-Ending VIsual-classification Stream (NEVIS'22)を紹介する。
分類に制限されているにもかかわらず、OCR、テクスチャ分析、シーン認識など、様々なタスクが生成される。
NEVIS'22は、タスクの規模と多様性のために、現在のシーケンシャルな学習アプローチに対して前例のない課題を提起している。
論文 参考訳(メタデータ) (2022-11-15T18:57:46Z) - Summarization with Graphical Elements [55.5913491389047]
本稿では,グラフィカル要素による要約という新しい課題を提案する。
タスクの研究を支援するために,高品質なラベル付きデータセットを収集する。
論文 参考訳(メタデータ) (2022-04-15T17:16:41Z) - Learning multiview 3D point cloud registration [74.39499501822682]
本稿では,エンドツーエンドで学習可能なマルチビュー3Dポイントクラウド登録アルゴリズムを提案する。
このアプローチは、エンドツーエンドのトレーニングが可能で、計算コストが小さく、最先端のマージンよりも優れています。
論文 参考訳(メタデータ) (2020-01-15T03:42:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。