PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback
Abstractの概要
本論文は科学図表のマルチターンによる改善(リファインメント)を研究し、1回の生成だけでは著者の変化する視覚的選好を十分に満たせないことが多いと主張しています。14名の参加者を対象とした予備的なユーザー調査では、初稿を確認した後に全員が追加の修正を要求し、86%が修正後の図表をより満足度が高いと評価しました。体系的な評価を可能にするため、著者らは3,518件のアノテーション付きユーザー要求を含む292件の図表ベンチマーク「MTPaperBananaBench」と、未充足の要求を複数ターンにわたって自然言語フィードバックとして提示するユーザーシミュレータを導入しました。実験を通じて既存システムにおける2つの反復的な失敗モード(ターン間の品質ドリフトと以前満たされていた要求の忘却)が特定され、これらを動機として新たなマルチエージェント改善システム「PaperBanana-Interact」が提案されています。
新規性
本論文は、要求のアノテーションと反復的なフィードバックを行うシミュレータを組み合わせた、マルチターン科学図表生成のための初とされるベンチマークを提示しています。さらに、要約された対話メモリと、現在の要求、過去の要求、情報源への忠実性、提示品質を明示的に検証する多目的クリティックを組み合わせたマルチエージェント改善フレームワークを提案しています。
成果
ベンチマーク設定全体において、PaperBanana-Interactはベースラインの改善手法と比べて図表品質を11.9〜18.6ポイント向上させ、忘却を3.7〜6.2ポイント低減させました。PaperBananaの出力を改善する際、k=1設定で品質スコア61.2・要求充足度58.0を達成し、k=3設定では品質54.5・要求充足度94.2を達成するとともに、PaperBanana-DirectRefineや生成モデルベースラインよりも低い忘却率を維持しました。また、150サンプルでの人間のペアワイズ評価においても、PaperBanana-Interactの出力はNanoBananaProに対して81.3%、PaperBanana-DirectRefineに対して76.7%のケースで選好されました。
論文の注目点
- MTPaperBananaBenchは、シミュレートされたユーザーフィードバックを用いたマルチターン改善のベンチマーク用に、292件の科学図表と3,518件のアノテーション付き要求を提供します。
- ベースラインのマルチターンシステムは個々の要求の多くを満たせる一方で、品質ドリフトや過去に正常に適用された修正を忘却してしまう問題が頻繁に発生します。
- PaperBanana-Interactは要約モジュールに加え、多目的クリティックを備えた内部の批評・修正ループを使用することで、ターン間での品質維持の向上と忘却の低減を実現します。
参考リンク
- arXiv: https://arxiv.org/abs/2608.30241v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.30241v1
- Hugging Face Papers: https://huggingface.co/papers/2608.30241