論文の概要: SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence
- arxiv url: http://arxiv.org/abs/2607.27066v1
- Date: Wed, 29 Jul 2026 15:54:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.732164
- Title: SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence
- Title(参考訳): SciFigAlign:手書きによる視覚の微調整による科学的フィギュアの装飾
- Authors: Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai,
- Abstract要約: SciFigAlignは,原稿証拠の質評価を基礎とした微調整型マルチモーダルスコアラーである。
紙レベルでの分割では、SciFigAlignは0.3524のマクロMAEを達成し、テストセット上では紙内ペアの精度は81.64%である。
- 参考スコア(独自算出の注目度): 7.2640055022009635
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Scientific figure assessment in peer review differs fundamentally from general image quality evaluation: a figure must be visually legible, faithfully support the manuscript's claims, and communicate evidence with a clear visual hierarchy. However, if we apply traditional image assessment methods to scientific figure quality assessment, limitations emerge: classic IQA models capture perceptual quality or aesthetics but cannot judge whether a figure serves the paper's scientific argument; CLIP-based methods assess generic image-text correspondence, yet lack understanding of manuscript context; and zero-shot LLM/VLM judges, when repurposed for figure scoring, often yield overly concentrated scores with limited fusion of visual and textual evidence. We introduce an annotated dataset of 3,857 scientific figures from peer-reviewed conference papers, each rated along four peer-review-oriented dimensions: Clarity, Relevance, Informativeness, and Structure. We propose SciFigAlign, a fine-tuned multimodal scorer that grounds figure quality assessment in manuscript evidence. Given a figure crop, caption, citing paragraphs, and light paper context, SciFigAlign fine-tunes CLIP and SciBERT end-to-end with per-modality cross-attention and CubeMLP fusion, jointly optimizing SmoothL1 regression with a within-paper ranking hinge loss. Under paper-level splits, SciFigAlign achieves a macro MAE of 0.3524 and a within-paper pairwise accuracy of 81.64% on the test set with n = 396, a 59% relative error reduction over the best LLM-as-judge baseline with MAE 0.864. Ablations confirm that manuscript-grounded inputs, citing-context denoising, and ranking supervision are all critical, showing that scientific figure assessment requires learned alignment between visual content and manuscript evidence rather than prompting alone, even with state-of-the-art VLMs.
- Abstract(参考訳): ピアレビューにおける科学的フィギュア評価は、一般的な画像品質評価とは根本的に異なる: 図形は視覚的に正当性があり、原稿の主張を忠実に支持し、明確な視覚的階層で証拠を伝える必要がある。
しかし、従来の画像評価手法を科学的な図形品質評価に適用すると、限界が出現する: 古典IQAモデルは知覚的品質や美学を捉えるが、その図形が論文の科学的議論に役立っているかどうかを判断できない; CLIPベースの手法は汎用的な画像テキスト対応を評価できるが、原稿の文脈を理解できない; ゼロショットのLLM/VLM審査員は、図形スコアの再使用時に、視覚的証拠とテキスト的証拠を限定的に融合して過度に集中的なスコアを得ることが多い。
我々は,4つのピアレビュー指向の次元(明瞭度,妥当性,インフォーマティブ性,構造)に沿って評価された,ピアレビューされた会議論文から3,857人の科学的人物の注釈付きデータセットを紹介した。
SciFigAlignは,原稿証拠の質評価を基礎とした微調整型マルチモーダルスコアラーである。
SciFigAlign fine-tunes CLIP and SciBERT end-to-end with per-modality cross-attention and CubeMLP fusion, togethertimizing SmoothL1 regression with a inside-paper rank hinge loss。
紙レベルでの分割では、SciFigAlign は 0.3524 のマクロ MAE を達成し、n = 396 でテストセット上では 81.64% で、MAE 0.864 で最高の LLM-as-judge ベースラインに対して 59% の相対誤差削減を行う。
アブレーションは、原稿による入力、引用文のデノベーション、ランキングの監督がすべて重要であることを確認し、科学的な人物評価は、最先端のVLMであっても、単独でプロンプトするのではなく、視覚的内容と原稿証拠の間の学習されたアライメントを必要とすることを示した。
関連論文リスト
- GraphReview: Scientific Paper Evaluation via LLM-Based Graph Message Passing [4.802002747361241]
セマンティックペーパーグラフ上でのレビュー信号メッセージパッシングとして紙評価を定式化するグラフベースのLCMフレームワークを提案する。
このグラフは、本質的な品質、同時代の論文間の同期リンク、および先行研究とのダイアクロニックリンクを共同でキャプチャする。
実験の結果、GraphReviewは最強のベースラインを一貫して上回り、意思決定とランキングの指標で平均29.7%の改善を達成した。
論文 参考訳(メタデータ) (2026-05-26T15:58:49Z) - SIQA: Toward Reliable Scientific Image Quality Assessment [72.41803245808924]
我々は,2つの相補的な次元に沿って,科学的画質をモデル化するフレームワークであるSIQA(Scientific Image Quality Assessment)を紹介する。
SIQA-U (Understanding), SIQA-S (Scoring), SIQA-U (Understanding), SIQA-U (Understanding), SIQA-U (Understanding), SIQA-U (Understanding), SIQA-U (Understanding) の2つの評価プロトコルを設計した。
代表的マルチモーダル大言語モデル(MLLM)に対する実験は、アライメントアライメントと科学的理解の間に一貫した相違が見られる。
論文 参考訳(メタデータ) (2026-03-05T06:57:26Z) - RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension [65.81339691942757]
RPC-Bench(RPC-Bench)は、高品質なコンピュータサイエンス論文のレビュー・リビューの交換から構築された大規模質問応答ベンチマークである。
我々は、科学研究の流れに沿ったきめ細かい分類を設計し、モデルがなぜ、何、どのように学術的な文脈で質問するかを理解し、答える能力を評価する。
論文 参考訳(メタデータ) (2026-01-14T11:37:00Z) - Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates [27.434014916351348]
複数ラウンドのレビュアー-著者による議論に対して不均一なグラフ推論を行う新しいフレームワークであるReViewGraphを提案する。
これらの構造化された議論グラフの推論にグラフニューラルネットワークを適用することで、ReViewGraphは詳細な議論のダイナミクスをキャプチャし、より詳細なレビュー決定を可能にする。
論文 参考訳(メタデータ) (2025-11-11T14:46:07Z) - Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fréchet Distance [13.599366291595672]
視覚的忠実度とテキスト・プロンプトの整合性を評価する指標であるcFreDを1つのスコアにまとめる。
本研究は, テキスト条件付きモデルの系統評価において, cFreDを頑健で将来性のある指標として評価するものである。
論文 参考訳(メタデータ) (2025-03-27T17:35:14Z) - SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval [64.03631654052445]
科学領域内の画像テキストペアリングにおけるMMIR性能を評価するための最新のベンチマークは、顕著なギャップを示している。
オープンアクセス用紙コレクションを利用した特殊な科学的MMIRベンチマークを開発する。
このベンチマークは、科学的文書に詳細なキャプションのある数字や表から抽出された、530Kの精巧にキュレートされた画像テキストペアからなる。
論文 参考訳(メタデータ) (2024-01-24T14:23:12Z) - Simple Token-Level Confidence Improves Caption Correctness [117.33497608933169]
Token-Level Confidence(TLC)は、字幕の正確さを評価するシンプルな方法であるが、驚くほど効果的である。
画像キャプションに関する視覚言語モデルを微調整し、画像と提案されたキャプションをモデルに入力し、単語やシーケンスに対するトークンの信頼度を集計し、画像キャプションの一貫性を推定する。
論文 参考訳(メタデータ) (2023-05-11T17:58:17Z) - Evaluating and Improving Factuality in Multimodal Abstractive
Summarization [91.46015013816083]
そこで我々は,CLIPBERTScoreを提案する。
ゼロショットにおけるこの2つの指標の単純な組み合わせは、文書要約のための既存の事実度指標よりも高い相関性が得られることを示す。
本分析は,CLIPBERTScoreとそのコンポーネントの信頼性と高い相関性を示す。
論文 参考訳(メタデータ) (2022-11-04T16:50:40Z) - CLIPScore: A Reference-free Evaluation Metric for Image Captioning [44.14502257230038]
Webから400M画像+キャプションペアにプリトレーニングされたクロスモーダルモデルであるCLIPは、参照を必要とせずに画像キャプションの堅牢な自動評価に使用できることを示しています。
複数のコーポラにまたがる実験は、私たちの新しい基準なしメトリックであるCLIPScoreが人間の判断と最も高い相関を達成することを実証します。
また、RefCLIPScoreという参照拡張版も提示し、さらに高い相関性を実現する。
論文 参考訳(メタデータ) (2021-04-18T05:00:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。