論文の概要: PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark
- arxiv url: http://arxiv.org/abs/2607.03006v1
- Date: Fri, 03 Jul 2026 06:39:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.49339
- Title: PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark
- Title(参考訳): PosterHarness:科学的なポスター生成を監査可能なインストラクションフォローベンチマークに変える
- Authors: Tianyi Yang, Dawei Fu, Youpeng Wu, Zixun Kou, Linrui Chen, Ruobing Jiang, Zijian Wang, Qiang Li,
- Abstract要約: テキストリッチな画像モデルは、現在、ポスタースケールのレイアウトを設計できますが、それらが科学的コミュニケーション契約を尊重するかどうかを測定する方法はありません。
本稿では、評価可能な指示追従タスクとして、監査可能なハーネスリフレーミングポスター生成であるPOSTERHARNESSを提案する。
- 参考スコア(独自算出の注目度): 7.957250777212916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-rich image models can now design poster-scale layouts, but we lack ways to measure whether they honor scientific communication contracts: legible labels, prescribed aspect ratios, and -- above all -- abstaining from fabricated scientific figures. We present POSTERHARNESS, an auditable harness reframing poster generation as measurable instruction-following tasks, with a pilot benchmark and failure taxonomy. POSTERHARNESS uses a placeholder-first contract to separate two jobs models otherwise conflate. The model performs visual-summary design: typography, reading path, color, and background -- but never draws data-bearing figures. Every figure region must be an empty labeled placeholder; a deterministic compositor inserts real source-paper figures at detected coordinates. This makes properties measurable: placeholder count and ID accuracy, blankness, aspect-ratio compliance, abstention from synthesized graphics, public-text hygiene, and source-figure provenance -- with failures logged as explicit rejections, not hidden in plausible-looking output. We instantiate the harness on 12 papers (6 HEP, 6 AI/ML-adjacent) and report three findings. (i) A counterfactual probe shows the placeholder contract drives VLM-counted synthesized figures from 34 to 0 across three papers. (ii) A failure taxonomy identifies blocking contracts: placeholder geometry, placeholder QA, template critic, and public text. (iii) Comparison with Paper2Poster shows a trade-off: PosterHarness yields higher-resolution artifacts, lower white-canvas fraction, and stronger VLM visual preference; the deterministic baseline retains slightly more PosterQuiz-style information and runs faster. We report this as regime characterization, not a superiority claim. All artifacts, prompts, manifests, and audit scripts are released as a reusable evaluation component.
- Abstract(参考訳): テキストに富んだ画像モデルは、現在、ポスタースケールのレイアウトを設計できるが、彼らが科学的コミュニケーション契約を尊重するかどうかを測定する方法がない。
本稿では、評価可能な指示追従タスクとして、監査可能なハーネスリフレーミングポスター生成であるPOSTERHARNESSについて、パイロットベンチマークと故障分類を用いて紹介する。
POSTERHARNESSはプレースホルダーファースト契約を使用して、2つのジョブモデルを分離する。
このモデルは、タイポグラフィー、読み方、色、背景といったビジュアル・サマリーデザインを実行します。
すべての図形領域は空のラベル付きプレースホルダーでなければならない。決定論的合成器は、検出された座標に実元図形を挿入する。
プレースホルダのカウントとIDの精度、空白性、アスペクト比のコンプライアンス、合成グラフィックからの排除、公開テキストの衛生、ソースフィギュアの証明といったプロパティが測定可能になります。
12論文(6HEP、6AI/ML-adjacent)をインスタンス化し,3つの知見を報告する。
i) 反実的プローブは、3枚の紙から34から0までのVLM計数された合成図形をプレースホルダー契約で駆動することを示す。
(ii)障害分類は、プレースホルダー幾何学、プレースホルダーQA、テンプレート評論家、パブリックテキストといった、ブロッキング契約を識別する。
(iii)Paper2Posterとの比較はトレードオフを示している: PosterHarnessは高解像度のアーティファクト、低い白キャンバス率、より強力なVLM視覚的嗜好をもたらす。
我々はこれを制度的特質として報告し、優越的主張ではない。
再利用可能な評価コンポーネントとして、すべてのアーティファクト、プロンプト、マニフェスト、監査スクリプトがリリースされた。
関連論文リスト
- Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures [45.39546965981896]
科学と工学の量的記録は、テキストや表ではなく数字によってもたらされる。
図をグラフィックとして保存すると、そのデータは画像によって近似されず、エンコードされる。
これを3つのコントリビューションに変換します。
論文 参考訳(メタデータ) (2026-06-30T08:43:32Z) - Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models [16.13083848552738]
視覚言語モデルは画像中のテキストを読むのにほぼ完璧な精度を達成するが、大部分はタイポグラフィー・ブラインドである。
フォントファミリ,サイズ,スタイル,色認識を26種,スクリプト4種,難易度3種で評価することにより,このギャップを系統的に検討した。
視覚言語理解におけるタイポグラフィーギャップの解消を支援するため,評価フレームワーク,データ,微調整レシピをリリースする。
論文 参考訳(メタデータ) (2026-03-09T15:31:47Z) - PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions [55.95282725491425]
PoShは、LLMs-as-a-Judgeをガイドするために、シーングラフを構造化ルーリックとして使用する詳細な画像記述のメトリクスである。
PoShはレプリカ可能で、解釈可能で、既存のメトリクスよりも人間のレーダのプロキシが優れている。
我々は,オープンウェイトな選択肢よりも,DOCENTにおける人間の判断とPoShの相関が強いことを示す。
論文 参考訳(メタデータ) (2025-10-21T20:30:20Z) - Losing the Plot: How VLM responses degrade on imperfect charts [11.071294641688496]
視覚言語モデル(VLM)は、チャート理解において強力な結果を示すが、既存のベンチマークでは、明確な数字と事実に基づくクエリを仮定している。
我々はChatGPT 4o, Claude Sonnet 4, Gemini 2.5 Proを評価し, 汚損や隠蔽下での急激な性能低下を見出した。
重要なイノベーションは、モデルが同じ声明を確認または否定するよう求められたときに矛盾する、逆の矛盾を早急に起こすことだ。
論文 参考訳(メタデータ) (2025-09-22T21:12:20Z) - Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers [34.9495497884296]
ポストジェネレーションは科学コミュニケーションにおいて不可欠だが難しい課題である。
ポスター生成のための最初のベンチマークとメトリクススイートを紹介する。
PosterAgentはトップダウンのビジュアルインザループマルチエージェントパイプラインである。
論文 参考訳(メタデータ) (2025-05-27T17:58:49Z) - Noisy-Correspondence Learning for Text-to-Image Person Re-identification [50.07634676709067]
本稿では,雑音対応においても頑健な視覚関係を学習するための新しいロバスト二重埋め込み法(RDE)を提案する。
提案手法は,3つのデータセット上での合成ノイズ対応と非合成ノイズ対応を両立させる。
論文 参考訳(メタデータ) (2023-08-19T05:34:13Z) - Towards General Visual-Linguistic Face Forgery Detection [95.73987327101143]
ディープフェイクは現実的な顔操作であり、セキュリティ、プライバシー、信頼に深刻な脅威をもたらす可能性がある。
既存の方法は、このタスクを、デジタルラベルまたはマスク信号を使用して検出モデルをトレーニングするバイナリ分類として扱う。
本稿では, 微粒な文レベルのプロンプトをアノテーションとして用いた, VLFFD (Visual-Linguistic Face Forgery Detection) という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-07-31T10:22:33Z) - FactGraph: Evaluating Factuality in Summarization with Semantic Graph
Representations [114.94628499698096]
文書と要約を構造化された意味表現(MR)に分解するFactGraphを提案する。
MRは、コアセマンティックの概念とその関係を記述し、文書と要約の両方の主要な内容を標準形式で集約し、データの疎結合を減少させる。
事実性を評価するための異なるベンチマークの実験では、FactGraphは以前のアプローチよりも最大15%優れていた。
論文 参考訳(メタデータ) (2022-04-13T16:45:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。