論文の概要: GenPuzzle: Benchmarking Visual Reasoning in Image Generation Models
- arxiv url: http://arxiv.org/abs/2609.05902v1
- Date: Sat, 05 Sep 2026 05:56:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 12:22:56.187565
- Title: GenPuzzle: Benchmarking Visual Reasoning in Image Generation Models
- Title(参考訳): GenPuzzle: 画像生成モデルにおけるビジュアル推論のベンチマーク
- Authors: Changpeng Zhao, Yiren Song, Jinpeng Wang,
- Abstract要約: GenPuzzleは推論中心の画像生成のベンチマークである。
12トラックにまたがる2,005の問題があり、パターン補完、空間構成、迷路、スドク、ノングラム、タングラム、ボードゲーム、マッチスティックパズル、直交投影、数学的視覚的証明がある。
- 参考スコア(独自算出の注目度): 14.487084010911095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent image generation systems increasingly combine multimodal understanding, reasoning, and synthesis, suggesting that they may do more than render plausible scenes. Yet existing evaluations emphasize aesthetics, prompt alignment, compositionality, or text-based answers, leaving unclear whether these systems can solve visual problems and faithfully express solutions in pixels. We introduce GenPuzzle, a benchmark for reasoning-centric image generation. GenPuzzle contains 2,005 problems across 12 tracks, spanning pattern completion, spatial construction, mazes, Sudoku, nonograms, tangrams, board games, matchstick puzzles, orthographic projection, and mathematical visual proof. Each task provides a visual puzzle and requires an image output that preserves the input state while executing a logically valid solution. GenPuzzle uses task-specific evaluation protocols: discrete grid outputs are transcribed and verified programmatically, while visually complex outputs are assessed with tiered, multidimensional, or binary multimodal large language model (MLLM) rubrics. We further select the automatic judge by measuring agreement with human reference scores. Across three frontier generators, the strongest model reaches only 40.57 Macro Overall, revealing frequent failures in logic, geometry, state preservation, and instruction execution. GenPuzzle provides a testbed for measuring progress from image rendering toward visual problem solving.
- Abstract(参考訳): 最近の画像生成システムは、多モーダル理解、推論、合成を組み合わさり、プラウザブルなシーンをレンダリングする以上のことができることを示唆している。
しかし、既存の評価では、美学、迅速なアライメント、構成性、あるいはテキストベースの回答が強調されており、これらのシステムが視覚的な問題を解決し、ピクセル内のソリューションを忠実に表現できるかどうかは不明である。
我々は、推論中心の画像生成のベンチマークであるGenPuzzleを紹介する。
GenPuzzleには、パターン補完、空間構成、迷路、スドゥーク、ノングラム、タングラム、ボードゲーム、マッチスティックパズル、正射影、数学的視覚的証明など、12トラックにまたがる2,005の問題が含まれている。
各タスクは視覚パズルを提供し、論理的に有効な解を実行しながら入力状態を保存する画像出力を必要とする。
GenPuzzleはタスク固有の評価プロトコルを使用する: 離散グリッド出力は書き起こされ、プログラム的に検証され、視覚的に複雑な出力は、結合された、多次元またはバイナリマルチモーダルな大言語モデル(MLLM)ルーブリックで評価される。
我々は、人間の基準スコアとの一致を計測することで、自動判断を更に選択する。
3つのフロンティアジェネレータで最強のモデルが40.57マクロに到達し、論理学、幾何学、状態保存、命令実行の失敗が頻発した。
GenPuzzleは画像レンダリングから視覚的問題解決への進歩を測定するテストベッドを提供する。
関連論文リスト
- Seq2Seq Models Reconstruct Visual Jigsaw Puzzles without Seeing Them [2.8834483859625952]
本稿では,各パズルピースをトークンの離散列に変換する特殊トークン化器を提案する。
ブラインド」ソルバとして扱われ、エンコーダ・デコーダ変換器は元のレイアウトを正確に再構築した。
視覚的な入力を意図的に制限されているにもかかわらず、我々のモデルは最先端の結果を得る。
論文 参考訳(メタデータ) (2025-11-09T10:43:16Z) - When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought [118.71264263478083]
MIRAは,中間画像の生成が推論の成功に不可欠であるシナリオにおいて,モデルを評価するために設計された新しいベンチマークである。
546のマルチモーダル問題を含み、中間画像と最終回答が注釈付きである。
論文 参考訳(メタデータ) (2025-11-04T18:00:51Z) - RECODE: Reasoning Through Code Generation for Visual Question Answering [68.86938437188964]
我々は、検証可能な視覚的推論のための新しいモダリティとして、視覚を実行可能コードにリバースエンジニアリングするプロセスであるデレンダリングを活用することを提案する。
我々の研究は、実行可能コードにおける視覚的認識の基盤が、より正確で検証可能なマルチモーダル推論への新たな道を提供することを示した。
論文 参考訳(メタデータ) (2025-10-15T17:05:37Z) - GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles [13.001531516689035]
我々は,視覚的,論理的,知的刺激的な,脱出室パズル画像を生成することによって,テキスト・ツー・イメージモデルに挑戦する。
本稿では,このタスクを機能設計,象徴的なシーングラフ推論,レイアウト合成,局所画像編集など,構造化段階に分解する階層型マルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-27T01:08:37Z) - ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning [76.2503352325492]
ControlThinkerは、"Comprehend-then-generate"パラダイムを採用した、新しいフレームワークである。
制御画像からの潜在セマンティクスは、テキストプロンプトを豊かにするためにマイニングされる。
このリッチなセマンティック理解は、追加の複雑な修正を必要とせずに、画像生成をシームレスに支援する。
論文 参考訳(メタデータ) (2025-06-04T05:56:19Z) - Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint [57.73346054360675]
画像、空間配置、記号置換を通じて言語を符号化するリバスパズルは、現在の視覚言語モデル(VLM)に固有の課題をもたらす。
本稿では,現代VLMにおけるレバスパズルの解釈と解決の能力について,多種多様な英語リバスパズルの手書きおよび注釈付きベンチマークを構築して検討する。
論文 参考訳(メタデータ) (2025-05-29T17:59:47Z) - GenVP: Generating Visual Puzzles with Contrastive Hierarchical VAEs [15.118234858274679]
本稿では,RPM生成プロセス全体をモデル化するための生成的ビジュアルパズル (GenVP) を提案する。
私たちのモデルの能力は、1つの特定の問題に対して複数のソリューションを生成することから、望ましいルールセットから完全な新しいパズルを生成することまで、多岐にわたっています。
論文 参考訳(メタデータ) (2025-03-30T21:35:26Z) - Video Anomaly Detection by Solving Decoupled Spatio-Temporal Jigsaw
Puzzles [67.39567701983357]
ビデオ異常検出(VAD)はコンピュータビジョンにおいて重要なトピックである。
近年の自己教師型学習の進歩に触発された本論文は,直感的かつ難解なプレテキストタスクを解くことによって,VADに対処する。
提案手法は3つの公開ベンチマークにおいて最先端のベンチマークよりも優れている。
論文 参考訳(メタデータ) (2022-07-20T19:49:32Z) - Pictorial and apictorial polygonal jigsaw puzzles: The lazy caterer
model, properties, and solvers [14.08706290287121]
任意の直線切断数で大域多角形/像を切断して生成した一般凸多角形であるジグソーパズルを定式化する。
このようなパズルの理論的性質を解析し、ピースが幾何的ノイズで汚染されたときの解法に固有の課題を含む。
論文 参考訳(メタデータ) (2020-08-17T22:07:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。