論文の概要: JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
- arxiv url: http://arxiv.org/abs/2607.27670v2
- Date: Tue, 04 Aug 2026 01:34:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.401
- Title: JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
- Title(参考訳): JigShape: JigsawパズルによるVLMの視覚的幾何学的推論の評価
- Authors: Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao,
- Abstract要約: Jigsawパズルの解決には、視覚的内容と幾何学的制約の推論が必要である。
既存のベンチマークでは、テクスチャを繰り返した領域で曖昧な地上真実を生み出す矩形カットを使用している。
タブ・アンド・ブランクのインターロック機能を備えたベンチマークであるtextitoursを導入し,そこでは幾何学的制約が強い局所的互換性要件を提供する。
- 参考スコア(独自算出の注目度): 96.55050162060297
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Jigsaw puzzle solving requires jointly reasoning about visual content and geometric constraints, yet existing benchmarks use rectangular cuts that create ambiguous ground truth in texture-repeated regions. We introduce \textit{\ours{}}, a benchmark with tab-and-blank interlocking pieces where geometric constraints provide strong local compatibility requirements that, combined with visual content, yield unambiguous ground truth. Across 95K instances at four grid densities (4$\times$4 to 16$\times$16), we find that \textbf{zero-shot VLMs largely lack geometric reasoning}: only one of five frontier models (GPT-5.5) exceeds random baseline on 4$\times$4 puzzles, while all others perform at chance level. While supervised fine-tuning achieves $>$97\% on 4$\times$4, \textbf{all models collapse on larger grids}: GPT-5.5 drops from 70\% to near-random on 8$\times$8, and even fine-tuned models fall below 5\% on 12$\times$12. This ``scaling cliff'' suggests current architectures cannot maintain consistent constraint satisfaction as the number of pieces increases. \ours{} establishes scalable geometric reasoning as an open challenge for vision-language models.
- Abstract(参考訳): Jigsawのパズル解決には、視覚的内容と幾何学的制約を共同で推論する必要があるが、既存のベンチマークでは、テクスチャを繰り返した領域で曖昧な基底真理を生成する長方形のカットを使用している。
これは、幾何学的制約が、視覚的コンテンツと組み合わせることで、曖昧な基礎的真理をもたらす、強い局所的な互換性要件を提供する、タブとブランクのインターロックのあるベンチマークである。
4つの格子密度の95Kインスタンス(4$\times$4から16$\times$16)のうち、5つのフロンティアモデル(GPT-5.5)のうちの1つだけが4$\times$4パズルのランダムなベースラインを超え、他の全ては確率レベルで実行されている。
GPT-5.5 は 70\% から 8$\times$8 まで減少し、細調整されたモデルでさえ 12$\times$12 では 5\% 以下になる。
この 'scaling cliff'' は、現在のアーキテクチャがピースの数が増えるにつれて一貫性のある制約満足度を維持することができないことを示唆している。
\ours{}は、拡張可能な幾何学的推論を視覚言語モデルのオープンチャレンジとして確立する。
関連論文リスト
- Geometry-Aware MCTS for Extremal Problems in Combinatorial Geometry [3.8362220332316626]
幾何学において、n×n$グリッドの点の構成を問う極端問題について研究する。
提案手法は、実行可能なアクション空間への漸進的な更新を通じて、厳密な幾何学的制約を強制する。
検討した6つの問題のうちの5つに、新しい最もよく知られた計算結果を確立する。
論文 参考訳(メタデータ) (2026-06-24T21:34:08Z) - Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction [59.47026381165585]
視覚言語モデルは精度を上げて幾何学的問題を解くが、その中間状態は潜伏し、検証できないままである。
我々は,GeoGebra制約エンジンとのエージェント相互作用に潜時空間推論から幾何推論を再キャストするフレームワークDraw2Thinkを提案する。
論文 参考訳(メタデータ) (2026-05-20T05:46:14Z) - Stateful Reasoning via Insight Replay [51.85629502016196]
CoT(Chain-of-Thought)推論は,大規模言語モデルにおける多段階推論の基盤となっている。
この現象の主な原因は、CoTが成長するにつれて、トレースの早期に生成された重要な洞察に対するモデルの注意が徐々に弱まることである。
提案手法は、モデルがその推論トレースから定期的に重要な洞察を抽出し、アクティブな世代フロンティア付近で再生するステートフル推論手法である。
論文 参考訳(メタデータ) (2026-05-14T06:52:59Z) - MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs [8.776836095441475]
我々はLLMの推論能力を評価するためのハードで適応的なベンチマークであるMathConstraintを紹介する。
MathConstraintはパラメータ化された問題タイプを使用して、任意に困難で自動検証可能なインスタンスをスケーラブルに生成する。
我々は、一般的なSAT/SMTソルバを含むサンドボックスのPython環境にアクセスせずに、12のフロンティアモデルとオープンウェイトモデルを評価する。
論文 参考訳(メタデータ) (2026-05-08T21:28:02Z) - Recurrent Reasoning on Symbolic Puzzles with Sequence Models [3.900695166480356]
本稿では、4つのリカレント論理パズルの難易度制御ベンチマークであるRecurrReasonを紹介する。
我々は、2つのトランスフォーマーファミリ、エンコーダ-デコーダモデル(T5スタイル)とデコーダ-オンリーモデル(GPT-2スタイル)をベンチマークする。
微調整済みのT5は97.27%の検証と81.00%のOOD精度をブロックワールドで達成している。
論文 参考訳(メタデータ) (2026-04-19T15:48:32Z) - BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs [0.688204255655161]
$textbfBareBones$は、純粋な幾何学的形状理解をストレステストするために設計されたゼロショットベンチマークである。
WTP-ベンチ(WTP-Bench)は、境界輪郭のみからクラス間の幾何学的概念を識別するようモデルに強制する、極端できめ細かな視覚パズルである。
論文 参考訳(メタデータ) (2026-04-12T08:46:27Z) - Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning [53.13514542825493]
TRCoT(Theorem-d Reverse Chain-of-Thought Reasoning Synthesis)フレームワークについて述べる。
最初の段階であるTR-Engineは、構造的な記述と性質を持つ定理基底幾何学図を合成する。
第2段階であるTR-Reasonerは、幾何特性と記述フラグメントを交互に検証することで、反復的に質問と回答のペアを洗練するためのリバース推論を採用している。
論文 参考訳(メタデータ) (2024-10-23T13:58:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。