論文の概要: PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models
- arxiv url: http://arxiv.org/abs/2608.14741v1
- Date: Thu, 13 Aug 2026 20:19:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.059283
- Title: PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models
- Title(参考訳): PolyComp:多モードモデルにおける合成3次元空間推論のためのポリキューブベンチマーク
- Abstract要約: PolyCompは、視覚認識と空間推論を強調する手続き的に生成された検証済みのベンチマークである。
ベンチマークには4つの幾何学系にまたがる120の問題が含まれており、各問題には3つの異なる表現形式がある。
3つのプレゼンテーション(モデル毎の360の問題を提示)、GPT-5.6ソルで最大50.0%の精度を実現した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce PolyComp, a procedurally generated and verified benchmark that stresses visual recognition and compositional spatial reasoning. In each problem, a model must identify which of four options shows a pair of polycube components that can be combined to form a target solid. The benchmark contains 120 problems across four geometry families, and each problem has three different presentation formats using either a single image or multiple images. The random guessing baseline is 25%. Across the three presentations (360 presented problems per model), GPT-5.6 Sol with max effort attains 50.0% accuracy (95% problem-cluster CI 43.3-56.7%) at a mean cost of \$0.951 per presented problem, Claude Fable 5 with max effort attains 39.4% (33.1-46.1%) at \$0.701, and Gemini 3.1 Pro Preview with thinking level high attains 27.5% (22.8-32.5%), near the 25% random guessing baseline, at \$0.350. The observed accuracy spread across geometry families is larger than across presentation formats. We present a problem development and evaluation protocol, cost and token accounting, and release the 120 problems.
- Abstract(参考訳): 本稿では,視覚認識と合成空間推論に重点を置いた,手続き的に生成された検証済みベンチマークであるPolyCompを紹介する。
それぞれの問題において、モデルは、対象となる固体を形成するために結合可能なポリキューブ成分のペアを示す4つの選択肢のうちどれかを特定する必要がある。
ベンチマークには4つの幾何学系にまたがる120の問題が含まれており、各問題には1つの画像または複数の画像を使用して3つの異なる表示形式がある。
ランダムな推定基準は25%である。
GPT-5.6 Sol with max effort at a average cost of $0.951 per presented problem, Claude Fable 5 at 39.4% (33.1-46.1%) at $0.701, Gemini 3.1 Pro Preview with thinking level attains 27.5% (22.8-32.5%) near the 25% random guessing baseline, at $0.350。
幾何学ファミリにまたがる観測精度は、提示形式よりも大きい。
本稿では,問題開発と評価のプロトコル,コストとトークンの会計,120件の問題点の公表について述べる。
関連論文リスト
- StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models [0.5624504968545648]
我々は,立方体-ネット対面推論,閉立方体-towerカウント,隣接する連結成分カウントのベンチマークであるStateSightを紹介する。
各タスクファミリーには300の単一イメージプロンプトがあり、決定論的オラクルラベルと正確なマッチスコアがある。
OpenAI GPT-5.5はAPIモデルの識別子gpt-5.5を使用して、3つのタスクで59.3%、33.3%、28.3%の精度を達成した。
論文 参考訳(メタデータ) (2026-08-15T20:13:12Z) - JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles [96.55050162060297]
Jigsawパズルの解決には、視覚的内容と幾何学的制約の推論が必要である。
既存のベンチマークでは、テクスチャを繰り返した領域で曖昧な地上真実を生み出す矩形カットを使用している。
タブ・アンド・ブランクのインターロック機能を備えたベンチマークであるtextitoursを導入し,そこでは幾何学的制約が強い局所的互換性要件を提供する。
論文 参考訳(メタデータ) (2026-07-30T04:34:27Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs [86.49905745865038]
Soohakは64人の数学者によって新たに書かれた439プロブレムのベンチマークである。
データセットは2026年後半に公開され、中間で要求に応じてモデル評価が利用可能になる。
論文 参考訳(メタデータ) (2026-05-09T17:14:22Z) - LARGO: Low-Rank Hypernetwork for Handling Missing Modalities [41.99844472131922]
LARGOは,2N-1ドルの専用モダリティモデルを1つのネットワークに圧縮するハイパーネットワークである。
我々の手法は52構成のうち47位にランクインし、最先端のベースラインよりも平均的な+0.68$%$と+2.53$%$を達成している。
avMNISTにおける概念実証実験は、ARGOが医療画像を超えて異種非医学的モダリティにまで拡張する可能性を示唆している。
論文 参考訳(メタデータ) (2026-05-07T12:07:55Z) - Medical thinking with multiple images [44.04557445622649]
我々はMedThinkVQAを紹介した。MedThinkVQAは、複数の画像で考えるためのエキスパートアノテーション付きベンチマークである。
データセットは720のテストケースを含む8,067ケースを含み、1ケースあたり平均6.62イメージである。
テストセットでは、最高のクローズドソースモデルであるClaude-4.6-Opus、Gemini-3-Pro、GPT-5.2-xhighは57.2%、55.3%、54.9%の精度しか達成できなかった。
論文 参考訳(メタデータ) (2026-04-14T18:51:07Z) - COMPOSE: Hypergraph Cover Optimization for Multi-view 3D Human Pose Estimation [58.47973015036709]
スパース多視点からの3次元ポーズ推定は、行動認識、スポーツ分析、人間とロボットの相互作用にとって重要な課題である。
ハイパーグラフ問題として多視点ポーズ対応マッチングを定式化する新しいフレームワークComposEを提案する。
COMPOSEは,従来の最適化手法よりも平均23%,自己教師付きエンドツーエンド学習手法より最大11%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-01-14T18:50:17Z) - Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks [22.52796625148737]
ユークリッド幾何学の問題解決を代理課題として扱う。
モデルがユークリッドの原理を取得し、適用できるようにするため、Qwen2.5VLファミリーとRoboBrain2.0ファミリーを微調整する。
実験により, 得られたモデルが4つの空間的推論ベンチマークにおいて, 実質的なゼロショットゲインを達成できることが実証された。
論文 参考訳(メタデータ) (2025-09-29T08:49:21Z) - BeyondBench: Benchmark-Free Evaluation of Reasoning in Language Models [13.380359214677176]
インターネット規模のトレーニングデータから汚染を避けるための評価フレームワークであるBeyondBenchを紹介する。
本フレームワークでは,44のアルゴリズムタスクを117のバリエーションでカバーし,3つの難易度に分類する。
85のオープンソースモデルと16のクローズドソースモデルを含む101の言語モデルを評価する。
論文 参考訳(メタデータ) (2025-09-29T02:49:01Z) - Large Language Monkeys: Scaling Inference Compute with Repeated Sampling [81.34900892130929]
モデルから候補解を繰り返しサンプリングする簡単な手法を用いて、推論計算をスケーリングのための別の軸として検討する。
複数のタスクやモデルにまたがって、カバレッジは4桁以上のサンプル数でスケールする。
コードや形式的証明のようなドメインでは、回答が自動的に検証されるので、カバレッジの増加は直接的にパフォーマンスの向上につながります。
論文 参考訳(メタデータ) (2024-07-31T17:57:25Z) - IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations [47.133759061510986]
本稿では,数学,科学,アルゴリズム,ゲームという4つの主要分野の問題を含むベンチマークデータセットを提案する。
IsoBenchは、表現形式に起因するパフォーマンスギャップを診断するために、きめ細かいフィードバックを提供する。
本稿では,2つのプロンプト技術, $textitIsoCombination$ と $textitIsoScratchPad$ を提案する。
論文 参考訳(メタデータ) (2024-04-01T17:43:27Z) - Multi-person 3D Pose Estimation in Crowded Scenes Based on Multi-View
Geometry [62.29762409558553]
マルチパーソナライズされた3次元ポーズ推定手法における特徴マッチングと深さ推定のコアは、エピポーラ制約である。
スパサーの群衆シーンにおけるこの定式化の良好なパフォーマンスにもかかわらず、その効果はより密集した群衆の状況下でしばしば挑戦される。
本稿では,マルチパーソン3次元ポーズ推定式から脱却し,群衆ポーズ推定として再編成する。
論文 参考訳(メタデータ) (2020-07-21T17:59:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。