論文の概要: PuzzleMate: Benchmarking MLLMs for Egocentric Puzzle Assistance
- arxiv url: http://arxiv.org/abs/2609.14473v1
- Date: Sun, 13 Sep 2026 12:29:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 12:40:38.831355
- Title: PuzzleMate: Benchmarking MLLMs for Egocentric Puzzle Assistance
- Title(参考訳): PuzzleMate: Egocentric Puzzle AssistanceのためのMLLMのベンチマーク
- Abstract要約: 我々はPuzzleMateを用いて、最先端のMLLMが現在のパズルの状態をどのように認識しているかを評価し、実行可能な次のステップ命令を生成する。
その結果, GPT-5.2 や Gemini-2.5-Pro などの現行モデルでは, 大幅な性能差がみられた。
- 参考スコア(独自算出の注目度): 21.60284785247072
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personal AI assistants hold the potential to evolve from digital interfaces into embodied companions capable of guiding users through complex physical activities. For these assistants to become integral to daily life, they must do more than identify objects; they must provide precise, step-by-step instructions that align with a user's real-time progress. While Multimodal Large Language Models (MLLMs) show promise in general visual understanding, their ability to deliver grounded, sequential guidance for fine-grained manipulation tasks remains largely unverified. In this paper, we choose the jigsaw puzzle as a strategic testbed for this capability. Unlike general object recognition, puzzle solving demands high-precision spatial reasoning, the ability to distinguish between minute geometric variations, and a rigorous adherence to sequential logic. We investigate this capability through PuzzleMate, a novel framework focused on jigsaw puzzle solving captured through an egocentric viewpoint. We deploy PuzzleMate in a user-in-the-loop study to evaluate how well state-of-the-art MLLMs perceive the current puzzle state and generate actionable next-step instructions. Our analysis reveals seven key bottlenecks that limit their effectiveness. Building on these insights, we propose a benchmark that enables systematic evaluation of MLLMs' reasoning capabilities for puzzle solving. Our findings reveal a substantial performance gap in current models like GPT-5.2 and Gemini-2.5-Pro; while these MLLMs are highly capable, they struggle to navigate the intricate reasoning and sequential logic essential for jigsaw puzzle assistance.
- Abstract(参考訳): パーソナルAIアシスタントは、デジタルインターフェースから複雑な身体活動を通じてユーザーを導くことができるエンボディ化されたコンパニオンへと進化する可能性を秘めている。
これらのアシスタントが日々の生活に不可欠なものにするためには、オブジェクトを識別する以上のことをしなければならない。
MLLM(Multimodal Large Language Models)は、一般的な視覚的理解において有望であるが、微粒な操作タスクのための基礎的かつシーケンシャルなガイダンスを提供する能力はほとんど検証されていない。
本稿では,ジグソーパズルを,この能力の戦略的テストベッドとして選択する。
一般的な物体認識とは異なり、パズル解法は高精度な空間推論、微小な幾何学的変分を区別する能力、シーケンシャル論理への厳密な固執を必要とする。
我々はこの能力を,エゴセントリックな視点から捉えたジグソーパズルの解法に焦点を当てた,新しいフレームワークであるPuzzleMateを通じて検討する。
我々はPuzzleMateをユーザ・イン・ザ・ループ・スタディに展開し、最先端のMLLMが現在のパズル状態をどのように認識しているかを評価し、実行可能な次のステップ命令を生成する。
分析の結果,有効性を制限する7つの重要なボトルネックが明らかになった。
これらの知見に基づいて,MLLMの推論能力の体系的評価を可能にするベンチマークを提案する。
GPT-5.2 や Gemini-2.5-Pro のような現在のモデルでは,これらのMLLM は高い能力を持つが,ジグソーパズル支援に不可欠な複雑な推論とシーケンシャル論理のナビゲートに苦慮している。
関連論文リスト
- Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games? [0.0]
本稿では,人間の論理的問題解決能力を評価するためのベンチマークであるVision-Language Against The Incredible Machine (VLATIM)を紹介する。
既存のベンチマークとは異なり、VLATIMは特に高レベルの論理的推論と連続的なアクション空間の間の臨界ギャップをターゲットとしている。
その結果, 推論と実行の相違が明らかとなった。
論文 参考訳(メタデータ) (2026-05-11T20:33:48Z) - Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios [56.703500104126014]
DailyClueは、日々のシナリオで視覚的な手がかり駆動推論のために設計されたベンチマークである。
本研究は,(1) 日常活動の厳格化,(2) 問合せ設計の課題,という2つの基本原則で導かれる。
本分析は,視覚的手がかりの正確な同定が堅牢な推論に不可欠であることを強調し,いくつかの重要な知見を明らかにした。
論文 参考訳(メタデータ) (2026-04-15T16:22:10Z) - Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles [13.059313134998192]
このサーベイは、LVLMにおける視覚パズル推論の統一的な視点を提供する。
共通の抽象化を通じて視覚パズルをフレーム化し、それらがターゲットとする推論メカニズムによって既存のベンチマークを編成する。
我々は、不安定な一般化、知覚と推論の密接な絡み合い、流動的な説明と忠実な実行の間の永続的なギャップなど、現在のモデルにおける一貫した限界を識別する。
論文 参考訳(メタデータ) (2026-01-20T08:02:04Z) - PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving [50.50405233978406]
我々は、OVPG(Open-ended Visual Puzzle Generation)という、完全に動的なマルチモーダル評価フレームワークを提案する。
OVPGは、パズル解決タスクにおいて、新しく、多様性があり、検証可能な評価データを自動的に生成することを目的としている。
OVPG上に構築されたPuzzleBenchは11,840のVQAサンプルからなる動的でスケーラブルなベンチマークである。
論文 参考訳(メタデータ) (2025-04-15T05:29:31Z) - CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation [53.452699232071495]
そこで我々は,大言語モデル(LLM)とLVLM(Large Vision-Language Model)の推論能力を評価するためのベンチマークであるCrossWordBenchを紹介する。
評価の結果,LLMの推論は,クロスレター制約を効果的に活用することにより,非推論モデルよりも大幅に優れていることがわかった。
本研究は,現在のLLMとLVLMの推論能力の限界を強調し,今後の評価のために,マルチモーダル制約タスクを作成するための効果的なアプローチを提供する。
論文 参考訳(メタデータ) (2025-03-30T20:03:36Z) - VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models [31.645103181716678]
LVLM(Large Vision-Language Models)は、正確な認識、ルール理解、論理的推論を必要とするパズルと競合する。
VGRP-Benchは、20種類のパズルを特徴とするVisual Grid Reasoning Puzzle Benchmarkである。
以上の結果から,現在最先端のLVLMでさえこれらのパズルに苦戦していることが明らかとなり,パズル解法の基本的限界が浮き彫りになった。
論文 参考訳(メタデータ) (2025-03-29T12:50:38Z) - LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning? [23.90259639381836]
LEGO-Puzzlesは、11の異なるタスクにまたがる1,100の精巧にキュレートされた視覚的質問応答(VQA)サンプルで構成されている。
最も強力なMLLMでさえ、テストケースの約半分しか答えられません。
実験の結果,GPT-4o と Gemini-2.0-Flash はこれらの命令に従う能力に制限があり,他のMLLM は入力画像を複製するか,全く無関係な出力を生成することがわかった。
論文 参考訳(メタデータ) (2025-03-25T18:21:07Z) - FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving [90.88021670297664]
FINEREASONは、大規模言語モデルの推論能力を評価するための論理パズルベンチマークである。
状態チェックと状態遷移という2つのタスクを導入し、モデルが現在の状況をどのように評価するかを総合的に評価し、次の動きを計画する。
状態チェックと遷移データに基づいてトレーニングされたモデルでは、GSM8Kで最大5.1%の精度で数学推論が向上することを示す。
論文 参考訳(メタデータ) (2025-02-27T16:23:25Z) - VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning [63.0285363282581]
MLLM(Multimodal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なツールとなっている。
本稿では,MLLMの知覚的理解と抽象的関係推論を評価するためのベンチマークVOILAを紹介する。
我々は,現在のMLLMが画像間関係の理解に苦慮し,高レベルの関係推論において限られた能力を示すことを明らかにした。
論文 参考訳(メタデータ) (2025-02-25T23:36:19Z) - Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems [25.0042181817455]
本稿では,大言語モデルとオフ・ザ・シェルフ定理証明器を統合したマルチエージェントシステムZPSを紹介する。
このシステムは、問題をより小さく管理可能な部分に分割することで、複雑なパズル解決作業に取り組む。
また,問題解の正当性を評価するための自動グリッドパズルグレーダを導入し,ユーザスタディで評価することで,自動グレーダが信頼性が高いことを示す。
論文 参考訳(メタデータ) (2024-07-04T14:22:25Z) - DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent) [73.10899129264375]
本稿では,LLMによる動的シーン理解のための包括的かつ概念的にエレガントなシステムであるドラモンGPTについて検討する。
質問/タスクのあるビデオが与えられた場合、DoraemonGPTは入力されたビデオをタスク関連の属性を格納するシンボリックメモリに変換することから始める。
我々は,DoraemonGPTの有効性を,3つのベンチマークといくつかのアプリ内シナリオで広範囲に評価した。
論文 参考訳(メタデータ) (2024-01-16T14:33:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。