論文の概要: MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku
- arxiv url: http://arxiv.org/abs/2607.12711v2
- Date: Fri, 17 Jul 2026 12:17:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.237061
- Title: MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku
- Title(参考訳): シュドクにおける視覚言語モデル誘導のためのMaxSATに基づくフィードバック
- Abstract要約: VLM(Vision-Language Models)は、最近、構造化された視覚的推論タスクにおける有望なパフォーマンスを実証した。
本稿では,VLM解決プロセスに形式的制約推論を統合するニューロシンボリックアプローチを提案する。
- 参考スコア(独自算出の注目度): 9.132725363009044
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision--Language Models (VLMs) have recently demonstrated promising performance on structured visual reasoning tasks, including grid-based puzzles. However, despite strong perceptual capabilities, these models lack explicit mechanisms for enforcing logical consistency and frequently generate assignments that violate underlying constraints. In this paper, we propose a neuro-symbolic approach that integrates formal constraint reasoning into the VLM solving process via a Maximum Satisfiability (MaxSAT) oracle. Rather than computing solutions directly, the symbolic component acts as a consistency validator and refinement engine. Candidate placements generated by the VLM are encoded as soft clauses in a partial MaxSAT formulation, while Sudoku constraints remain hard clauses. When inconsistencies arise, the MaxSAT solver identifies a largest mutually consistent subset of assignments, which is then translated into structured textual and visual feedback to guide subsequent refinements. We evaluate our approach on a Sudoku dataset across multiple open-source and closed-access VLMs. Results show that MaxSAT-based feedback improves logical consistency and increases the number of solved instances, particularly in full-board refinement mode. These findings demonstrate that symbolic optimisation can enhance the reliability of vision-language reasoning.
- Abstract(参考訳): VLM(Vision-Language Models)は、グリッドベースのパズルを含む、構造化された視覚的推論タスクにおける有望なパフォーマンスを最近実証した。
しかし、強い知覚能力にもかかわらず、これらのモデルは論理的一貫性を強制する明確なメカニズムを欠き、基礎となる制約に反する代入を頻繁に生成する。
本稿では,最大満足度(MaxSAT)オラクルを用いて,形式的制約推論をVLM解決プロセスに統合するニューロシンボリックアプローチを提案する。
ソリューションを直接計算するのではなく、シンボリックコンポーネントは一貫性検証と改良エンジンとして機能する。
VLMによって生成される候補配置は、一部のMaxSATの定式化においてソフトな節としてエンコードされるが、Sudokuの制約はハードな節のままである。
不整合が発生した場合、MaxSATソルバは割り当ての最大の相互に一貫したサブセットを特定し、その後構造化されたテキストと視覚フィードバックに変換してその後の改善を導く。
我々は,複数のオープンソースおよびクローズドアクセスVLMを対象としたSudokuデータセットに対するアプローチを評価した。
その結果、MaxSATベースのフィードバックは、特にフルボードリファインメントモードにおいて、論理的一貫性を改善し、解決されたインスタンスの数を増加させることを示す。
これらの結果から,記号的最適化が視覚言語推論の信頼性を高めることが示唆された。
関連論文リスト
- Reliable Reasoning with Large Language Models via Preference-Based Maximum Satisfiability [19.16962344736341]
大きな言語モデル(LLM)は、自然言語を理解するのに優れているが、ユーザ定義の好みを含む最適化タスクに苦労する。
本稿では,LLMがコード生成を通じて推論を外部化するハイブリッド推論手法を提案する。
この結果から,LLMによるコード生成と嗜好に基づくMaxSATが組み合わさることで,ソルバ検証の最適化が可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-28T09:51:33Z) - Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition [51.68340973140949]
GMNER(Multimodal Named Entity Recognition)は、テキストベースのエンティティを抽出し、セマンティックカテゴリを割り当て、それらを対応する視覚領域に接地することを目的としている。
MLLMは、視覚バイアスやテキストバイアスを含む$textbfmodality bias$を示す。
本稿では,モダリティを考慮した一貫性推論(bfMCR$)を提案する。
論文 参考訳(メタデータ) (2026-02-04T12:12:49Z) - KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering [64.62317305868264]
テキスト模倣から強化学習によるインタラクション最適化へパラダイムをシフトするフレームワークである textbfKBQA-R1 を提案する。
KBQAを多ターン決定プロセスとして扱うことで,行動のリストを用いて知識ベースをナビゲートすることを学ぶ。
WebQSP、GrailQA、GraphQuestionsの実験では、KBQA-R1が最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-10T17:45:42Z) - Do LLMs Dream of Discrete Algorithms? [0.7646713951724011]
大規模言語モデル(LLM)は、人工知能の風景を急速に変化させてきた。
確率的推論への依存は、厳密な論理的推論を必要とする領域における有効性を制限する。
本稿では,論理ベースの推論モジュールでLLMを増強するニューロシンボリックアプローチを提案する。
論文 参考訳(メタデータ) (2025-06-29T22:03:01Z) - LLM-Symbolic Integration for Robust Temporal Tabular Reasoning [69.27153114778748]
本研究では,システムおよび制御された評価のための合成データセットであるTempTabQA-Cを紹介する。
この構造化アプローチにより、LLM(Large Language Models)はsqlクエリの生成と実行を可能にし、一般化とバイアス軽減の強化を行う。
論文 参考訳(メタデータ) (2025-06-06T05:14:04Z) - CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation [53.452699232071495]
そこで我々は,大言語モデル(LLM)とLVLM(Large Vision-Language Model)の推論能力を評価するためのベンチマークであるCrossWordBenchを紹介する。
評価の結果,LLMの推論は,クロスレター制約を効果的に活用することにより,非推論モデルよりも大幅に優れていることがわかった。
本研究は,現在のLLMとLVLMの推論能力の限界を強調し,今後の評価のために,マルチモーダル制約タスクを作成するための効果的なアプローチを提供する。
論文 参考訳(メタデータ) (2025-03-30T20:03:36Z) - Large Language Models Meet Symbolic Provers for Logical Reasoning Evaluation [24.081573908824353]
一階述語論理(FOL)推論はインテリジェントシステムにおいて重要である。
既存のベンチマークは、広範囲の人間のアノテーションや手作りテンプレートに依存していることが多い。
本稿では,大言語モデルの生成強度を記号型プローサの厳密性と精度で相乗化するProverGenという新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-10T15:31:54Z) - NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision [64.83085920775316]
NPHardEval4Vは4つの古典的NPハード問題に基づくマルチモーダルベンチマークスイートである。
各タスクは、構造化された視覚レイアウトとテキストプロンプトを組み合わせることで、視覚言語的制約の下で推論を行うLVLMの能力を評価するように設計されている。
以上の結果から,これらのモデルは知覚に基づく入力に対して合理的に優れているが,グローバルな最適化,抽象化,制約満足度に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2024-03-04T07:10:31Z) - SatLM: Satisfiability-Aided Language Models Using Declarative Prompting [68.40726892904286]
本研究では,大規模言語モデル (LLM) の推論能力を向上させるために,新しい満足度支援言語モデリング (SatLM) 手法を提案する。
我々はLLMを用いて命令型プログラムではなく宣言型タスク仕様を生成し、既製の自動定理証明器を利用して最終解を導出する。
我々はSATLMを8つの異なるデータセット上で評価し、命令パラダイムにおいてプログラム支援されたLMよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2023-05-16T17:55:51Z) - SUN: Exploring Intrinsic Uncertainties in Text-to-SQL Parsers [61.48159785138462]
本稿では,ニューラルネットワークに基づくアプローチ(SUN)における本質的な不確かさを探索することにより,テキストから依存への変換性能を向上させることを目的とする。
5つのベンチマークデータセットの大規模な実験により、我々の手法は競合より大幅に優れ、新しい最先端の結果が得られた。
論文 参考訳(メタデータ) (2022-09-14T06:27:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。