論文の概要: Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?
- arxiv url: http://arxiv.org/abs/2608.05097v1
- Date: Wed, 05 Aug 2026 17:33:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.059984
- Title: Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?
- Title(参考訳): 言語モデルはモーダル論理の仕様に従うか?
- Authors: Réemi Andrieu, Damien Sileo,
- Abstract要約: 同一の前提条件と推測条件を持つペア型モーダル問題に対する言語モデルの評価を行った。
バランスの取れたコアは、セマンティックな条件だけで答えを明らかにするのを防ぐ。
公式、オラクルアーティファクト、カウンターモデル、レスポンスを解放します。
- 参考スコア(独自算出の注目度): 2.9458822941489387
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning about necessity and possibility depends on assumptions about accessibility between worlds and about which objects exist at each one. The same inference may therefore hold under one modal system and fail under another. Evaluating language models on such problems requires testing whether their judgments follow the stated semantics rather than a familiar logic. We construct paired modal problems with identical premises and conjecture but different frame or domain conditions; automated reasoning verifies opposite labels. A balanced core prevents the semantic condition alone from revealing the answer. On this core, four of five recent models perform below the condition-only baseline under direct prompting. Yet enabling reasoning mode raises DeepSeek V4 Flash from 4.4% to 88.1% on unchanged prompts. Following stipulated modal semantics thus depends strongly on inference mode as well as model identity. When frame conditions are omitted, models often agree but fit different familiar logics best. We release the formulas, oracle artifacts, countermodels, and responses.
- Abstract(参考訳): 必要性と可能性に関する推論は、世界間のアクセシビリティに関する仮定と、どのオブジェクトがそれぞれの世界に存在しているかに依存する。
したがって、同じ推論は1つのモード体系の下に保持され、もう1つのモードで失敗する。
このような問題に対する言語モデルの評価には、その判断が慣れ親しんだ論理ではなく、記述された意味論に従うかどうかをテストする必要がある。
我々は、同一の前提条件と予想を持つペア型モーダル問題を構築するが、フレームや領域条件が異なるので、自動推論は反対のラベルを検証できる。
バランスの取れたコアは、セマンティックな条件だけで答えを明らかにするのを防ぐ。
このコアでは、5つの最新のモデルのうち4つが直接プロンプトの下で条件のみのベースライン以下で実行される。
しかし、推論モードを有効にすると、DeepSeek V4 Flashは不規則なプロンプトで4.4%から88.1%に上昇する。
したがって、規定されたモーダルセマンティクスに従うことは、推論モードとモデルアイデンティティに強く依存する。
フレーム条件が省略された場合、モデルはよく一致するが、最もよく知られたロジックに適合する。
公式、オラクルアーティファクト、カウンターモデル、レスポンスを解放します。
関連論文リスト
- GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods [20.57926775700787]
クロスモーダルな説明可能性を評価するために設計された最初の診断フレームワークであるGridVQA-Xを紹介する。
自然なデータセットとは異なり、GridVQA-Xはクローズドワールド合成ロジックを利用して、ユニークな数学的に保証された説明を生成する。
提案手法は, 実空間関係推論に基づくモデルと, クロスモーダルショートカットを利用したモデルとを区別できないことがわかった。
論文 参考訳(メタデータ) (2026-06-02T17:18:24Z) - The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models [15.12701445445687]
潜在CoTを用いた推論において,言語モデルが実際に重ね合わせを利用するかどうかを検討する。
スクラッチからトレーニングされたモデルだけが、重ね合わせを使うことの兆候を示します。
この結果は、連続連鎖推論において重畳がいつ、なぜ生じるのかを統一的に説明できる。
論文 参考訳(メタデータ) (2026-04-07T18:59:32Z) - Non-Monotonic S4F Standpoint Logic (Extended Version with Proofs) [1.0312968200748118]
本稿では,S4Fスタンプポイント論理と呼ばれる新しい形式論を提案する。
多視点、非単調なセマンティックコミットメントを表現できる。
論文 参考訳(メタデータ) (2025-11-13T16:14:23Z) - Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach [70.44265766483633]
本稿では,潜在空間における暗黙的推論によるテスト時間計算のスケールアップが可能な,新しい言語モデルアーキテクチャについて検討する。
我々のモデルは繰り返しブロックを繰り返すことで動作し、テスト時に任意の深さに展開する。
結果のモデルが推論ベンチマークの性能を劇的に改善できることが示される。
論文 参考訳(メタデータ) (2025-02-07T18:55:02Z) - Self-supervised Analogical Learning using Language Models [59.64260218737556]
自己教師型アナログ学習フレームワークであるSALを提案する。
SALは人間の類推過程を模倣し、高品質な記号解を明示的に伝達するようモデルを訓練する。
得られたモデルは、幅広い推論ベンチマークでベース言語モデルより優れていることを示す。
論文 参考訳(メタデータ) (2025-02-03T02:31:26Z) - QUITE: Quantifying Uncertainty in Natural Language Text in Bayesian Reasoning Scenarios [15.193544498311603]
本稿では,カテゴリー的確率変数と複雑な関係を持つ実世界のベイズ推論シナリオのデータセットであるQUITEを提案する。
我々は幅広い実験を行い、論理ベースのモデルが全ての推論型において、アウト・オブ・ボックスの大規模言語モデルより優れていることを発見した。
以上の結果から,ニューロシンボリックモデルが複雑な推論を改善する上で有望な方向であることを示す。
論文 参考訳(メタデータ) (2024-10-14T12:44:59Z) - How FaR Are Large Language Models From Agents with Theory-of-Mind? [69.41586417697732]
大規模言語モデル(LLM)に対する新たな評価パラダイムを提案する。
T4Dは、他者の精神状態に関する推論を社会的シナリオにおける行動に結びつけるモデルを必要とする。
ゼロショットプロンプトフレームワークであるフォアシー・アンド・リフレクション(FaR)を導入し,LCMが今後の課題を予測できるように推論構造を提供する。
論文 参考訳(メタデータ) (2023-10-04T06:47:58Z) - Logical Satisfiability of Counterfactuals for Faithful Explanations in
NLI [60.142926537264714]
本稿では, 忠実度スルー・カウンタファクトの方法論について紹介する。
これは、説明に表される論理述語に基づいて、反実仮説を生成する。
そして、そのモデルが表現された論理と反ファクトの予測が一致しているかどうかを評価する。
論文 参考訳(メタデータ) (2022-05-25T03:40:59Z) - Provable Limitations of Acquiring Meaning from Ungrounded Form: What
will Future Language Models Understand? [87.20342701232869]
未知のシステムが意味を習得する能力について検討する。
アサーションによってシステムが等価性のような意味関係を保存する表現をエミュレートできるかどうか検討する。
言語内のすべての表現が参照的に透明であれば,アサーションによってセマンティックエミュレーションが可能になる。
しかし、言語が変数バインディングのような非透過的なパターンを使用する場合、エミュレーションは計算不能な問題になる可能性がある。
論文 参考訳(メタデータ) (2021-04-22T01:00:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。