論文の概要: Controlled Reformulation Testing for Logical Consistency in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.14528v1
- Date: Thu, 16 Jul 2026 03:30:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.972743
- Title: Controlled Reformulation Testing for Logical Consistency in Large Language Models
- Title(参考訳): 大規模言語モデルにおける論理的整合性の制御された再構成試験
- Abstract要約: 制御改革試験(CRTBench)における350の質問族(総質問数1,750)のベンチマークを示す。
本研究では,大言語モデルにおいて,制御された再編成における一貫した回答を維持する能力について検討する。
これらの結果から,LLMにおける論理的推論の評価には精度だけでは不十分であることが示唆された。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) frequently contradict themselves when the surface form of a logically equivalent question changes. We present a benchmark of 350 question families (1,750 total questions) for Controlled Reformulation Testing (CRTBench) to evaluate logical invariance. In this benchmark, we investigate LLMs' ability to maintain consistent answers across controlled reformulations, which include contrapositive rewriting, double negation, negation flipping, and passive voice. We evaluate several frontier LLMs and observe an accuracy-consistency gap where GPT-5.4-mini achieves $98.9\%$ base accuracy but only $60.3\%$ family-level consistency, while reasoning-optimized o4-mini achieves $96.9\%$ consistency. From our experiments, we observe that failures cluster around logically nontrivial transformations such as contrapositive rewriting ($72.4\%$ for GPT-5.4-mini) and double negation ($84.6\%$), while surface-level rephrasing remains robust ($94-100\%$). Increasing reasoning effort improves GPT-5.4-mini to $85.4\%$ consistency, but leaves GPT-5.4 unchanged overall because gains on nested negation are offset by failures on quantifier families. These results show that accuracy alone is not enough for evaluating logical reasoning in LLMs.
- Abstract(参考訳): 大きな言語モデル(LLM)は、論理的に等価な質問の表面形式が変化するときにしばしば矛盾する。
論理的不変性を評価するために,制御改革試験(CRTBench)のための350の質問族(総質問数1,750)のベンチマークを示す。
本ベンチマークでは, 反正の書き換え, 二重否定, 否定反転, 受動的音声を含む, 制御された書き換えにおける一貫した回答の維持能力について検討する。
我々は、いくつかのフロンティアLCMを評価し、GPT-5.4-miniがベース精度9,8.9 %、ファミリーレベルの一貫性60.3 %、推論最適化o4-miniが9,6.9 %となる精度-一貫性ギャップを観測した。
実験の結果, 反正の書き換え (GPT-5.4-mini) や二重否定 (84.6\%$) など, 論理的に非自明な変換をまわり, 表面レベルの言い換えは堅牢 (94-100\%$) であることがわかった。
推論努力の増加は、GPT-5.4-miniを85.4\%の一貫性に改善するが、ネストされた否定が量子化器ファミリーの故障によって相殺されるため、GPT-5.4は全体として変化しない。
これらの結果から,LLMにおける論理的推論の評価には精度だけでは不十分であることが示唆された。
関連論文リスト
- Robustness of LLM-Generated SystemVerilog Assertions to Semantics-Preserving RTL Transformations [0.0]
大規模言語モデル(LLM)は、SystemVerilog Assertion(SVA)の自動生成のために、ますます研究されている。
ほとんどの評価では、入力の単一の構文表現に正確さを報告している。
そのような点の精度は、モデルの正しい出力が同じRTLの振る舞いが異なる場合に安定であるかどうかを明らかにしない。
論文 参考訳(メタデータ) (2026-09-04T18:41:58Z) - Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution [0.0]
大規模言語モデルは、論理的に健全に見えるが、実際にはその前提に依存しないチェーン・オブ・シント(CoT)推論を生成する。
インベンショナル・グラウンディング・監査,ブラックボックス,ステップレベルの前提依存性テストを導入する。
すべての監査証明書、生のアウトプット、再生スクリプトは、パブリックGitHubリポジトリで利用できる。
論文 参考訳(メタデータ) (2026-07-11T01:32:22Z) - When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation [9.055086193088083]
10大言語モデルによって駆動されるチェーン・オブ・シンクとReActエージェントに経験的現象を記述した。
平均的な摂動は、同等の厳しさのプレゼンテーション摂動よりも、最終的な答えを頻繁に変更する。
論文 参考訳(メタデータ) (2026-05-25T15:57:11Z) - When Corrective Hints Hurt: Prompt Design in Reasoner-Guided Repair of LLM Overcaution on Entailed Negations under OWL~2~DL [10.675009214407185]
OWL2DL コンプライアンスクエリにおいて GPT-5.4 で再現可能なエラーパターンを報告した。
emphFunctionalProperty closure または class emphdisjointness' の下で、理性に満ちた答えが no''' である場合、モデルは「未知」を頻繁に答える。
論文 参考訳(メタデータ) (2026-04-25T18:11:01Z) - When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models [0.0]
自己参照的ステートメントとメタ認知的プロンプトは、主要な崩壊関連メトリクスのパラドックス的自己参照よりも安定している。
我々は、NCTRが有限深度変圧器をこれらの問題に集中する力学系へ強制することを提案する。
論文 参考訳(メタデータ) (2026-04-13T23:23:02Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Less Is More for Multi-Step Logical Reasoning of LLM Generalisation Under Rule Removal, Paraphrasing, and Compression [3.3492355863487275]
大規模言語モデル(LLM)は多くの自然言語処理において高い性能を達成するが、論理規則系の構造的摂動下での一般化は依然として不十分である。
本研究では,4つの応力試験による推理信頼性の検証を行う制御評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-06T10:49:50Z) - Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models [45.63440666848143]
MLLM(Multimodal Large Language Models)は、様々なモダリティの統合において顕著な進歩を見せている。
彼らの成功にもかかわらず、MLLMは会話の敵対的な入力に弱いままである。
我々は,最初に正しい回答を提供するモデルが,ユーザが提供する否定によってそのアウトプットを逆転するように説得される現象であるガスライティング否定攻撃について検討する。
論文 参考訳(メタデータ) (2025-01-31T10:37:48Z) - Benchmarking and Improving Generator-Validator Consistency of Language
Models [82.73914625520686]
言語モデル(LM)において、解答の生成と検証が一般的である矛盾
最先端のLMであるGPT-4でさえ、GVとの共存率はわずか76%である。
このアプローチはAlpaca-30BのGV一貫性を60%から93%に向上させる。
論文 参考訳(メタデータ) (2023-10-03T07:23:22Z) - Progressive-Hint Prompting Improves Reasoning in Large Language Models [63.98629132836499]
本稿では,プログレッシブ・ヒント・プロンプト(PHP)と呼ばれる新しいプロンプト手法を提案する。
事前に生成された回答をヒントとして使用することで、ユーザとLLM(Large Language Models)間の自動多元的対話を可能にする。
我々は7つのベンチマークで広範囲かつ包括的な実験を行った。その結果、PHPは高い効率を保ちながら精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2023-04-19T16:29:48Z) - Consistency Analysis of ChatGPT [65.268245109828]
本稿では,ChatGPTとGPT-4の論理的一貫した行動に対する信頼性について検討する。
その結果,両モデルとも言語理解能力と推論能力が向上しているように見えるが,論理的に一貫した予測が得られないことが示唆された。
論文 参考訳(メタデータ) (2023-03-11T01:19:01Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。