論文の概要: Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning
- arxiv url: http://arxiv.org/abs/2606.13607v2
- Date: Sat, 13 Jun 2026 20:58:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 13:45:31.213758
- Title: Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning
- Title(参考訳): パターンマッチングとしての推論:人間とLLMにおける共有メカニズム
- Abstract要約: 大規模言語モデル(LLM)は推論において一般化またはハファザードエラーを発生させるのに失敗する。
人間の行動は、人間の推論が原則的および抽象的世界モデルを使用するため、同じタイプの失敗を示さないことが示唆される。
各種の日常生活状況に関する常識的推論を行う能力について, 被験者25名, LLM25名について検討した。
- 参考スコア(独自算出の注目度): 0.13368662482451263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When large language models (LLMs) fail to generalize or make haphazard errors in reasoning, it is often taken as evidence that LLMs are not truly reasoning, but rather performing a kind of pattern matching. The implication is that people's behavior does not exhibit the same types of failures because human reasoning uses principled and abstract world models. We evaluate human participants and 25 LLMs on their ability to engage in common-sense reasoning about a variety of everyday situations and observe similar patterns of errors in both people and models. We then identify the set of attention heads driving LLM responses and find that these heads implement a form of pattern-matching. These attention heads allow us to predict seemingly inexplicable reasoning errors in people caused by ostensibly irrelevant prompt details. Taken together, our results suggest that everyday causal reasoning in people and LLMs is more consistent with a form of pattern-matching than with abstract world models.
- Abstract(参考訳): 大規模言語モデル(LLM)が推論において一般化またはハファザードな誤りを犯さない場合、LLMが真の推論ではなく、ある種のパターンマッチングを実行するという証拠としてしばしば用いられる。
人間の行動は、人間の推論が原則的および抽象的世界モデルを使用するため、同じタイプの失敗を示さないことが示唆される。
我々は,人間と25個のLDMを,様々な日常的状況に関する常識的推論に携わる能力について評価し,人間とモデルの両方で類似したエラーパターンを観察した。
次に、LCM応答を駆動する注目ヘッドのセットを特定し、これらのヘッドがパターンマッチングの形式で実装されていることを確認する。
これらの注目は、一見無関係なプロンプトの詳細によって引き起こされる人々の説明不能な推論エラーを予測できる。
この結果から,人やLSMの日常的因果推論は,抽象的世界モデルよりもパターンマッチングの形式と一致していることが示唆された。
関連論文リスト
- Thinking effort aligns between humans and reasoning models in abductive reasoning [0.0]
大規模言語モデル(LRM)は、検証可能な報酬からの強化学習によって最適化され、推論タスクに対する正しい解決策が奨励される。
近年の研究では、人間の反応時間とモデル推論トレースを比較することで、人間とLEMの思考コストを調査している。
我々は、LRMと人間の推論努力が一致していることのさらなる証拠と、モデルと人間が同様の誤りを犯す傾向があることの証拠を見出した。
論文 参考訳(メタデータ) (2026-09-01T21:02:18Z) - To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks [56.11584171938381]
心の理論 (ToM) は、モデルが信念、欲望、意図などの隠された精神状態を推測できるかどうかを評価する。
近年のLRM(Large Reasoning Models)の進歩により、数学やコーディングにおけるステップバイステップ推論が向上している。
本研究では,9つの大規模言語モデル(LLM)の体系的研究を行い,推論モデルと非推論モデルを比較した。
論文 参考訳(メタデータ) (2026-02-11T08:16:13Z) - MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables [50.29407048003165]
MORABLESは,歴史文献から引用されたファブレットと短編から構築された人間検証ベンチマークである。
主なタスクは、道徳的推論をターゲットとした複数選択の質問として構成されており、モデルが浅く抽出された質問応答を超えるよう挑戦する注意深い注意を払っている。
以上の結果から,より大きなモデルはより小さなモデルよりも優れているが,敵の操作に敏感であり,真の道徳的推論よりも表面的パターンに頼っていることが示唆された。
論文 参考訳(メタデータ) (2025-09-15T19:06:10Z) - Can Reasoning Help Large Language Models Capture Human Annotator Disagreement? [84.32752330104775]
ヒトのアノテーションの変化(つまり不一致)は、NLPでは一般的である。
異なる推論条件が大言語モデルの不一致モデルに与える影響を評価する。
意外なことに、RLVRスタイルの推論は不一致モデリングにおいて性能を低下させる。
論文 参考訳(メタデータ) (2025-06-24T09:49:26Z) - Do Large Language Models Reason Causally Like Us? Even Better? [7.749713014052951]
大きな言語モデル(LLM)は、人間のようなテキストを生成する際、印象的な能力を示している。
我々は,コライダーグラフに基づくタスクを用いて,ヒトの因果推論と4つのLDMを比較した。
論文 参考訳(メタデータ) (2025-02-14T15:09:15Z) - Failure Modes of LLMs for Causal Reasoning on Narratives [51.19592551510628]
世界の知識と論理的推論の相互作用について検討する。
最先端の大規模言語モデル(LLM)は、しばしば表面的な一般化に依存している。
タスクの単純な再構成により、より堅牢な推論行動が引き起こされることを示す。
論文 参考訳(メタデータ) (2024-10-31T12:48:58Z) - RULEBREAKERS: Challenging LLMs at the Crossroads between Formal Logic and Human-like Reasoning [3.0648414540406703]
RULEBREAKERSは、大規模な言語モデルによるルールブレーカーの認識と応答を人間的な方法で厳格に評価するための最初のデータセットです。
GPT-4oを含むほとんどのモデルでは、RULEBREAKERSの中間精度が得られ、典型的な人間の推論と異なり、論理規則を過度に適用する傾向が見られた。
論文 参考訳(メタデータ) (2024-10-21T20:48:16Z) - Large Language Models Assume People are More Rational than We Really are [10.857040292234984]
AIが人と効果的にコミュニケーションするためには、意思決定の仕方を理解する必要があります。
以前の実証的な証拠は、これらの暗黙のモデルが正確であることを示唆しているようである。
人々の選択をシミュレートし、予測する場合は、実際にはそうではありません。
論文 参考訳(メタデータ) (2024-06-24T18:15:27Z) - (Ir)rationality and Cognitive Biases in Large Language Models [2.9008806248012333]
認知心理学文献からのタスクを用いた7つの言語モデルの評価を行った。
人間と同じく、LLMはこれらのタスクに不合理性を示す。
これらのタスクに対してLLMによって誤った答えが与えられる場合、それらはしばしば人間のようなバイアスとは異なる方法で間違っている。
論文 参考訳(メタデータ) (2024-02-14T14:17:21Z) - A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning [73.77088902676306]
論理的推論の文脈において,大規模言語モデル(LLM)の自己検証能力について詳しく検討する。
本研究の主目的は,既存のLCMが誤った推論手順を正確に識別するのに苦労し,自己検証法の有効性を保証できないことにある。
論文 参考訳(メタデータ) (2023-11-14T07:13:10Z) - Exposing Attention Glitches with Flip-Flop Language Modeling [55.0688535574859]
この研究は、大きな言語モデルにおける注意点の現象を特定し、分析する。
ニューラルネットワークモデルの外挿挙動を探索するために設計された,合成ベンチマークのファミリであるフリップフロップ言語モデリング(FFLM)を導入する。
その結果,Transformer FFLM は散発的推論誤差の長い尾に悩まされていることがわかった。
論文 参考訳(メタデータ) (2023-06-01T17:44:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。