Fugu-MT 論文翻訳(概要): Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought

論文の概要: Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought

arxiv url: http://arxiv.org/abs/2210.01240v1
Date: Mon, 3 Oct 2022 21:34:32 GMT
ステータス: 翻訳完了
システム内更新日: 2022-10-05 14:05:59.279089
Title: Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought
Title（参考訳）: 言語モデルがグリーディ・ライソナーになる: 秩序の連鎖の体系的形式解析
Authors: Abulhair Saparov and He He
Abstract要約: 大規模言語モデル(LLM)は、チェーン・オブ・シークレット・プロンプトが与えられた顕著な推論能力を示している。本稿では, PrOntoQAと呼ばれる合成質問応答データセットを提案し, それぞれの例を合成世界モデルとして生成する。これにより、生成された連鎖を形式解析の象徴的な証明に解析することができる。
参考スコア（独自算出の注目度）: 10.524051272257614
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Large language models (LLMs) have shown remarkable reasoning capabilities given chain-of-thought prompts (examples with intermediate reasoning steps). Existing benchmarks measure reasoning ability indirectly, by evaluating accuracy on downstream tasks such as mathematical reasoning. However, it is unclear how these models obtain the answers and whether they rely on simple heuristics rather than the generated chain-of-thought. To enable systematic exploration of the reasoning ability of LLMs, we present a new synthetic question-answering dataset called PrOntoQA, where each example is generated from a synthetic world model represented in first-order logic. This allows us to parse the generated chain-of-thought into symbolic proofs for formal analysis. Our analysis on InstructGPT and GPT-3 shows that LLMs are quite capable of making correct individual deduction steps, and so are generally capable of reasoning, even in fictional contexts. However, they have difficulty with proof planning: When multiple valid deduction steps are available, they are not able to systematically explore the different options.
Abstract（参考訳）: 大規模言語モデル(LLM)は、チェーン・オブ・シークレット・プロンプト(中間的推論ステップの例)が与えられた顕著な推論能力を示している。既存のベンチマークは、数学的推論のような下流タスクの正確性を評価することによって、間接的に推論能力を測定する。しかし、これらのモデルがどのように答えを得るのか、そしてそれらが生成された連鎖よりも単純なヒューリスティックに依存しているかどうかは不明である。 LLMの推論能力の体系的な探索を可能にするために、PrOntoQAと呼ばれる新しい合成質問応答データセットを提案し、各例は1次論理で表される合成世界モデルから生成される。これにより、生成された連鎖を形式解析の象徴的な証明に解析することができる。 InstructGPT と GPT-3 を用いて解析した結果,LLM は個々の推論ステップを正しく行うことができ,フィクションの文脈においても推論が可能であることがわかった。有効な推論ステップが複数用意されている場合、異なる選択肢を体系的に探索することはできません。

関連論文リスト

Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models [2.172419551358714]
大規模言語モデル(LLM)は、自然言語推論タスク全体で強いパフォーマンスを示しているが、その推論プロセスは脆弱で解釈が難しいままである。 Theorem-of-Thought (ToTh)は、3つの並列エージェント間の協調として推論をモデル化する新しいフレームワークである。シンボリック(WebOfLies)と数値(MultiArithm)の推論ベンチマークの実験は、ToThがCoT、セルフ一貫性、CoT-デコーディングを一貫して上回っていることを示している。
論文参考訳（メタデータ） (2025-06-08T12:28:38Z)
CLATTER: Comprehensive Entailment Reasoning for Hallucination Detection [60.98964268961243]
我々は,系統的かつ包括的な推論プロセスを実行するためのモデルを導くことで,モデルがよりきめ細やかで正確な絞り込み決定を実行できることを提案する。我々は,(i)クレームの分解,(ii)サブクレームの属性と包含分類,および(iii)集約分類から成る3段階の推論プロセスを定義し,そのような導出推論が実際に幻覚検出の改善をもたらすことを示す。
論文参考訳（メタデータ） (2025-06-05T17:02:52Z)
Can Large Language Models Learn Formal Logic? A Data-Driven Training and Evaluation Framework [2.9334627971166336]
本稿では,大規模言語モデル(LLM)の論理的推論能力について検討する。訓練されたLLMは、一連の仮定とゴールを入力として受け取り、その仮定からゴールを正式に導出する証明を出力として生成する。トレーニングにとって重要な障害は、現実世界の証明が不足していることだ。
論文参考訳（メタデータ） (2025-04-28T19:25:29Z)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models [51.99046112135311]
我々は、大言語モデルの厳密な評価のための合成推論ベンチマークであるJustLogicを紹介する。 JustLogicは非常に複雑で、多様な言語パターン、語彙、引数構造を生成することができる。実験の結果,ほとんどのSOTA (State-of-the-art (SOTA) LLMは人体平均よりも著しく低下していることがわかった。
論文参考訳（メタデータ） (2025-01-24T15:49:10Z)
Critical-Questions-of-Thought: Steering LLM reasoning with Argumentative Querying [0.3659498819753633]
State-of-the-art Large Language Model (LLM) は論理的および数学的推論を行う際にも苦戦している。本稿では、議論論に関する文献からの批判的質問の概念を利用し、特にトゥールミンの議論モデルに焦点を当てる。これらの重要な質問を取り入れることで,LLMの推論能力が向上することを示す。
論文参考訳（メタデータ） (2024-12-19T18:51:30Z)
P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains [97.25943550933829]
P-FOLIO(P-FOLIO)は、多種多様で複雑な推論連鎖からなる人称注釈付きデータセットである。我々はP-FOLIOを用いて大規模言語モデル推論機能の評価と改善を行う。
論文参考訳（メタデータ） (2024-10-11T19:22:57Z)
On the Diagram of Thought [12.304069891580658]
現在の大規模言語モデル(LLM)は印象的な能力を示しているが、複雑な多段階推論タスクに苦労している。 1つの自己回帰型LCMが内部で構成し、DAG(Directed Acyclic Graph)をナビゲートするフレームワークとして、Diagram of Thought(DoT)を紹介した。本研究は,適切なトポ内の図式として推論DAGを定式化し,検証された情報を集約する最終段階が関連するサブダイアグラムのコリミットの計算に意味的に対応していることを証明する。
論文参考訳（メタデータ） (2024-09-16T07:01:41Z)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation [110.71955853831707]
我々は、LMを、事前学習時に見られる間接的推論経路を集約することで、新たな結論を導出すると考えている。我々は、推論経路を知識/推論グラフ上のランダムウォークパスとして定式化する。複数のKGおよびCoTデータセットの実験と分析により、ランダムウォークパスに対するトレーニングの効果が明らかにされた。
論文参考訳（メタデータ） (2024-02-05T18:25:51Z)
Neuro-Symbolic Integration Brings Causal and Reliable Reasoning Proofs [95.07757789781213]
LLMの複雑な推論には2行のアプローチが採用されている。 1行の作業は様々な推論構造を持つLLMを誘導し、構造出力は自然に中間推論ステップと見なすことができる。他方の行では、LCMのない宣言的解法を用いて推論処理を行い、推論精度は向上するが、解法のブラックボックスの性質により解釈性に欠ける。具体的には,Prologインタプリタが生成した中間検索ログにアクセスし,人間可読推論に解釈可能であることを示す。
論文参考訳（メタデータ） (2023-11-16T11:26:21Z)
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning [73.77088902676306]
論理的推論の文脈において,大規模言語モデル(LLM)の自己検証能力について詳しく検討する。本研究の主目的は,既存のLCMが誤った推論手順を正確に識別するのに苦労し,自己検証法の有効性を保証できないことにある。
論文参考訳（メタデータ） (2023-11-14T07:13:10Z)
Are LLMs Rigorous Logical Reasoner? Empowering Natural Language Proof Generation with Contrastive Stepwise Decoding [11.385103498440932]
本稿では,論理的推論のためのモデルの能力を高めるために,負の推論経路を用いることにより,ステップワイズな証明生成に対照的な復号を導入する。 EntailmentBankの実験は、言語モデルの計画能力を実証する上で、我々の手法の成功を裏付けている。
論文参考訳（メタデータ） (2023-11-12T05:12:49Z)
Towards a Mechanistic Interpretation of Multi-Step Reasoning Capabilities of Language Models [107.07851578154242]
言語モデル(LM)は強力な多段階推論能力を持つ。 LMが事前学習コーパスから記憶された回答を不正に処理するか,多段階推論機構を用いてタスクを実行するかは明らかでない。メカニスティックプローブは,ほとんどの例において,モデルの注意から推論ツリーの情報を検出することができることを示す。
論文参考訳（メタデータ） (2023-10-23T01:47:29Z)
Deductive Verification of Chain-of-Thought Reasoning [22.79166959432764]
大型言語モデル(LLM)は、様々な推論タスクを実行する上で、Chain-of-Thoughtの恩恵を受ける。 CoTはモデルがより包括的な推論プロセスを生成することを可能にするが、中間的推論ステップに重点を置くことは、必然的に幻覚や累積エラーをもたらす可能性がある。本研究では,自然言語に基づく帰納的推論形式であるNatural Programを提案する。
論文参考訳（メタデータ） (2023-06-06T17:18:56Z)
LAMBADA: Backward Chaining for Automated Reasoning in Natural Language [11.096348678079574]
LAMBADAと呼ばれる逆チェインアルゴリズムは、推論を4つのサブモジュールに分解する。 LAMBADAは最先端のフォワード推論手法よりも精度が向上することを示す。
論文参考訳（メタデータ） (2022-12-20T18:06:03Z)
Evaluating Step-by-Step Reasoning through Symbolic Verification [20.156768135017007]
事前学習言語モデル(LM)は、文脈内学習において顕著な推論性能を示した。 LMLPは、より小さなモデルサイズであっても、長さの一般化ベンチマークにおいて、チェーン・オブ・ソート(CoT)よりも25%以上精度が高い。
論文参考訳（メタデータ） (2022-12-16T19:30:01Z)
MetaLogic: Logical Reasoning Explanations with Fine-Grained Structure [129.8481568648651]
複雑な実生活シナリオにおけるモデルの論理的推論能力を調べるためのベンチマークを提案する。推論のマルチホップ連鎖に基づいて、説明形式は3つの主成分を含む。この新たな説明形式を用いて,現在のベストモデルの性能を評価した。
論文参考訳（メタデータ） (2022-10-22T16:01:13Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。