論文の概要: Bridging the Know-Act Gap via Task-Level Autoregressive Reasoning
- arxiv url: http://arxiv.org/abs/2603.22619v1
- Date: Mon, 23 Mar 2026 22:43:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.207432
- Title: Bridging the Know-Act Gap via Task-Level Autoregressive Reasoning
- Title(参考訳): タスクレベル自己回帰推論によるノウアクティギャップのブリッジ
- Authors: Jihyun Janice Ahn, Ryo Kamoi, Berk Atil, Renze Lou, WonWoo Kang, Heehyun Park, Sarkar Snigdha Sarathi Das, Zhuoyang Zou, Xiaoxin Lu, Yusen Zhang, Asfahan Shah, Ridwanul Hasan Tanvir, Lingxiao Zhao, Hongxi Huang, Vignesh Venkatesh, Dianjun Lin, Hamid Shah, Wentao Wang, Zhanpeng Song, Joshua Reed Bassin, Dax Patel, Ishan Appareddy Agrahar, Sahil Pardasani, Xin Dong, Fatemeh Rahbari, Benjamin David Rishel, Soochan Andrew Lee, Yuv Boghani, Ali B. AlNaseeb, Pranav Suby, Seokhyeon Bae, Shreya Buddharaju, Damien Kula, Soumyadeep Das, Hanyang Frank Liu, Faye Mo, Wenpeng Yin,
- Abstract要約: 我々は,新たに構築された大規模・学際横断的な問題ベンチマークであるFactyScienceを用いて,包括的解析を行った。
このギャップは,タスク選択とコンテンツ生成を結びつけるトークンレベルの自己回帰に起因していることを示す。
この決定を明示的にモデル化したタスクレベルの自動回帰フレームワークであるDeIllusionLLMを提案する。
- 参考スコア(独自算出の注目度): 22.264933226031435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs often generate seemingly valid answers to flawed or ill-posed inputs. This is not due to missing knowledge: under discriminative prompting, the same models can mostly identify such issues, yet fail to reflect this in standard generative responses. This reveals a fundamental know-act gap between discriminative recognition and generative behavior. Prior work largely characterizes this issue in narrow settings, such as math word problems or question answering, with limited focus on how to integrate these two modes. In this work, we present a comprehensive analysis using FaultyScience, a newly constructed large-scale, cross-disciplinary benchmark of faulty scientific questions. We show that the gap is pervasive and stems from token-level autoregression, which entangles task selection (validate vs. answer) with content generation, preventing discriminative knowledge from being utilized. To address this, we propose DeIllusionLLM, a task-level autoregressive framework that explicitly models this decision. Through self-distillation, the model unifies discriminative judgment and generative reasoning within a single backbone. Empirically, DeIllusionLLM substantially reduces answer-despite-error failures under natural prompting while maintaining general reasoning performance, demonstrating that self-distillation is an effective and scalable solution for bridging the discriminative-generative know-act gap
- Abstract(参考訳): LLMは、しばしば欠陥や不適切な入力に対する有効な答えを生成する。
これは知識の欠如によるものではなく、差別的なプロンプトの下では、同じモデルがそのような問題をほとんど特定できるが、標準的な生成応答ではそれを反映できない。
このことは、差別的認識と生成的行動の間には、根本的なノウハウのギャップが浮かび上がっている。
以前の研究は、この問題を数学の単語問題や質問応答といった狭い設定で特徴づけており、これらの2つのモードを統合する方法に限定している。
本研究では,新たに構築された大規模・学際的な科学的問題ベンチマークであるFactyScienceを用いて,包括的解析を行う。
このギャップは広範に存在し、トークンレベルの自己回帰が原因であり、これはタスク選択(妥当性対回答)をコンテンツ生成に絡め込み、差別的知識の活用を妨げていることを示している。
そこで我々は,この決定を明示的にモデル化したタスクレベルの自己回帰フレームワークであるDeIllusionLLMを提案する。
自己蒸留により、モデルは単一のバックボーン内で識別的判断と生成的推論を統一する。
実証的に、DeIllusionLLMは、自然な推論性能を維持しながら、自然なプロンプト下での応答-不一致の失敗を著しく低減し、自己蒸留が識別・生成的ノウ・アクティブギャップをブリッジするための効果的でスケーラブルなソリューションであることを実証した。
関連論文リスト
- WakenLLM: Evaluating Reasoning Potential and Stability in LLMs via Fine-Grained Benchmarking [34.350505059394536]
大規模言語モデル(LLM)は、推論タスクにおいて未知のラベルを頻繁に出力する。
我々は、モデル非能力に起因する未知の出力の一部を定量化するフレームワーク、WakenLLMを紹介した。
論文 参考訳(メタデータ) (2025-07-22T03:21:48Z) - Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search [76.54475437069395]
大きな言語モデル(LLM)は、意味的に一貫性があるがタスクに依存しないコンテキスト情報に直面している場合、元のパフォーマンスを維持するのに苦労することが多い。
本稿では,木探索に基づく動的散逸生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-03T18:43:36Z) - LLM Uncertainty Quantification through Directional Entailment Graph and Claim Level Response Augmentation [5.255129053741665]
大規模言語モデル(LLM)は、基本質問応答(QA)に起因して、様々な領域にわたる高度なタスクにおいて優れた機能を示した。
そこで,本稿では,包含確率から方向グラフを構築することにより,方向不安定性を捉える不確実性を評価する新しい手法を提案する。
また、提案したレイヤに既存の作業のセマンティクスの不確実性を統合する方法も提供します。
論文 参考訳(メタデータ) (2024-07-01T06:11:30Z) - R-Tuning: Instructing Large Language Models to Say `I Don't Know' [66.11375475253007]
大きな言語モデル(LLM)は、優れたパフォーマンスで多くのドメインに革命をもたらしたが、それでもその課題に直面している。
事前の指導チューニング方法は、モデルが知識を知っているかどうかに関わらず、モデルに文章を完成させるよう強制する。
我々はRefusal-Aware Instruction Tuning (R-Tuning)と呼ばれる新しいアプローチを提案する。
実験の結果、R-Tuningは、既知の質問に答えたり、未知の質問に答えるのを控えるモデルの能力を効果的に改善することを示した。
論文 参考訳(メタデータ) (2023-11-16T08:45:44Z) - Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs [58.620269228776294]
そこで本稿では,ユーザに対して,あいまいさを解消するためのタスク非依存のフレームワークを提案する。
我々は3つのNLPアプリケーション(質問応答、機械翻訳、自然言語推論)にまたがるシステムを評価する。
インテントシムは堅牢であり、幅広いNLPタスクやLMの改善を実証している。
論文 参考訳(メタデータ) (2023-11-16T00:18:50Z) - A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning [73.77088902676306]
論理的推論の文脈において,大規模言語モデル(LLM)の自己検証能力について詳しく検討する。
本研究の主目的は,既存のLCMが誤った推論手順を正確に識別するのに苦労し,自己検証法の有効性を保証できないことにある。
論文 参考訳(メタデータ) (2023-11-14T07:13:10Z) - Multi-level Adaptive Contrastive Learning for Knowledge Internalization
in Dialogue Generation [37.55417272177113]
知識基底対話生成は、文脈を補うために外部知識を統合することを目的としている。
しかし、このモデルはしばしば、この情報を人間的な方法で応答に内部化するのに失敗する。
否定例を動的にサンプリングし,その後に退化挙動をペナルティ化する多段階適応コントラスト学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-13T08:16:27Z) - Disentangling Observed Causal Effects from Latent Confounders using
Method of Moments [67.27068846108047]
我々は、軽度の仮定の下で、識別性と学習可能性に関する保証を提供する。
我々は,線形制約付き結合テンソル分解に基づく効率的なアルゴリズムを開発し,スケーラブルで保証可能な解を得る。
論文 参考訳(メタデータ) (2021-01-17T07:48:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。