論文の概要: Thinking Under Uncertainty: Evidence Use and Information-Seeking in Language Models
- arxiv url: http://arxiv.org/abs/2607.26845v1
- Date: Wed, 29 Jul 2026 12:33:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.666088
- Title: Thinking Under Uncertainty: Evidence Use and Information-Seeking in Language Models
- Title(参考訳): 不確実性の下で考える:言語モデルにおけるエビデンス利用と情報探索
- Abstract要約: 我々は行動選好,思考長,不確実性に対する信頼度を計測した。
オープンウェイトモデル10機は、思考および非思考モードにおける水平方向スタイルの2本腕バンディットトライアルを完了した。
- 参考スコア(独自算出の注目度): 4.628443511523674
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Inference-time thinking improves the performance of large language models, but aggregate outcomes do not reveal whether models use available evidence more effectively or seek information that could improve future decisions. We distinguish these responses by measuring action preference, thinking length, and reported confidence under matched uncertainty. Ten open-weight models completed matched horizon-style two-armed bandit trials in thinking and non-thinking modes. A cognitive model separated value-guided action and uncertainty-independent choice noise from two behavioral signatures of exploration: a UCB-like preference for the less-known arm and Thompson-like choice variability that increases with total uncertainty. On average, thinking strengthened value-guided action and reduced uncertainty-independent choice noise, without producing UCB-like exploration or strengthening Thompson-like exploration. Outside action, the information-imbalanced history condition, which also displayed more observations than the matched balanced condition, was associated with greater thinking length. Reported confidence became more sensitive to decision difficulty and more strongly associated with chosen task evidence. We interpret these thinking-length and reported-confidence patterns as consistent with metacognitive control and metacognitive monitoring, respectively, without establishing either process. Decoder sweeps, especially temperature, altered choice noise and thinking length but did not reproduce the joint cross-output pattern. In this controlled decision setting, thinking improved how models acted on current evidence, while neither measured signature supported a shift toward a more information-seeking policy.
- Abstract(参考訳): 推論時思考は、大きな言語モデルの性能を向上させるが、総合的な結果は、モデルがより効果的に利用可能な証拠を使用するか、将来の決定を改善する可能性のある情報を求めるかどうかを明らかにしない。
本研究では,行動選好,思考長,信頼度を一致しない不確実性の下で測定することで,これらの応答を識別する。
オープンウェイトモデル10機は、思考および非思考モードにおける水平方向スタイルの2本腕バンディットトライアルを完了した。
認知モデルは、価値誘導行動と不確実性に依存しない選択ノイズを、探索の2つの行動的シグネチャから分離した。
平均的な思考は, UCBのような探索やトンプソンのような探索を行なわずに, 価値誘導行動を強化し, 不確実性に依存しない選択ノイズを低減した。
行動の外では、一致したバランス状態よりも多くの観測結果を示した情報不均衡履歴条件は、思考長の増大と関連していた。
報告された信頼感は、決定の困難に対してより敏感になり、選択されたタスク証拠と強く結びついた。
いずれのプロセスも確立することなく,これらの思考長および報告信頼パターンを,メタ認知制御およびメタ認知モニタリングと一致していると解釈する。
デコーダは、特に温度、選択ノイズと思考長を変化させるが、共同出力パターンを再現しなかった。
この制御された決定設定では、モデルが現在の証拠に対してどのように振る舞うかを思考が改善したが、計測されたシグネチャはどちらも、より情報を求めるポリシーへのシフトを支持しなかった。
関連論文リスト
- The Computational Basis of Confidence in Large Language Models [2.8220151940446425]
統計的決定信頼度を用いて言語モデルにおける信頼度を研究する。
回答ロジットは、潜在決定変数の単調な読み出しとして振る舞うことを示す。
これらの結果は、SDCを生物学的および人工知能の信頼性を研究するための統一的な枠組みとして確立している。
論文 参考訳(メタデータ) (2026-07-14T07:24:32Z) - Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning [63.24624171679711]
大規模言語モデル(LLM)ベースのエージェントは、しばしば最適なツール使用の決定を行う。
本研究では、不確実性分離を維持するための推進力として、不確実性定量化を報酬設計に組み込んだTRUSTを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:08:34Z) - Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty [3.070121019787871]
大規模言語モデルの不確実性が人間の不確実性にどの程度類似しているかという未解明の問題について検討する。
モデルが様々なデータセット上で同時アライメントとキャリブレーションの証拠を示すかどうかを同定する。
論文 参考訳(メタデータ) (2026-05-29T00:08:59Z) - LLMs Show No Signs Of Individuated Metacognition [0.023227405857540805]
20大言語モデルから二項信頼判断を分解する。
信頼性が異なる2つのモデルも性能が異なるかどうかを問う。
いずれの検査領域においても,有意な弁別メタ認知の証拠は見つからない。
論文 参考訳(メタデータ) (2026-05-22T23:54:33Z) - Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models [54.041320081289996]
音声対応大言語モデル(ALLM)における不確実性推定に関する最初の系統的研究について述べる。
予測エントロピー、長さ正規化エントロピー、意味エントロピー、個別意味エントロピー、P(True)を含む5つの代表的な手法をベンチマークする。
まず、意味レベルと検証ベースの手法は、一般的な音声推論ベンチマークにおけるトークンレベルベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-28T12:56:22Z) - Are LLM Decisions Faithful to Verbal Confidence? [15.666596480779104]
本稿では,モデルが種々のエラー罰に応答して,禁忌ポリシーを調整するかどうかを評価するためのフレームワークを提案する。
いくつかのフロンティアモデルに対する我々の評価は、モデルが言語的信頼を表現する際にはコストを意識せず、また、関与するかどうかを判断する際には戦略的に応答しない、という重大な解離を明らかにしている。
これは、格付けされた言語的信頼スコアが、信頼できる、解釈可能なAIシステムを作るのに十分でないことを示唆している。
論文 参考訳(メタデータ) (2026-01-12T17:49:51Z) - LoGU: Long-form Generation with Uncertainty Expressions [49.76417603761989]
不確実性を伴う長文生成(LoGU)の課題について紹介する。
不確実性抑制と不確実性誤認の2つの主要な課題を特定します。
当社のフレームワークでは,原子的クレームに基づく不確実性を改善するため,分割・分散戦略を採用している。
提案手法が精度を向上し,幻覚を低減し,応答の包括性を維持できることを示す。
論文 参考訳(メタデータ) (2024-10-18T09:15:35Z) - Uncertainty Estimation of Large Language Models in Medical Question Answering [60.72223137560633]
大規模言語モデル(LLM)は、医療における自然言語生成の約束を示すが、事実的に誤った情報を幻覚させるリスクがある。
医学的問合せデータセットのモデルサイズが異なる人気不確実性推定(UE)手法をベンチマークする。
以上の結果から,本領域における現在のアプローチは,医療応用におけるUEの課題を浮き彫りにしている。
論文 参考訳(メタデータ) (2024-07-11T16:51:33Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z) - Dense Uncertainty Estimation via an Ensemble-based Conditional Latent
Variable Model [68.34559610536614]
我々は、アレータリック不確実性はデータの固有の特性であり、偏見のないオラクルモデルでのみ正確に推定できると論じる。
そこで本研究では,軌道不確実性推定のためのオラクルモデルを近似するために,列車時の新しいサンプリングと選択戦略を提案する。
以上の結果から,提案手法は精度の高い決定論的結果と確実な不確実性推定の両方を達成できることが示唆された。
論文 参考訳(メタデータ) (2021-11-22T08:54:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。