論文の概要: BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation
- arxiv url: http://arxiv.org/abs/2606.30850v1
- Date: Mon, 29 Jun 2026 19:30:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.99315
- Title: BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation
- Title(参考訳): BayesBench:マルチTurnエビデンス累積下におけるLLM信念軌道の評価
- Authors: Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel R. Jiang, Yonathan Efroni,
- Abstract要約: 大規模言語モデル(LLM)は通常、マルチターン会話にデプロイされる。
LLMの信念の更新は、マルチターン設定における合理的ベイズ論理の更新とどの程度密接に一致しているかを問う。
ベイズベンチ(BayesBench)は3つの複雑なタスクにまたがってこれを探索するシミュレーション環境である。
- 参考スコア(独自算出の注目度): 20.375742002723765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are typically deployed in multi-turn conversations, where each turn provides new evidence that should reduce epistemic uncertainty about their environment. Acting rationally then requires inferring the unobserved quantities that govern it and updating beliefs about them as evidence accumulates. Yet most evaluations only score the model's final-turn answer in a single-turn format, leaving this process unexamined. We ask how closely LLMs' belief updates match those of a rational Bayesian reasoner in multi-turn settings, and introduce BayesBench, a suite of simulation environments that probe this across three progressively complex tasks: (i) Bayesian estimation, where the model infers an unknown parameter from sequential evidence; (ii) Bayesian prediction, where the model turns inferred beliefs about a latent variable into outcome forecasts; and (iii) latent-framed Bayesian prediction, where observations are filtered through a user-persona framing, requiring joint inference over the latent state and the persona. Across seven LLMs (3B--70B), scaling improves latent inference and evidence accumulation, with updates occasionally matching the Bayesian posterior. However, these gains do not reliably carry over to downstream prediction, exposing a gap between inferring latent structure and using it to rationally update beliefs about the target outcome.
- Abstract(参考訳): 大規模言語モデル(LLM)は、通常マルチターン会話にデプロイされ、各ターンは環境に対する疫学的な不確実性を減少させる新しい証拠を提供する。
合理的に行動するためには、それを統治する観測されていない量を推測し、証拠が蓄積するにつれてそれらに関する信念を更新する必要がある。
しかし、ほとんどの評価は、モデルの最終ターンの回答を1ターンの形式でのみスコアし、このプロセスは未検討のままである。
LLMの信念の更新は、マルチターン設定における合理的なベイズ的推論とどのように一致しているかを問うとともに、3つの段階的に複雑なタスクにまたがってこれを調査するシミュレーション環境であるBayesBenchを紹介します。
一 連続的証拠から未知のパラメータを推定するベイズ推定
2 モデルが潜伏変数に関する推論された信念を結果予測に変換するベイズ予測
三 潜時フレームのベイズ予測で、潜時状態と人格に対する共同推論を必要とするユーザ・ペルソナ・フレーミングを通して観測をフィルタリングする。
7つのLSM(3B--70B)にわたって、スケーリングは潜伏推論と証拠蓄積を改善し、時折ベイズの後部と一致する更新を行う。
しかし、これらの利得は下流の予測に確実に引き継がれず、潜在構造を推測し、目標とする結果に関する信念を合理的に更新するためにそれを使用する。
関連論文リスト
- From Drift to Coherence: Stabilizing Beliefs in LLMs [23.20001878593831]
大型言語モデル (LLM) はしばしば暗黙のベイズ推論を行うと仮定される。
予測的信念のマーチンゲール特性であるキーコヒーレンス条件は、制御された文脈内学習設定で失敗することが示されている。
自己回帰的回答再サンプリングによって引き起こされる信念のダイナミクスについて検討する。
論文 参考訳(メタデータ) (2026-06-16T12:01:26Z) - Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty [70.43119366710778]
本稿では,Agens-BRACE: Agent Belief state Representation by Abstraction and Confidence Estimationを紹介する。
LLMエージェントを信頼状態モデルと政策モデルに分離し、強化学習を通じて協調的に最適化する手法である。
長期にわたる部分的に観察可能な言語環境において、平均して+14.5%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2026-05-12T02:37:04Z) - Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning [47.975618905252354]
マルチモーダルな3次元視覚言語モデルは多種多様な3次元タスクにまたがる強力な一般化を示すが、その性能はドメインシフトで顕著に低下する。
これはテストタイム適応に関する最近の研究を動機付けており、テストタイムデータを使ってモデルをオンラインに適応させることができる。
テストポイントクラウド分析のためのマルチモーダル分散学習フレームワークBayesMMを提案する。
論文 参考訳(メタデータ) (2026-03-23T15:03:47Z) - From Observations to States: Latent Time Series Forecasting [65.98504021691666]
本稿では,TSFを観測回帰から潜時予測に移行する新しいパラダイムであるLatent Time Series Forecasting(LatentTSF)を提案する。
具体的には、LatentTSFはAutoEncoderを使用して、各段階での観測結果を高次元の潜在状態空間に投影する。
提案する潜伏目標は,予測潜伏状態と地道状態と観測値との相互情報を暗黙的に最大化する。
論文 参考訳(メタデータ) (2026-01-30T20:39:44Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective [12.655285605773932]
我々は,トランスフォーマーがモデルサイズ全体にわたって高いあいまいさの予測に苦慮していることを示す。
予備的な結果は、キャパシティアロケーションの改善とテストタイムのスケーラブルな推論を通じて、あいまいな文脈でかなりの増加を示す。
論文 参考訳(メタデータ) (2025-06-19T13:05:12Z) - Confidence Aware Learning for Reliable Face Anti-spoofing [52.23271636362843]
本稿では,その能力境界を意識した信頼認識顔アンチスプーフィングモデルを提案する。
各サンプルの予測中にその信頼性を推定する。
実験の結果,提案したCA-FASは予測精度の低いサンプルを効果的に認識できることがわかった。
論文 参考訳(メタデータ) (2024-11-02T14:29:02Z) - Exchangeable Sequence Models Quantify Uncertainty Over Latent Concepts [6.256239986541708]
事前学習されたシーケンスモデルは、交換可能なデータポイントよりも確率論的推論が可能であることを示す。
シーケンスモデルは、典型的なベイズモデルとは異なる観測間の関係を学習する。
シーケンス予測損失が不確実性定量化の品質を制御することを示す。
論文 参考訳(メタデータ) (2024-08-06T17:16:10Z) - Adversarial robustness of amortized Bayesian inference [3.308743964406687]
償却ベイズ推論は、当初シミュレーションデータ上の推論ネットワークのトレーニングに計算コストを投資することを目的としている。
観測対象のほとんど認識不能な摂動は、予測された後部および非現実的な後部予測標本に劇的な変化をもたらす可能性があることを示す。
本研究では,条件密度推定器のフィッシャー情報をペナライズした計算効率の高い正規化手法を提案する。
論文 参考訳(メタデータ) (2023-05-24T10:18:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。