論文の概要: Bayesian Fine-tuning Yields Language Models that are as Bayesian as their Beliefs Allow
- arxiv url: http://arxiv.org/abs/2610.00679v1
- Date: Wed, 30 Sep 2026 20:16:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.755931
- Title: Bayesian Fine-tuning Yields Language Models that are as Bayesian as their Beliefs Allow
- Title(参考訳): バイーシアン・ファインチューニングの収量モデル : バイーシアンとして信仰される言語モデル
- Abstract要約: 言語モデル(LM)は、いくつかの観測結果から隠れた変数の推論を必要とするタスクにますます使われており、ベイズ推論は規範的に正しい解である。
ベイズ訓練されたLMがベイズの支配を中間層にエンコードし、その推奨のためにエンコードされた信念をある程度利用していることを示す。
オラクルで訓練されたLMは、それが持つ信念と、それが信条をレコメンデーションに読み出すかどうかの両方で異なる。
- 参考スコア(独自算出の注目度): 19.97122990968814
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models (LMs) are increasingly used for tasks that require reasoning about hidden variables from a few observations, for which Bayesian inference is the normatively correct solution. While supervised fine-tuning of an LM on the outputs of an optimal $\textit{Bayesian}$ model leads to near-Bayesian behavior, standard supervised fine-tuning (SFT) on the true answers for the task falls short of it. But behavior alone does not tell us $\textit{why}$ tuning on a $\textit{Bayesian}$ or an $\textit{oracle}$ (true answers) signal differs: whether the resulting LM represents Bayesian beliefs, acts on them, or turns them into a choice the way Bayes' rule does. To compare them, we formulate increasingly demanding requirements for an LM to count as a Bayesian decision maker, spanning its behavior, representations, and computations, and test them on a flight recommendation task. The Bayes-trained LM acts Bayesian, encodes quantities of Bayes' rule in its middle layers, and uses the encoded belief for the recommendation to a certain extent. The oracle-trained LM differs from it both in the beliefs it holds and whether it reads beliefs out into recommendations. Exchanging beliefs between the LMs transfers a part of the Bayesian advantage. Bayes fine-tuning thus installs usable Bayesian beliefs in an LM for reasoning under uncertainty in a way standard SFT on oracle answers cannot, highlighting the advantage of nuanced supervision.
- Abstract(参考訳): 言語モデル(LM)は、いくつかの観測結果から隠れた変数の推論を必要とするタスクにますます使われており、ベイズ推論は規範的に正しい解である。
最適$\textit{Bayesian}$モデルの出力に対するLMの教師付き微調整は、ほぼベイズ的挙動をもたらすが、タスクの真の答えに関する標準教師付き微調整(SFT)はそれより劣る。
しかし、振舞いだけでは、$\textit{why}$ tuning on a $\textit{Bayesian}$ or a $\textit{oracle}$ (true answer)シグナルは、異なる。
それらを比較するために、我々は、LMがベイズ的な意思決定者として数えられるように要求される要求を増大させ、その振る舞い、表現、計算を網羅し、フライトレコメンデーションタスクでそれらをテストする。
ベイズを訓練したLMはベイズ的であり、ベイズの規則をその中間層にエンコードし、ある程度の推奨のためにエンコードされた信念を使用する。
オラクルで訓練されたLMは、それが持つ信念と、それが信条を推薦に読み出すかどうかの両方で異なる。
LM間の信念の交換はベイズ的優位性の一部を伝達する。
ベイズによる微調整により、不確実性の下でのSFTにおける標準回答が不可能な方法での推論のために、使用可能なベイズ的信念をLMにインストールし、ニュアンス化された監督の利点を浮き彫りにする。
関連論文リスト
- Bayesian learning for the stochastic shortest path problem [7.552707920682579]
我々は最適な意思決定戦略を学ぶためのベイズ的枠組みを開発する。
非現実的なモデリング仮定やアドホック近似には依存していません。
私たちは、我々のフレームワークが不確実性を忠実に定量化していることを示します。
論文 参考訳(メタデータ) (2026-06-03T13:13:41Z) - Reason-to-Recommend: Using Interaction-of-Thought Reasoning to Enhance LLM Recommendation [9.282278040339138]
$textbfR2Rec$は推論強化レコメンデーションフレームワークである。
ユーザアイコングラフからインタラクションチェーンをサンプリングし、それらを構造化されたインタラクション・オブ・思想に変換する。
論文 参考訳(メタデータ) (2025-06-05T14:16:44Z) - Enough Coin Flips Can Make LLMs Act Bayesian [71.79085204454039]
大規模言語モデル(LLMs)は、入力プロンプトで与えられた少数ショットの例を一般化する能力を示しており、これはICL(In-context Learning)として知られる創発的能力である。
LLM が ICL を用いて,ベイズフレームワークと整合性のある構造的推論を行うか,パターンマッチングに依存するかを検討する。
論文 参考訳(メタデータ) (2025-03-06T18:59:23Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。