論文の概要: Evidence-Gated LLM Priors for Multi-Objective Bayesian Optimization
- arxiv url: http://arxiv.org/abs/2606.01730v1
- Date: Mon, 01 Jun 2026 05:50:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:31.400841
- Title: Evidence-Gated LLM Priors for Multi-Objective Bayesian Optimization
- Title(参考訳): Evidence-Gated LLM Priors for Multi-Objective Bayesian Optimization
- Abstract要約: 大規模言語モデル (LLM) はブラックボックス最適化のアドバイザとしてますます使われているが、その提案と自己報告された自信は、必ずしも下流の客観的値に調整されるとは限らない。
離散多目的ベイズ最適化において, LLM 生成した専門家を盲目的に信頼せずに利用する方法について検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used as heuristic advisors for black-box optimization, yet their suggestions and self-reported confidence are not necessarily calibrated to downstream objective values. This issue becomes more pronounced in multi-objective Bayesian optimization, where different objectives may require different expert knowledge and where an LLM expert can be useful for one objective but misleading for another. We study how to use LLM-generated expert priors in discrete multi-objective Bayesian optimization without blindly trusting them. We propose an objective-wise reputation-market mechanism that treats each expert-objective pair as a falsifiable prior source. Expert weights are updated online from observed objective feedback, discounted over time, and gated by market-level trust. We then introduce a decoupled counterfactual gate that can use the LLM prior without confidence, use it with confidence, or abstain from the LLM prior entirely. Across controlled synthetic stress tests and three molecule optimization benchmarks with \qwenflash{}-generated expert priors, we find that dynamic objective-wise calibration improves robustness over fixed LLM priors. However, raw LLM confidence is not reliably beneficial: on ESOL, confidence is positively correlated with prediction error; on FreeSolv, confidence can help; and on Lipophilicity, ignoring confidence remains strongest. Our fixed three-arm counterfactual gate improves over the first counterfactual variant on ESOL and FreeSolv, while an attempted margin portfolio exposes a useful negative result: margin selection should be acquisition-aware rather than based only on one-step prior error.
- Abstract(参考訳): 大規模言語モデル (LLM) はブラックボックス最適化のヒューリスティックアドバイザとしてますます使われているが、その提案と自己報告された自信は、必ずしも下流の客観的値に調整されるとは限らない。
この問題は多目的ベイズ最適化においてより顕著になり、異なる目的が異なる専門家の知識を必要とする場合と、LLMの専門家が一つの目的に有用であるが別の目的に誤解をもたらす場合である。
離散多目的ベイズ最適化において, LLM 生成した専門家を盲目的に信頼せずに利用する方法について検討した。
本稿では、各専門家と客観的なペアを偽造可能な事前情報源として扱う客観的評価市場機構を提案する。
専門家の重みは、観察された客観的フィードバックからオンラインで更新され、時間の経過とともに割引され、市場レベルの信頼によって強制される。
次に,LLM を信頼せずに,信頼を持って使用したり,信頼を持って使用したり,あるいは LLM を完全に排除したりできる非結合の対物ゲートを導入する。
制御された合成応力試験と,\qwenflash{} 生成したエキスパート前駆体を用いた3分子最適化ベンチマークにより,動的主観的キャリブレーションが固定LDM前駆体よりも堅牢性を向上させることが判明した。
ESOLでは、信頼は予測エラーと肯定的に相関し、FreeSolvでは、信頼は役立つ。
固定された3腕対物ゲートはESOLとFreeSolvの最初の対物変種よりも改善され、一方、試用されたマージンポートフォリオは有用なネガティブな結果を示している。
関連論文リスト
- Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models [11.878003218072765]
MLLM(Multimodal Large Language Models)は、様々な知覚や推論タスクにおいて例外的な機能を示す。
二重チャネル信号とチャネル間の整合性を融合して正当性を推定するモノトーン信頼融合フレームワークを提案する。
各種オープンソースおよびクローズドソースMLLMの実験結果から,本手法は信頼性の高い推定値が得られることがわかった。
論文 参考訳(メタデータ) (2026-04-19T06:07:39Z) - Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation [47.91529693614168]
既存の方法は、主に回答ファーストであり、回答を生成した後のみ信頼を生み出す。
モデルが答える前に信頼を出力する信頼第一パラダイムについて検討し、このスコアを正解する確率として解釈する。
我々は,信頼度校正と正解精度をセグメント化された信用代入を通じて協調的に最適化する強化学習フレームワークであるCoCAを提案する。
論文 参考訳(メタデータ) (2026-03-06T04:03:13Z) - Reasoning with Confidence: Efficient Verification of LLM Reasoning Steps via Uncertainty Heads [104.9566359759396]
データ駆動の不確実性スコアに基づくステップレベルの推論検証の軽量な代替案を提案する。
本研究は, LLMの内部状態が不確実性を符号化し, 信頼性の高い検証信号として機能することが示唆された。
論文 参考訳(メタデータ) (2025-11-09T03:38:29Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator [20.81467363927836]
ポストトレーニングされた言語モデル(PoLM)は、しばしば過剰な自信に悩まされ、正しい出力と間違った出力の両方に高い信頼を割り当てる。
PoLMの校正における大きな障害は、個々の下流タスクのためのラベル付きデータの不足である。
本稿では,時間後信頼度校正におけるパラメータを最適化するために,DACA(Disagreement-Aware Confidence Alignment)を提案する。
論文 参考訳(メタデータ) (2025-05-22T13:55:39Z) - Aligning Large Language Models for Faithful Integrity Against Opposing Argument [71.33552795870544]
大規模言語モデル(LLM)は複雑な推論タスクにおいて印象的な機能を示している。
原文が正しい場合でも、会話中に不誠実な議論によって容易に誤解される。
本稿では,信頼度と信頼度を両立させる新しい枠組みを提案する。
論文 参考訳(メタデータ) (2025-01-02T16:38:21Z) - Calibrating Large Language Models Using Their Generations Only [44.26441565763495]
APRICOT は、信頼目標を設定し、テキスト入力と出力のみに基づいて LLM の信頼度を予測する追加モデルを訓練する手法である。
概念的には単純で、出力以上のターゲットモデルへのアクセスを必要とせず、言語生成に干渉せず、多くの潜在的な使用法を持っている。
閉書質問応答における白箱と黒箱のLCMの校正誤差を考慮し,誤ったLCMの解答を検出する方法として,本手法の競合性を示す。
論文 参考訳(メタデータ) (2024-03-09T17:46:24Z) - TrustLLM: Trustworthiness in Large Language Models [446.5640421311468]
本稿では,大規模言語モデル(LLM)における信頼度に関する総合的研究であるTrustLLMを紹介する。
まず、8つの異なる次元にまたがる信頼性の高いLCMの原則を提案する。
これらの原則に基づいて、真理性、安全性、公正性、堅牢性、プライバシ、機械倫理を含む6つの次元にわたるベンチマークを確立します。
論文 参考訳(メタデータ) (2024-01-10T22:07:21Z) - Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs [60.61002524947733]
従来の信頼性推論手法は、内部モデル情報やモデル微調整へのホワイトボックスアクセスに依存していた。
これにより、不確実性推定のためのブラックボックスアプローチの未解決領域を探索する必要性が高まっている。
言語的信頼を導き出すための戦略の推進、複数の応答を生成するためのサンプリング方法、一貫性を計算するための集約手法の3つの要素からなる体系的フレームワークを定義する。
論文 参考訳(メタデータ) (2023-06-22T17:31:44Z) - Generating with Confidence: Uncertainty Quantification for Black-box Large Language Models [37.63939774027709]
自然言語生成(NLG)に特化した大規模言語モデル(LLM)が,最近,有望な機能を示すようになった。
我々は、信頼できない結果が無視されるか、さらなる評価のために得られるような、選択的なNLG*に適用し、いくつかの信頼/不確実性対策を提案し、比較する。
その結果, セマンティックな分散の簡易な測定は, LLM応答の質の信頼性を予測できることがわかった。
論文 参考訳(メタデータ) (2023-05-30T16:31:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。