論文の概要: IDEA: An Interpretable and Editable Decision-Making Framework for LLMs via Verbal-to-Numeric Calibration
- arxiv url: http://arxiv.org/abs/2604.12573v1
- Date: Tue, 14 Apr 2026 10:50:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.400278
- Title: IDEA: An Interpretable and Editable Decision-Making Framework for LLMs via Verbal-to-Numeric Calibration
- Title(参考訳): IDEA: Verbal-to-NumericキャリブレーションによるLLMの解釈可能かつ編集可能な意思決定フレームワーク
- Authors: Yanji He, Yuxin Jiang, Yiwen Wu, Bo Huang, Jiaheng Wei, Wei Wang,
- Abstract要約: IDEAはLLM決定知識を解釈可能なパラメトリックモデルに抽出するフレームワークである。
定量的な人間とAIのコラボレーションを可能にしながら、キャリブレーションされた確率を生成する。
- 参考スコア(独自算出の注目度): 19.137433878125247
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models are increasingly deployed for decision-making, yet their adoption in high-stakes domains remains limited by miscalibrated probabilities, unfaithful explanations, and inability to incorporate expert knowledge precisely. We propose IDEA, a framework that extracts LLM decision knowledge into an interpretable parametric model over semantically meaningful factors. Through joint learning of verbal-to-numerical mappings and decision parameters via EM, correlated sampling that preserves factor dependencies, and direct parameter editing with mathematical guarantees, IDEA produces calibrated probabilities while enabling quantitative human-AI collaboration. Experiments across five datasets show IDEA with Qwen-3-32B (78.6%) outperforms DeepSeek R1 (68.1%) and GPT-5.2 (77.9%), achieving perfect factor exclusion and exact calibration -- precision unattainable through prompting alone. The implementation is publicly available at https://github.com/leonbig/IDEA.
- Abstract(参考訳): 大規模言語モデルは意思決定のためにますますデプロイされているが、高い領域での採用は、誤解された確率、不誠実な説明、専門家の知識を正確に組み込むことができないことによって制限されている。
本稿では,LLM決定知識を意味論的に意味のある因子に対して解釈可能なパラメトリックモデルに抽出するフレームワークであるIDEAを提案する。
言語と数字のマッピングとEMによる決定パラメータの連成学習、因子依存性を保存する相関サンプリング、数学的保証による直接パラメータ編集を通じて、IDEAは定量的な人間とAIの協調を可能にしながら、校正された確率を生成する。
5つのデータセットにわたる実験では、Qwen-3-32B (78.6%) がDeepSeek R1 (68.1%) と GPT-5.2 (77.9%) を上回り、完全な因子排除と正確な校正を達成した。
実装はhttps://github.com/leonbig/IDEA.comで公開されている。
関連論文リスト
- I Know What I Don't Know: Latent Posterior Factor Models for Multi-Evidence Probabilistic Reasoning [0.0]
本稿では,遅延後続因子 (LPF) をSum-Product Network (SPN) 推論のソフトな可能性因子に変換するフレームワークとして紹介する。
LPF を LPF-SPN (structured Factor-based inference) と LPF-Learned (end-to-end learned aggregate) とみなす。
8つのドメイン(7つの合成およびFEVERベンチマーク)で、LPF-SPNは高い精度(最大97.8%)、低い校正誤差(ECE 1.4%)、強い確率適合を達成する。
論文 参考訳(メタデータ) (2026-03-13T10:05:14Z) - From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code [0.0]
大規模言語モデル(LLM)は、高い意思決定にますます使われている。
ブラックボックスモデルはそれらの推論を曖昧にし、最近のLCMベースのルールシステムはサンプル単位の評価に依存している。
我々は,LLMをインスタンスごとの評価器ではなくコードジェネレータとして再フレーミングすることを提案する。
論文 参考訳(メタデータ) (2026-02-28T00:27:29Z) - Reasoning with Confidence: Efficient Verification of LLM Reasoning Steps via Uncertainty Heads [104.9566359759396]
データ駆動の不確実性スコアに基づくステップレベルの推論検証の軽量な代替案を提案する。
本研究は, LLMの内部状態が不確実性を符号化し, 信頼性の高い検証信号として機能することが示唆された。
論文 参考訳(メタデータ) (2025-11-09T03:38:29Z) - Reasoning-Based AI for Startup Evaluation (R.A.I.S.E.): A Memory-Augmented, Multi-Step Decision Framework [0.0]
本稿では,意思決定ツリーの解釈可能性と大規模言語モデル(LLM)の高度な推論能力のギャップを埋めて,スタートアップの成功を予測する新しいフレームワークを提案する。
我々の手法はチェーン・オブ・ソート・プロンプトを利用して詳細な推論ログを生成し、その後、構造化された人間の理解可能な論理ルールに蒸留する。
我々の手法は、従来の意思決定プロセスを強化するだけでなく、専門家の介入や継続的な政策改善を促進する。
論文 参考訳(メタデータ) (2025-04-16T13:53:42Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - Variable Importance Matching for Causal Inference [73.25504313552516]
これらの目標を達成するためのModel-to-Matchと呼ばれる一般的なフレームワークについて説明する。
Model-to-Matchは、距離メートル法を構築するために変数重要度測定を使用する。
LASSO を用いて Model-to-Match フレームワークを運用する。
論文 参考訳(メタデータ) (2023-02-23T00:43:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。