論文の概要: LLM2Jev: LLMs Are Already Jev-Style Decision Models -- When and How to Fine-Tune Them
- arxiv url: http://arxiv.org/abs/2610.02076v1
- Date: Thu, 01 Oct 2026 17:15:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.324407
- Title: LLM2Jev: LLMs Are Already Jev-Style Decision Models -- When and How to Fine-Tune Them
- Title(参考訳): LLM2Jev:LLMはすでにJevスタイルの意思決定モデルです。いつ、どのように微調整するか
- Abstract要約: Jevスタイルの決定モデルは、自由形式のテキストを生成することなく、事前定義されたオプションよりもカテゴリー的な確率分布を返す。
LLM2Jevは、括弧付き数値識別子の次点確率から直接キャリブレーションされた決定を抽出するアーキテクチャ保存フレームワークである。
- 参考スコア(独自算出の注目度): 1.818512316929965
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Jev-style decision models return categorical probability distributions over predefined options without generating free-form text, enabling software systems to act on their outputs directly. In this work, we investigate the extent to which general-purpose LLMs already possess this capability out of the box, and when fine-tuning is actually necessary. We present LLM2Jev, an architecture-preserving framework that extracts calibrated decisions directly from next-token probabilities over bracketed numeric identifiers. LLM2Jev provides both a training-free inference recipe and a fine-tuning objective that optimizes candidate selection via a tree-factorized listwise loss while anchoring auxiliary predictions to the base model using KL divergence penalties. Evaluating on Qwen3.5-4B and Qwen3-0.6B, we find that modern LLMs are inherently effective decision models: without training, the 4B model matches community Jev-style models built on the same backbone, outperforms letter-logit readouts, supports arbitrary option counts, and natively handles multimodal decisions over images. Fine-tuning provides targeted rather than universal benefits -- substantially improving weaker models and specific tasks (such as many-option intent routing), but offering diminishing returns for strong backbones. Crucially, our KL anchors prevent behavioral degradation in conversational text generation, with LoRA delivering the strongest performance on capable models.
- Abstract(参考訳): Jevスタイルの決定モデルは、フリーフォームのテキストを生成することなく、事前に定義されたオプションよりもカテゴリ的な確率分布を返す。
本研究は, 汎用LLMが既にこの能力を持っている範囲と, 実際に微調整が必要な時期について検討する。
LLM2Jevは、括弧付き数値識別子の次点確率から直接キャリブレーションされた決定を抽出するアーキテクチャ保存フレームワークである。
LLM2Jevは、トレーニング不要な推論レシピと、KLの発散によるベースモデルに補助的な予測を固定しつつ、ツリーファクトリ化されたリストワイズ損失による候補選択を最適化する微調整目的の両方を提供する。
Qwen3.5-4B と Qwen3-0.6B に基づいて評価すると、現代の LLM は本質的に効果的な決定モデルであることがわかった。
ファインチューニングは、普遍的なメリットよりもターゲットを提供する -- より弱いモデルや特定のタスク(多目的のインテントルーティングなど)を大幅に改善するが、強力なバックボーンに対するリターンの低下を提供する。
重要なことは、我々のKLアンカーは会話テキスト生成の動作劣化を防ぎ、LoRAは有能なモデル上で最高のパフォーマンスを提供する。
関連論文リスト
- Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities [0.0]
大規模言語モデル(LLM)は様々な分野をサポートするために広く使われているが、その選択肢モデリングの可能性はいまだに解明されていない。
本研究は, LLMの仕様における補助エージェントとしての可能性を検討するとともに, 技術的に実現可能なマルチノードロジットモデルの推定を行う。
論文 参考訳(メタデータ) (2025-07-29T13:24:44Z) - PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training [9.093854840532062]
PITAはLLMのトークン生成に直接好みフィードバックを統合する新しいフレームワークである。
PITAは、微調整をせずに、推論時にトークン確率を変更するための、小さな嗜好に基づくガイダンスポリシーを学習する。
我々は,数学的推論や感情分類など,多種多様なタスクにまたがるPITAを評価する。
論文 参考訳(メタデータ) (2025-07-26T21:46:32Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - DALD: Improving Logits-based Detector without Logits from Black-box LLMs [56.234109491884126]
大規模言語モデル(LLM)はテキスト生成に革命をもたらし、人間の文章を忠実に模倣する出力を生成する。
我々は、ブラックボックステキスト検出における最先端性能を再定義する革新的なフレームワークであるDLD(Dis Distribution-Aligned LLMs Detection)を提案する。
DALDは、サロゲートモデルの分布を未知の目標LLMの分布と整合させ、高速モデルの反復に対する検出能力とレジリエンスを向上するように設計されている。
論文 参考訳(メタデータ) (2024-06-07T19:38:05Z) - Aligning Large Language Models via Fine-grained Supervision [20.35000061196631]
事前訓練された大規模言語モデル(LLM)は、一貫性のある記事を生成するのに優れていますが、そのアウトプットは非現実的、有毒、あるいはユーザの期待に沿わないかもしれません。
現在のアプローチは、モデルアライメントを改善するために、人間のフィードバックによる強化学習を使うことに重点を置いている。
トークンレベルの微粒化によるLCMアライメント向上手法を提案する。
論文 参考訳(メタデータ) (2024-06-04T20:21:45Z) - Self-Exploring Language Models: Active Preference Elicitation for Online Alignment [88.56809269990625]
本研究では, 分布域外領域を積極的に探索するために, 潜在的に高次応答に対して楽観的に偏りを呈する2段階的客観性を提案する。
実験の結果,Zephyr-7B-SFTとLlama-3-8B-Instructモデルで微調整した場合,SELM(Self-Exploring Language Models)は命令追従ベンチマークの性能を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-05-29T17:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。