論文の概要: Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses
- arxiv url: http://arxiv.org/abs/2605.27971v1
- Date: Wed, 27 May 2026 05:05:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.760483
- Title: Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses
- Title(参考訳): セマンティックフロー規則化: LLM に多元的かつ一貫性のある応答を生成することを教える
- Authors: Kerui Peng, Feifei Li, Xingyu Fan, Wenhui Que,
- Abstract要約: 大きな言語モデルがペルソナやトーン条件の応答を生成するように微調整された場合、その出力の多様性は極めて限定的です。
本研究では,セマンティックフロー正規化(Semantic Flow Regularization, SFR)を提案する。
- 参考スコア(独自算出の注目度): 6.956097396264084
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When large language models are fine-tuned to generate persona- or tone-conditioned responses, their output diversity is severely limited--a failure we term Cross-Style Collapse. We trace this collapse to the cross-entropy objective, which under shared representations tends to suppress diverse continuations. We propose Semantic Flow Regularization (SFR), a lightweight auxiliary objective that supervises the backbone with continuous sentence-encoder embeddings of future segments via conditional flow matching. The stochastic flow source preserves multi-modality by construction; the flow-matching head is discarded at inference, adding zero deployment cost. On a large-scale industrial dialogue dataset (Qwen3-32B, 9 personas), SFR improves output diversity, style fidelity, and response quality over SFT. We further validate on the public LiveCodeBench-v5 (Qwen2.5-Coder-7B-Instruct), where SFR consistently improves pass@k, confirming generality beyond stylized dialogue. A controlled comparison on MBPP reveals Multi-Token Prediction to be a degenerate special case of SFR.
- Abstract(参考訳): 大きな言語モデルがペルソナやトーン条件の応答を生成するように微調整された場合、その出力の多様性は極めて限定的です。
この崩壊は、共有表現の下で様々な継続を抑制する傾向にあるクロスエントロピー目的に遡る。
本研究では,セマンティックフロー正規化(Semantic Flow Regularization, SFR)を提案する。
確率的フロー源は、構成によるマルチモダリティを保ち、フローマッチングヘッドは推論時に破棄され、デプロイコストがゼロになる。
大規模産業対話データセット(Qwen3-32B,9ペルソナ)では、SFRは出力の多様性、スタイルの忠実さ、SFTに対する応答品質を改善している。
さらに、パブリックなLiveCodeBench-v5 (Qwen2.5-Coder-7B-Instruct) において、SFRはパス@kを一貫して改善し、スタイリングされた対話以上の一般性を確認する。
MBPPの制御された比較では、SFRの退化特別なケースであるマルチトークン予測が明らかである。
関連論文リスト
- Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention [58.484607892210015]
Diffusion Language Models (DLM) は、グローバルコヒーレント、双方向、および制御可能なテキスト生成を可能にする。
既存の多くのブロックスパースアテンション手法は、高分解能アテンション空間上の固定サンプリングパターンによってブロックを選択する。
本稿では,ブロックワイド事前サンプリング操作によるBA-Att(Block Approximate Sparse Attention framework)を提案する。
論文 参考訳(メタデータ) (2026-05-19T12:01:13Z) - Hybrid Latent Reasoning with Decoupled Policy Optimization [19.348125016748018]
HyLaR(Hybrid Latent Reasoning)は、連続的な視覚的潜在表現を持つ離散テキスト生成をシームレスにインターリーブするフレームワークである。
我々は,HyLaRが細粒度知覚と一般的なマルチモーダル理解ベンチマークにおいて,最先端の潜時推論手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-04-22T08:22:23Z) - Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models [102.20309135516186]
クロスエントロピー(CE)トレーニングは、言語モデルの密集したスケーラブルな監視を提供する。
言語モデル微調整のための特徴マッチング手法を提案する。
この目的を効率的に最適化するために,エネルギーベースファインチューニングを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:57:50Z) - Empowering Contrastive Federated Sequential Recommendation with LLMs [13.016120865205258]
フェデレートシーケンシャルレコメンデーション(FedSeqRec)は、ユーザのデータを分散化しながら、次のイテム予測を実行することを目的としている。
パラメータ分離型FedSeqRecアーキテクチャである textbfLUMOS を提案する。
論文 参考訳(メタデータ) (2026-02-10T00:47:43Z) - Efficient semantic uncertainty quantification in language models via diversity-steered sampling [46.23327887393273]
本稿では,デコード中に意味的に冗長な出力を回避できるダイバーシティステアリング・サンプリング手法を提案する。
主要なアイデアは、モデルの提案分布に連続的な意味-類似性ペナルティを注入することである。
モジュラーであり、ベースLSMへの勾配アクセスを必要としないため、このフレームワークは不確実性評価のためのドロップインエンハンスメントとして機能することを約束している。
論文 参考訳(メタデータ) (2025-10-24T10:06:21Z) - DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation [30.150846119894577]
DISTARはゼロショットのテキスト音声合成フレームワークで、離散的残差ベクトル量子化符号空間で完全に動作する。
DISTARは、堅牢性、自然性、話者/スタイルの整合性において、最先端のゼロショットTSシステムを超えている。
論文 参考訳(メタデータ) (2025-10-14T07:03:29Z) - MARS-Sep: Multimodal-Aligned Reinforced Sound Separation [72.85468563236005]
MARS-Sepは音分離のための強化学習フレームワークである。
クリッピングされた信頼領域サロゲートによって最適化された、ファクタライズされたベータマスクポリシを学ぶ。
複数のベンチマークの実験は、テキスト、オーディオ、イメージ-キュード分離において一貫した利得を示している。
論文 参考訳(メタデータ) (2025-10-12T09:05:28Z) - SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment [49.86376148975563]
大規模言語モデル(LLM)は、様々なタスクを理解し実行する能力を通じて自然言語処理に革命をもたらした。
教師付き微調整、特にRetrieval-Augmented Generation (RAG)のシナリオでは、しばしば破滅的な忘れが生じる。
本稿では,モデルのセマンティック分布を保存するために,入力シーケンスロジットをアライメントする自己分布アライメント手法であるSelfAugを提案する。
論文 参考訳(メタデータ) (2025-09-04T06:50:47Z) - Autoregressive Speech Synthesis without Vector Quantization [135.4776759536272]
We present MELLE, a novel continuous-valued token based language modeling approach for text-to-speech synthesis (TTS)。
MELLEはテキスト条件から直接連続メル-スペクトログラムフレームを自動回帰生成する。
MELLEは、サンプリングベクトル量子化符号の固有の欠陥を回避し、ロバスト性問題を緩和する。
論文 参考訳(メタデータ) (2024-07-11T14:36:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。