論文の概要: DZ-TDPO: Non-Destructive Temporal Alignment for Mutable State Tracking in Long-Context Dialogue
- arxiv url: http://arxiv.org/abs/2512.03704v2
- Date: Mon, 08 Dec 2025 16:26:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-09 15:54:52.342634
- Title: DZ-TDPO: Non-Destructive Temporal Alignment for Mutable State Tracking in Long-Context Dialogue
- Title(参考訳): DZ-TDPO:長期対話における可変状態追跡のための非破壊的時間アライメント
- Abstract要約: DZ-TDPOは、コンフリクト対応動的KL制約と時間的注意バイアスを調整した非破壊的アライメントフレームワークである。
Multi-Session Chatデータセットの実験は、DZ-TDPOが最先端の勝利率を達成することを示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context dialogue systems suffer from State Inertia, where static constraints prevent models from resolving conflicts between evolving user intents and established historical context. To address this, we propose DZ-TDPO, a non-destructive alignment framework that synergizes conflict-aware dynamic KL constraints with a calibrated temporal attention bias. Experiments on the Multi-Session Chat (MSC) dataset demonstrate that DZ-TDPO achieves state-of-the-art win rates (55.4% on Phi-3.5) while maintaining robust zero-shot generalization. Our scaling analysis reveals a "Capacity-Stability Trade-off": while smaller models incur an "alignment tax" (perplexity surge) to overcome historical inertia, the larger Qwen2.5-7B model achieves 50.8% win rate with negligible perplexity overhead. This confirms that TAI can be alleviated via precise attention regulation rather than destructive weight updates, preserving general capabilities (MMLU) across model scales. Code and data are available: https://github.com/lyj20071013/DZ-TDPO
- Abstract(参考訳): 長いコンテキストの対話システムは状態慣性に悩まされ、静的な制約は、進化するユーザの意図と確立された歴史的文脈の間の衝突をモデルが解決するのを防ぐ。
そこで本稿では,DZ-TDPOを提案する。DZ-TDPOは,コンフリクトを意識した動的KL制約と時間的注意バイアスの校正を併用する非破壊的アライメントフレームワークである。
マルチセッションチャット(MSC)データセットの実験では、DZ-TDPOが安定なゼロショットの一般化を維持しつつ、最先端の勝利率(Phi-3.5では55.4%)を達成することを示した。
より小さなモデルでは、歴史的慣性(英語版)を克服するために「調整税(perplexity surge)」が生じるが、大きなQwen2.5-7Bモデルは、無視できるパープレキシティオーバーヘッドで50.8%の勝利率を達成する。
このことは、TAIが破壊的な重量更新よりも正確な注意制御によって緩和され、モデルスケール全体にわたって一般能力(MMLU)が保たれることを確認している。
コードとデータは、https://github.com/lyj20071013/DZ-TDPO
関連論文リスト
- DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models [16.097057987606714]
textbfDecoupled textbfUpdate textbfDynamics textbf(DUD)を導入する。
各モジュールの独立復元能力を定量化することにより、モデルの内部の不安定性を捉えるデュアルストリーム動的プロファイルを構築する。
論文 参考訳(メタデータ) (2026-08-04T10:04:33Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - TS-Fault: Benchmarking Time Series Forecasters Against Structural Faults [22.88447833683736]
時系列予測(TSF)は、エネルギー、輸送、金融、医療の連続的な決定を支えている。
TSFモデルは、デプロイされた信頼性を予測するという暗黙の仮定の下で、クリーンなホールトアウトデータ上の1つの数でほぼ普遍的にランク付けされる。
TS-Faultは、制御可能な意味的難易度を持つ明示的でパラメータ化された障害シナリオの下で予測モデルを評価するベンチマークである。
論文 参考訳(メタデータ) (2026-06-16T23:15:20Z) - Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models [21.11973252925284]
大規模な言語モデルは、小さな急激な摂動に敏感である。
既存の堅牢性メソッドは通常、シーケンス全体の一貫性を強制する。
堅牢なLoRAファインチューニングのためのセグメントレベルフレームワークであるS$2$R$2$を紹介する。
論文 参考訳(メタデータ) (2026-05-02T21:12:07Z) - VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model [54.35791816657227]
適応型テスト時間計算でVLAモデルを実現するフレームワークである textbfVLA-ATTC' を導入する。
VLA-ATTCは、不確実性に基づく認知クラッチ'を用いて、反射的実行からTTC熟考フェーズへ動的に移行する。
LIBERO-LONGベンチマークでは、VLA-ATTCはSOTAモデルPI0.5の故障率を50%以上削減する。
論文 参考訳(メタデータ) (2026-05-02T02:13:11Z) - CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention [24.03101162891974]
計画指向のエンドツーエンド駆動モデルは、真の因果関係ではなく統計的相関を学習する。
この脆弱性は因果的混乱を引き起こし、モデルがショートカットとしてデータセットバイアスを利用する。
CausalVADは因果的介入を生かした非融合トレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-03-19T07:21:01Z) - Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction [49.03500737694832]
textbfReinforcement textbfLearning with textbfTurn textbfRLSTA。
実験の結果,RTSTAは標準微調整法や禁忌法よりも有意に優れていた。
論文 参考訳(メタデータ) (2026-03-05T04:04:59Z) - JANUS: Structured Bidirectional Generation for Guaranteed Constraints and Analytical Uncertainty [0.0]
JANUS(Joint Ancestral Network for Uncertainity and Synthesis)は、ベイズ決定木のDAGを用いて機能を統合するフレームワークである。
主な革新はReverse-Topological Back-fillingであり、因果グラフを通して制約を後方に伝播するアルゴリズムである。
Janusは最先端の忠実度(Detection Score 0.497)を実現し、不均衡なデータのモード崩壊を排除し、複雑なカラム間制約を正確に処理する。
論文 参考訳(メタデータ) (2026-03-04T05:36:11Z) - Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling [42.52160764841961]
Threshold Differential Attention (TDA) はシンクレスアテンション機構で、超スパーシビリティを実現し、長いシーケンス長で堅牢性を向上させる。
TDAは縦方向の極値閾値を長さ依存ゲートで適用し、超過しか保持しない。
我々は,TDAが1行あたりの急激なサバイバル数を$O(1)$に制御し,コンテキストが大きくなるにつれてコンセンサスに急激な一致がなくなることを示す。
論文 参考訳(メタデータ) (2026-01-17T19:41:23Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - On the Joint Minimization of Regularization Loss Functions in Deep Variational Bayesian Methods for Attribute-Controlled Symbolic Music Generation [47.38557855930304]
明示的な潜在変数モデルは、データ合成のための柔軟だが強力なフレームワークを提供する。
既存のアプローチは、両方の正規化目標を共同で最小化するのに苦労していることを示す。
適切な属性変換は、目標潜在次元の可制御性と正則化の両方を達成するのに有効であることを示す。
論文 参考訳(メタデータ) (2025-11-10T14:09:25Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Control-Augmented Autoregressive Diffusion for Data Assimilation [17.305296093966803]
本稿では,ARDMを軽量コントローラで拡張するアモールト化フレームワークを提案する。
我々はこの枠組みをカオス偏微分方程式(PDE)に対するデータ同化(DA)の文脈で評価する。
提案手法は,DA推論をオンザフライ修正による単一前方ロールアウトに還元し,推論中に高価な随伴計算や最適化を回避する。
論文 参考訳(メタデータ) (2025-10-08T04:37:32Z) - AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models [62.70575022567081]
本稿では,逆CoTチューニングによる動的自己補正をモデルに教えるアライメントパラダイムであるAdvChainを提案する。
私たちの仕事は、より堅牢で信頼性の高い推論モデルを構築するための新しい方向性を確立します。
論文 参考訳(メタデータ) (2025-09-29T04:27:23Z) - TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning [79.59753528758361]
両足のVLAを促進するために、豊富な車輪付きヒューマノイドデータを活用するクロス・エボディメント・フレームワークであるTrajBoosterを提案する。
私たちのキーとなる考え方は、形態素に依存しないインターフェースとして、エンドエフェクタ・トラジェクトリを使用することです。
以上の結果から,TrajBoosterは既存の車輪付きヒューマノイドデータにより,二足歩行ヒューマノイドVLAの性能を効率的に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-09-15T12:25:39Z) - STDiff: A State Transition Diffusion Framework for Time Series Imputation in Industrial Systems [2.3895981099137535]
そこで本研究では,ある状態から次の状態へシステムがどのように進化するかを学ぶために,命令を書き換えるSTDiffを提案する。
STDiffは低いエラーを継続的に達成し、その利点は長いギャップで増大する。
これらの結果は、産業時系列の堅牢なアプローチとして、動的に認識され、明示的な条件付き計算をサポートする。
論文 参考訳(メタデータ) (2025-08-26T13:14:53Z) - MINGLE: Mixture of Null-Space Gated Low-Rank Experts for Test-Time Continual Model Merging [29.58798660724693]
連続モデルマージは、オリジナルのトレーニングデータにアクセスすることなく、独立して微調整されたモデルを順次統合する。
テスト時間連続モデルマージの新しいフレームワークであるMINGLEを提案する。
MINGLEは堅牢な一般化を実現し、忘れることを大幅に減らし、従来の最先端の手法を平均で7-9%上回っている。
論文 参考訳(メタデータ) (2025-05-17T07:24:22Z) - Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models [86.88657425848547]
大型推論モデル(LRMs)はすでに長い連鎖推論のための潜在能力を持っている。
我々は、自動生成の自己検証タスクを使用して、モデルに推論、帰納、誘拐の3つのメタ能力を持たせることを明確にした。
我々の3つのステージ・パイプラインの個別アライメント、パラメータ空間のマージ、ドメイン固有の強化学習は、命令調整ベースラインと比較して10%以上のパフォーマンス向上を実現します。
論文 参考訳(メタデータ) (2025-05-15T17:58:33Z) - Simple and Effective Prevention of Mode Collapse in Deep One-Class
Classification [93.2334223970488]
深部SVDDにおける超球崩壊を防止するための2つの正則化器を提案する。
第1の正則化器は、標準のクロスエントロピー損失によるランダムノイズの注入に基づいている。
第2の正規化器は、小さすぎるとミニバッチ分散をペナライズする。
論文 参考訳(メタデータ) (2020-01-24T03:44:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。