論文の概要: CALMRec: Causally Aligned Language Memory for Long-Horizon Recommendation
- arxiv url: http://arxiv.org/abs/2607.23647v1
- Date: Sun, 26 Jul 2026 13:28:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.179854
- Title: CALMRec: Causally Aligned Language Memory for Long-Horizon Recommendation
- Title(参考訳): CALMRec: ロングホライズンレコメンデーションのためのCausally Aligned Language Memory
- Abstract要約: 本稿では,ロングホライゾンレコメンデーションのためのモデルに依存しないフレームワークを提案する。
我々は,eコマース,ニュース,ショートビデオのような環境における識別結果を提供し,その枠組みを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) can summarize heterogeneous user evidence in natural language, but current LLM recommenders often collapse enduring preferences, transient intent, and exposure-induced behavior into one profile. This makes recommendation vulnerable to feedback loops: repeated exposure is mistaken for preference, immediate clicks dominate delayed satisfaction, and fluent explanations need not reflect the ranking decision. We propose our method, a model-agnostic framework for long-horizon recommendation. Our method uses a frozen multimodal language model to convert item content and feedback into evidence-grounded semantic atoms, then maintains separate short-term, long-term, and exposure memories. Propensity-weighted updates reduce policy-induced exposure bias, while a conservative offline critic reranks candidates for delayed satisfaction under a behavior-support constraint. Explanations use only influential evidence atoms and are checked by counterfactual deletion. We provide an identification result and evaluate the framework in e-commerce-like, news-like, and short-video-like environments. Across ten seeds, our method improves discounted long-term value over the strongest alternative by 6.1%, 7.6%, and 6.7%, respectively. Twenty-seed paired ablations show significant value drops after removing propensity correction (0.739 +/- 0.191) or conservative support regularization (0.523 +/- 0.234). A frozen instruction language model also more than doubles semantic-atom NDCG over TF-IDF on a held-out paraphrase benchmark.
- Abstract(参考訳): 大規模言語モデル(LLM)は、自然言語における異種ユーザエビデンスを要約することができるが、現在のLLMレコメンデータは、永続的な嗜好、過渡的な意図、露光による振る舞いを1つのプロファイルに分解することが多い。
繰り返し露光が優先事項と間違えられ、即席クリックが遅れた満足度を支配し、流動的な説明がランキング決定を反映する必要はない。
本稿では,長期的推薦のためのモデルに依存しないフレームワークである本手法を提案する。
提案手法では, アイテムの内容とフィードバックをエビデンス基底のセマンティックな原子に変換し, 短期・長期・露光記憶を分離する。
Propensity-weighted updateは、ポリシーによって引き起こされる露出バイアスを減少させる一方、保守的なオフライン評論家は、行動支援の制約の下で、遅れた満足度に関する候補を再選する。
説明では、影響力のある証拠原子のみを使用し、事実上の削除によってチェックされる。
我々は,eコマース,ニュース,ショートビデオのような環境における識別結果を提供し,その枠組みを評価する。
10種中6.1%,7.6%,6.7%の割引値の改善を行った。
20種ペアアブレーションは、正当性補正 (0.739 +/- 0.191) または保守的支持正則化 (0.523 +/- 0.234) の後に有意な値低下を示す。
フリーズインストラクション言語モデルは、保持されたパラフレーズベンチマークでTF-IDF上のセマンティック・アトミック・NDCGを2倍以上に拡張する。
関連論文リスト
- RECAP: Feedback-Driven Streaming Semantic User Profiles for Short-Video Recommendation [74.86562505934961]
言語ベースのユーザプロファイルは、長い行動履歴をレコメンデーションのために明示的な意味表現に変換する。
そこでは,ストリームやプロファイルの更新を限定的に行うことで,ユーザの行動が継続的に到着する,実世界のショートビデオレコメンデーションにおいて,この問題について検討する。
本稿では,ストリーミング構造化されたセマンティックプロファイルを過去のレコメンデーションフィードバックで最適化するためのオフラインクローズドループフレームワークRECAPを提案する。
論文 参考訳(メタデータ) (2026-07-17T08:10:37Z) - CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction [51.56484100374058]
既存のLLM(Large Language Models)のキャリブレーション手法は、しばしば信頼性の重要な次元、すなわちモデルの振舞いの堅牢性を見落としている。
我々は,モデルが注意をそらす可能性を直接測定し,罰する,新しいポストホックキャリブレーション手法であるtextscCaliDistを紹介した。
textscCaliDistは、強いベースラインと比較して、期待の低いエラー(ECE)とBrier Scoreを一貫して達成します。
論文 参考訳(メタデータ) (2026-06-04T07:27:53Z) - Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation [0.0]
DriftBenchは、科学的思考における制約の順守を評価するためのベンチマークである。
繰り返し圧力は構造的複雑さを確実に増加させ、しばしば元の制約への固執を減少させる。
オープンベンチマークとして、すべてのブリーフ、プロンプト、ルックス、書き起こし、スコアをリリースします。
論文 参考訳(メタデータ) (2026-04-30T15:46:33Z) - Stated Preference for Interaction and Continued Engagement (SPICE): Evaluating an LLM's Willingness to Re-engage in Conversation [0.0]
Stated Preference for Interaction and Continued Engagement (SPICE)は、大規模言語モデルにYESまたはNO質問をすることで引き起こされる単純な診断信号である。
10-interactionstimul setによる3-tone(親しみやすい,不明瞭,嫌悪感)を用いた実験では,4つのフレーミング条件で4つのオープンウェイトチャットモデルを検証した。
友好的な相互作用は継続をほぼ一様に好んだ(97.5% YES)が、虐待的相互作用は断念を強く好んだ(17.9% YES)
論文 参考訳(メタデータ) (2025-09-10T22:34:17Z) - Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models [57.474294329887236]
拡散大言語モデル (dLLMs) は反復的 denoising を通じてテキストを生成する。
現在のデコード戦略は、最終的な出力に有利なリッチな中間予測を捨てている。
時間的整合性を利用する2つの相補的手法を導入する。
論文 参考訳(メタデータ) (2025-08-12T17:59:57Z) - Do Language Models Think Consistently? A Study of Value Preferences Across Varying Response Lengths [4.928535836750263]
短い形式のテストから推測される値の選好は、長い形式のアウトプットで表されるものと一致しますか?
短文の反応と長文の反応から得られる値の選好を比較し、後者の引数の数を変えて、ユーザの異なる冗長性選好を捉える。
論文 参考訳(メタデータ) (2025-06-03T05:52:03Z) - An Embarrassingly Simple Defense Against LLM Abliteration Attacks [47.347413305965006]
失語症と呼ばれる最近の攻撃は、拒否行動に最も責任がある唯一の潜伏方向を特定し、抑制する。
本稿では、モデルが拒否を表現する方法を根本的に変える防衛法を提案する。
微調整のLlama-2-7B-ChatとQwen2.5-Instructは、消音下で高い断熱率を維持するモデルを生成する。
論文 参考訳(メタデータ) (2025-05-25T09:18:24Z) - Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models [2.0962367975513496]
機械学習は、特定のトレーニングデータの影響をモデルから効率的に排除することを目的としている。
既存の未学習手法は, 無視集合に関連する応答を抑制するために, 負のフィードバックのみに頼っている。
本稿では,AltPO(Alternate Preference Optimization)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-09-20T13:05:07Z) - Rethinking Missing Data: Aleatoric Uncertainty-Aware Recommendation [59.500347564280204]
本稿では, Aleatoric Uncertainty-aware Recommendation (AUR) フレームワークを提案する。
AURは、新しい不確実性推定器と通常のレコメンデータモデルで構成されている。
誤ラベルの可能性がペアの可能性を反映しているため、AURは不確実性に応じてレコメンデーションを行う。
論文 参考訳(メタデータ) (2022-09-22T04:32:51Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。