論文の概要: DREAM Technical Report
- arxiv url: http://arxiv.org/abs/2608.09408v2
- Date: Tue, 11 Aug 2026 09:30:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.725444
- Title: DREAM Technical Report
- Title(参考訳): DREAM技術報告
- Abstract要約: DREAMは、既存のパイプラインの上に認識認識、オーケストレーション、監査可能なポリシ層を追加し、それを置き換えることなく、自律的な最適化制御アーキテクチャである。
DREAMには2つのコアコンポーネントがある。まず、3層Intent Engineはデバイス上の信号を構造化されたL0/L1/L2インテント表現に融合する。エッジクラウドトリガーチェーンはレポートのボリュームを約8.7%に削減する。
第2に、Meta EngineはMetaModelを使って、層状M1-to-M2-to-M3推論(インテントの要約、ストラテジーメモリに通知されるストラテジープランニング、パラメータ変換など)を定式化したM1-to-M2-to-M3推論に使用します。
- 参考スコア(独自算出の注目度): 53.37525197047151
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Industrial recommender systems commonly use cascaded retrieval, ranking, and re-ranking pipelines. Although efficient, these pipelines fragment information and objectives across modules, rely on rigid rules, and have limited awareness of real-time intent, leaving session-level shifts among browsing, comparison, and purchase insufficiently addressed. We present DREAM (Developing Recommender Engine with Agentic Methods), an autonomous optimization control architecture that adds a perception-aware, orchestrable, and auditable policy layer atop existing pipelines without replacing them. DREAM has two core components. First, a three-tier Intent Engine fuses on-device signals into structured L0/L1/L2 intent representations; its edge-cloud trigger chain reduces reporting volume to approximately 8.7%. Second, a Meta Engine uses a MetaModel for layered M1-to-M2-to-M3 reasoning: intent summarization, strategy planning informed by Strategy Memory, and parameter translation. It dispatches the resulting parameters through a unified outlet with safety guardrails. A Reward Dual Loop continuously optimizes both components by combining offline simulation for strategy-space exploration with online feedback for outcome calibration, forming a cycle of generation, execution, evaluation, and experience accumulation. Large-scale A/B tests on Taobao's homepage feed show that re-ranking control alone improves IPV by 2.06%, Core IPV by 2.39%, and GMV by 0.88%. Extending control to fine ranking raises these gains to 2.71%, 3.06%, and 1.31%, respectively, while consistently improving PV by more than 1%. These gains require neither replacement of pipeline models nor compromise of serving stability, supporting agentic meta-control as a viable paradigm for industrial recommendation.
- Abstract(参考訳): 産業推薦システムは一般的にカスケード検索、ランキング、再ランク付けパイプラインを使用する。
効率的ではあるが、これらのパイプラインはモジュール間の情報と目的を断片化し、厳格なルールに依存し、リアルタイムインテントに対する認識が制限され、ブラウジング、比較、購入のセッションレベルのシフトは不十分である。
DREAM(Developing Recommender Engine with Agentic Methods)は,既存のパイプライン上に,認識認識,オーケストレーション,監査可能なポリシレイヤを,置き換えることなく追加する,自律的な最適化制御アーキテクチャである。
DREAMには2つのコアコンポーネントがある。
まず、3層のIntent Engineはデバイス上の信号を構造化されたL0/L1/L2インテント表現に融合する。
第二に、Meta Engineは層化されたM1-to-M2-to-M3推論にMetaModelを使用します。
安全ガードレールを備えた統一された出口を通って、結果のパラメータをディスパッチする。
Reward Dual Loopは、戦略空間探索のためのオフラインシミュレーションと結果の校正のためのオンラインフィードバックを組み合わせて、生成、実行、評価、経験蓄積のサイクルを形成することによって、両方のコンポーネントを継続的に最適化する。
Taobaoのホームページフィードの大規模A/Bテストでは、再ランクコントロールだけでITVを2.06%改善し、Core IPVを2.39%改善し、GMVを0.88%改善した。
細かいランキングに制御を拡大すると、それぞれ2.71%、3.06%、および1.31%に上昇し、PVを1%以上改善している。
これらの利益はパイプラインモデルの置き換えや安定性の妥協を必要とせず、産業的推奨のための実行可能なパラダイムとしてエージェント的メタコントロールをサポートする。
関連論文リスト
- A Deployment-Oriented and Resource-Efficient Neuro-Symbolic Framework for Explainable DDoS Detection in Operational Technology Networks [1.202468381202799]
本稿では,資源制約環境下での堅牢なDDoS検出に特化して設計されたニューロシンボリック・フレームワークを提案する。
このフレームワークは、浅い決定木をシンボル成分としてゲートリカレントユニット(GRU)ニューラルネットワークを融合する。
ハイブリッドモデルは、3つの実世界のベンチマークDDoSデータセットで評価される。
論文 参考訳(メタデータ) (2026-08-17T16:18:15Z) - MGSB: Manifold Gated Signature Branch Pressure-Domain Baseline Architecture for Two-Phase Pipeline Flows Under Distributional Shift [0.0]
マルチフェーズパイプラインのリーク検出モデルは、トレーニングとは異なるフローレギュレーションの下でデプロイされると、しばしば劣化する。
本稿では,レギュラー条件付き特徴融合とTT-RoughPathエンコーダと平均-Teacher整合性正規化を組み合わせたレギュラーアウェアアーキテクチャを提案する。
離脱1グループアウト評価では、MGSBは0.930の検知F1と0.783のOODF1を達成し、CNN-LSTMと完全に接続されたベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-08-05T13:12:03Z) - GR2 Technical Report [58.300302585605095]
GR2は、セマンティックIDの中間トレーニングと、より強い教師から抽出された推論トレースを組み合わせたエンドツーエンドフレームワークである。
GR2は産業規模の交通のレガシーベースラインに対して+18.7%のR@1、+7.1%のR@3、+9.6%のN@3を提供する。
論文 参考訳(メタデータ) (2026-06-30T17:22:22Z) - TriSP: Tri-Signal Structured Pruning for Large Language Models [0.0]
大規模言語モデル(LLM)は多様なタスクにわたって高いパフォーマンスを達成するが、そのデプロイメントはメモリと計算コストによって制約される。
構造化プルーニング(Structured pruning)は、アテンションヘッドやマルチ層パーセプトロン(Multi-Layer Perceptron、MLP)ニューロンなどの構造全体を除去して、標準ハードウェア上で効率的に動作するより小さな密度のモデルを生成することで、この問題に対処する。
本稿では,Tri-Signal Structured Pruning(Tri-Signal Structured Pruning,Tri-Signal Structured Pruning,Tri-Signal Structured Pruning,Tri-Signal Structured Pruning)を提案する。
論文 参考訳(メタデータ) (2026-06-09T17:02:14Z) - LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval [10.896685094390136]
ビジュアル検索、レコメンデーションエンジン、マルチモーダル質問応答など、現代のAIアプリケーションを支えるマルチステージ検索システム。
本稿では,この制限を相認識型大規模言語モデル (LLM) エージェントを用いて解決する。
論文 参考訳(メタデータ) (2026-06-03T22:28:34Z) - GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control [0.0]
GIRL(Generative Imagination Reinforcement Learning)は、この障害モードに2つの重要なコンポーネントで対処する潜在的世界モデルフレームワークである。
GIRLは、DreamerV3に対するタスク間の遅延ロールアウトドリフトを38~61%削減し、リターンを改善し、長距離タスクでの環境相互作用を少なくする。
蒸留前の変種はオーバーヘッドを減らし、フルモデルに対する計算効率を向上させる。
論文 参考訳(メタデータ) (2026-04-08T17:14:21Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - MiniOneRec: An Open-Source Framework for Scaling Generative Recommendation [44.05859062614669]
MiniOneRecは、最初の完全なオープンソースジェネレーティブレコメンデーションフレームワークである。
SID構築にまたがるエンドツーエンドワークフロー、教師付き微調整、レコメンデーション指向の強化学習を提供する。
実験の結果,モデルサイズの増加に伴い,トレーニングと評価の両方の損失が一貫した下降傾向を示した。
論文 参考訳(メタデータ) (2025-10-28T13:58:36Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System [61.12400636463362]
OnePieceは、LLMスタイルのコンテキストエンジニアリングと推論を、検索モデルとランキングモデルの両方にシームレスに統合する統合フレームワークである。
OnePieceは、Shopeeの主要なパーソナライズされた検索シナリオにデプロイされ、さまざまな主要なビジネス指標で一貫したオンラインゲインを実現している。
論文 参考訳(メタデータ) (2025-09-22T17:59:07Z) - Reinforced Model Merging [53.84354455400038]
本稿では,タスク統合に適した環境とエージェントを含むRMM(Reinforced Model Merging)という,革新的なフレームワークを提案する。
評価プロセス中にデータサブセットを利用することで、報酬フィードバックフェーズのボトルネックに対処し、RMMを最大100倍高速化する。
論文 参考訳(メタデータ) (2025-03-27T08:52:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。