論文の概要: AURA: Agentic Diagnosis and Refinement for Production Recommender Systems at Scale
- arxiv url: http://arxiv.org/abs/2609.16625v1
- Date: Tue, 15 Sep 2026 04:38:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.342318
- Title: AURA: Agentic Diagnosis and Refinement for Production Recommender Systems at Scale
- Title(参考訳): AURA:大規模生産レコメンダシステムのためのエージェント診断とリファインメント
- Abstract要約: 本稿では,大規模に定性評価を行うエージェントシステムであるAURA(Agentic Understanding and Refinement of recommender algorithm)を提案する。
専門エージェントは、何千ものセッションから数百万まで、プロダクションエンゲージメントログを読み、レコメンダが実際のユーザを失敗させる方法のパターンや例をサーフェスする。
システム設計,大手メディアストリーミング企業における2つの大規模コンシューマプラットフォームの生産データの初期テスト,セーフガード,運用学習,そして自己改善型レコメンデータシステムに向けた早期結果について報告する。
- 参考スコア(独自算出の注目度): 0.15293427903448018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How and why does a recommender system fail the users it serves? Oftentimes, practitioners are left to improve their algorithms based on a combination of feedback from stakeholder teams, domain expertise, and insights from data analyses. Yet the nuances of how and where recommendations perform well or poorly for end users are difficult to discern from aggregate quantitative metrics. Whereas these metrics provide a high-level and incomplete picture, further granularity into the quality of recommendations and their patterns requires reasoning with domain understanding and objectivity, at scale. We contemplate this complex conundrum and describe a method and implementation that uses the latest AI agentic advances to provide actionable diagnoses and improvements for production recommender systems. We present AURA (Agentic Understanding and Refinement of recommender Algorithms), an end-to-end agentic system that performs qualitative evaluation at scale and can then generate improvements to our algorithms at the code level. Specialized agents read production engagement logs, from thousands of sessions to millions, and surface patterns and examples of how the recommender fails real users. The next step uses those diagnoses and context about the recommender's own code, data, and training pipeline to propose and implement refinements grounded in that codebase. We report the system design, initial tests on production data from two large consumer platforms at a major media-streaming company, safeguards, operational learnings, and early results toward a self-improving recommender system. Finally, the diagnostic gap AURA closes is not specific to streaming. The architecture is built to transfer: every domain-specific element enters through the configuration layer that already ported it between our two platforms. We map it concretely to e-commerce and online-retail recommendation.
- Abstract(参考訳): なぜ、レコメンデーターシステムは、ユーザーが機能しないのか?
多くの場合、実践者はステークホルダチームからのフィードバック、ドメインの専門知識、データ分析からの洞察の組み合わせに基づいて、アルゴリズムを改善するために残されます。
しかし、エンドユーザーにとって、どのように、どこでレコメンデーションがうまく機能しているかというニュアンスは、メトリクスの総量から見分けるのが難しい。
これらのメトリクスは、高レベルで不完全な図を提供するが、レコメンデーションの品質をさらに細かくし、そのパターンは、大規模にドメインの理解と客観性を推論する必要がある。
我々は、この複雑な混乱を熟考し、最新のAIエージェントの進歩を利用して、プロダクションレコメンデータシステムに対して実行可能な診断と改善を提供する方法と実装について述べる。
AURA(Agentic Understanding and Refinement of recommender Algorithms)は,大規模に定性評価を行い,コードレベルでアルゴリズムの改良を生成できるエージェントシステムである。
専門エージェントは、何千ものセッションから数百万まで、プロダクションエンゲージメントログを読み、レコメンダが実際のユーザを失敗させる方法のパターンや例をサーフェスする。
次のステップでは、レコメンダ自身のコード、データ、トレーニングパイプラインに関する診断とコンテキストを使用して、コードベースに根ざした改善を提案し、実装する。
システム設計,大手メディアストリーミング企業における2つの大規模コンシューマプラットフォームの生産データの初期テスト,セーフガード,運用学習,そして自己改善型レコメンデータシステムに向けた早期結果について報告する。
最後に、AURAのクローズする診断ギャップはストリーミングに特有ではない。
すべてのドメイン固有の要素が、すでに2つのプラットフォーム間で移植されている設定層を介して入力されます。
具体的には、eコマースとオンライン小売レコメンデーションにマップします。
関連論文リスト
- The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows [72.9051182568928]
推論駆動最適化のための統合フレームワークであるReASearchを提案する。
共有エージェントループとドメイン固有のツールにより、ReASearchは、プロンプト、プログラム、MLを最適化するために、まったく同じスキャフォールドをインスタンス化する。
我々は,複雑な探索行動がエージェントの推論プロセスから自然に現れることを観察する。
論文 参考訳(メタデータ) (2026-08-07T02:15:39Z) - Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems [64.88044474617854]
大規模言語モデルベースのエージェントをリコメンダシステムに迅速に統合することで、静的なランキングベースのパイプラインから、自律的でインタラクティブなシステムへのシフトが加速した。
この調査では、自律性のレベルとエージェントレコメンデータシステムの3つのコアパラダイムを基盤とした統合された分類法を紹介した。
論文 参考訳(メタデータ) (2026-07-05T17:55:05Z) - RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation [63.74915464611075]
RecThinkerはツール拡張推論を推奨するエージェントフレームワークである。
我々はRecThinker専用のツール群を開発し、モデルがユーザアイテム側および協調的な情報を取得することを可能にする。
論文 参考訳(メタデータ) (2026-03-10T16:07:17Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - Online and Offline Evaluations of Collaborative Filtering and Content Based Recommender Systems [0.0]
本研究では,イランにおける大規模レコメンデーションシステムの比較分析を行った。
このシステムは、コンテンツベース、協調フィルタリング、トレンドベース手法、ハイブリッドアプローチを用いた、ユーザベースおよびアイテムベースのレコメンデーションを採用している。
評価方法は,手動による評価,ヒットレート@kやnDCGなどの評価指標を含むオフラインテスト,クリックスルーレート(CTR)によるオンラインテストなどである。
論文 参考訳(メタデータ) (2024-11-02T20:05:31Z) - Quantifying User Coherence: A Unified Framework for Cross-Domain Recommendation Analysis [69.37718774071793]
本稿では,レコメンデーションシステムを理解するための新しい情報理論手法を提案する。
9つのデータセットで7つのレコメンデーションアルゴリズムを評価し、測定値と標準的なパフォーマンス指標の関係を明らかにする。
論文 参考訳(メタデータ) (2024-10-03T13:02:07Z) - A Sequence-Aware Recommendation Method Based on Complex Networks [1.385805101975528]
データからネットワークモデルを構築し、それを使ってユーザのその後のアクションを予測する。
提案手法は大規模データセット上で実験的に実装および試験を行った。
論文 参考訳(メタデータ) (2022-09-30T16:34:39Z) - Recommendation Systems with Distribution-Free Reliability Guarantees [83.80644194980042]
我々は、主に良いアイテムを含むことを厳格に保証されたアイテムのセットを返す方法を示す。
本手法は, 擬似発見率の厳密な有限サンプル制御によるランキングモデルを提供する。
我々はYahoo!のランキングとMSMarcoデータセットの学習方法を評価する。
論文 参考訳(メタデータ) (2022-07-04T17:49:25Z) - Recommending with Recommendations [1.1602089225841632]
レコメンデーションシステムは、しばしば予測を行う際に敏感なユーザー情報を引き出す。
既存のサービスからのレコメンデーションに基づいて、サービスのレコメンデーションエンジンを基盤にすることで、この障害に対処する方法を示します。
我々の設定では、ユーザの(潜在的に敏感な)情報は高次元の潜在空間に属します。
論文 参考訳(メタデータ) (2021-12-02T04:30:15Z) - Beyond NDCG: behavioral testing of recommender systems with RecList [3.36987520740109]
本稿では,行動に基づくテスト手法RecListを提案する。
RecListはユースケースによってレコメンデータシステムを整理し、振る舞いテストのスケールアップのための一般的なプラグイン・アンド・プレイ手順を導入している。
我々は、既知のアルゴリズムとブラックボックスの商用システムを分析することで、その能力を実証する。
論文 参考訳(メタデータ) (2021-11-18T22:34:38Z) - A2Log: Attentive Augmented Log Anomaly Detection [53.06341151551106]
異常検出は、ITサービスの信頼性とサービス性にとってますます重要になる。
既存の教師なし手法は、適切な決定境界を得るために異常な例を必要とする。
我々は,異常判定と異常判定の2段階からなる教師なし異常検出手法であるA2Logを開発した。
論文 参考訳(メタデータ) (2021-09-20T13:40:21Z) - Recommendation system using a deep learning and graph analysis approach [1.2183405753834562]
本稿では,行列係数化とグラフ解析に基づく新しい推薦手法を提案する。
さらに,ディープオートエンコーダを利用してユーザやアイテムの潜伏要因を初期化し,ディープ埋め込み手法によってユーザの潜伏要因をユーザ信頼グラフから収集する。
論文 参考訳(メタデータ) (2020-04-17T08:05:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。