論文の概要: RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle
- arxiv url: http://arxiv.org/abs/2608.11241v1
- Date: Fri, 31 Jul 2026 15:42:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.592539
- Title: RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle
- Title(参考訳): RecSysファクトリー:LLMエージェントの自律性から産業用レコメンダライフサイクルの意思決定ポイントへ
- Abstract要約: RecSys Factoryは、3つの推奨ビジネスラインで78日間デプロイされたLLMエージェントプラットフォームです。
設計原則は、一般化ではなく、決定点における自律性である。
78日間の窓越しに、プラットフォームは1,624回のCLIツールディスパッチを78.6%の総成功率で記録した。
- 参考スコア(独自算出の注目度): 2.424372451932308
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying LLM agents into industrial recommender operations exposes a three-way tension we frame as the autonomy-determinism-efficiency trilemma: general autonomy (interpreting operator intent, generating glue code zero-shot), industrial determinism (schema-conforming feature extraction, non-crashing A/B, zero compliance-path hallucination), and end-to-end efficiency. Any two can be maximized against the third. We present RecSys Factory, an LLM-agent platform deployed for 78 days across three heterogeneous Tencent recommender business lines. The design principle is autonomy at decision points, not over pipelines, made concrete through three deconstructions that each discharge one vertex of the trilemma. Runtime is deconstructed into three host-emitted event sources (Claude Code Stop hooks, corporate-IM webhooks, workflow scheduler APIs): the platform carries no long-running daemon during the wait phase and consumes zero CPU during the 94% of wall-clock spent waiting on Spark or GPU jobs. Capability is deconstructed into a 29-file skill ecosystem (8,971 lines of SKILL.md) whose per-skill pitfall tables mechanically compile into a 400-entry PitfallStore, confining autonomy to bounded typed decision surfaces inside pre-committed pipelines. Deployment spans three business lines with disjoint label semantics, A/B layer topologies, and operator personas; an onboarding-time compression is observed on two of the three and is reported as a case-study observation, not a generalization claim, and not measured against a controlled pre-platform baseline. The human is retained at the diagnostic-versus-execution boundary via a human-in-the-loop card protocol, deployed as an audit-trail primitive (schema-validated, idempotent, replayable) and reported from an 8-day 16-run pilot. Across the 78-day window the platform recorded 1,624 CLI-tool dispatches at a 78.6% aggregate success rate.
- Abstract(参考訳): LLMエージェントを産業レコメンデーションオペレーションに配置すると、私たちは、自律性決定主義=効率のトリレンマとして、一般的な自律性(オペレーターインテンションの解釈、グルーコードゼロショットの生成)、産業決定性(スキーマコンフォーミング機能抽出、非クラッシングA/B、コンプライアンスパス幻覚ゼロ)、エンドツーエンド効率の3方向の緊張が表れる。
2つとも3つ目に対して最大化できる。
RecSys Factoryは、ヘテロジニアスなTencentレコメンデーションビジネスラインで78日間デプロイされたLLMエージェントプラットフォームです。
設計原則は、パイプラインではなく、決定点における自律性であり、それぞれがトリレンマの1頂点を排出する3つのデコンストラクションを通じて具体化されている。
ランタイムは3つのホストエミッションイベントソース(Claude Code Stop hooks、Couch-IM webhooks、ワークフロースケジューラAPI)に分解される。
能力は29ファイルのスキルエコシステム(SKILL.mdの8,971行)に分解され、スキルごとの落とし穴テーブルは400エントリのPitfallStoreに機械的にコンパイルされる。
配置は3つのビジネスラインにまたがり、非結合なラベルセマンティクス、A/B層トポロジ、オペレータペルソナがあり、オンボーディング時間圧縮は3つのうちの2つで観測され、一般化クレームではなくケーススタディな観察として報告され、制御されたプレプラットフォームベースラインに対して測定されない。
人間は、ヒューマン・イン・ザ・ループ・カードプロトコルを介して診断・回避・実行境界に保持され、監査・トレールのプリミティブとして展開され、8日間の16ランパイロットから報告される。
78日間の窓越しに、プラットフォームは1,624回のCLIツールディスパッチを78.6%の総成功率で記録した。
関連論文リスト
- SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center [0.0]
Sentinel-RLは、意味論的推論から位相論的推論を分離するエージェントSOCアーキテクチャである。
本稿では,LANL Comprehensive, Multi-Source Cyber-Security Events データセット, インディアナ大学クォーツHPCクラスタ上でシステムをインスタンス化する。
論文 参考訳(メタデータ) (2026-09-03T17:49:12Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - Memory as Infrastructure: Reliability Engineering for Persistent Agent Memory in Months-Long LLM-Assisted Development [0.0]
我々は,2026年1月以降,単一連続クロードコードセッションラインによる研究プロジェクトについて報告する。
オープンソースのメモリ連続性インフラストラクチャであるSIx Harnessについて説明する。
永続的なエージェントメモリサブシステムの,最初の数ヶ月規模の運用記録を提示する。
論文 参考訳(メタデータ) (2026-08-31T03:28:35Z) - DREAM Technical Report [53.37525197047151]
DREAMは、既存のパイプラインの上に認識認識、オーケストレーション、監査可能なポリシ層を追加し、それを置き換えることなく、自律的な最適化制御アーキテクチャである。
DREAMには2つのコアコンポーネントがある。まず、3層Intent Engineはデバイス上の信号を構造化されたL0/L1/L2インテント表現に融合する。エッジクラウドトリガーチェーンはレポートのボリュームを約8.7%に削減する。
第2に、Meta EngineはMetaModelを使って、層状M1-to-M2-to-M3推論(インテントの要約、ストラテジーメモリに通知されるストラテジープランニング、パラメータ変換など)を定式化したM1-to-M2-to-M3推論に使用します。
論文 参考訳(メタデータ) (2026-08-10T10:35:32Z) - Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale [6.287658270510339]
GitHub Copilot、Claude Code、CodexといったAIコーディングエージェントは、ツール実行によるマルチステップLLM推論をインターリーブする。
私たちは2026年6月のGitHub Copilotトレースをサンプルとして,このワークロードを初めて実運用規模で評価した。
論文 参考訳(メタデータ) (2026-07-30T20:51:51Z) - Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives [0.0]
この契約は、広く使用されている6つのオープンソースフレームワークのどれにも当てはまらない。
モデルフリーディファレンシャルプローブは、繰り返し発生するシリングリークを分離する。
SoundGATEは環境外部のRustゲートであり、すべての副作用を認めなければならない。
論文 参考訳(メタデータ) (2026-07-15T05:55:38Z) - Time-Lag-Aware Deep Reinforcement Learning for Flexible Job-Shop Scheduling in PPVC Module Factories [13.958047178810189]
コンクリートの硬化、防水試験、塗料の乾燥によって引き起こされる長い手術後の時間ラグ。
我々は3つの最小限の侵襲的、個別のアブレタブル拡張により、最先端のデュアルアテンション深層強化学習法を適用した。
持ちこたえのインスタンスでは、学習されたポリシーが最強の解決者なしスケジューラである。
論文 参考訳(メタデータ) (2026-07-13T15:50:00Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents [8.951500258016974]
Tri-Spiritは、知性を計画、推論、実行に分解する認知フレームワークである。
平均タスク遅延を75.6%削減し、エネルギー消費を71.1%削減する。
結果は、AIハードウェアにおいて、モデルスケーリング単独ではなく、認知的分解がシステムレベルの効率の第一の要因であることを示唆している。
論文 参考訳(メタデータ) (2026-04-15T11:43:01Z) - SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning [104.01865949020304]
エージェント・マルチモーダル・大規模言語モデル(MLLM)は,反復的な視覚的ツールの実行によって顕著な推論能力を達成する。
しかし、カスケード認識、推論、ツール呼び出しループは、重要なシーケンシャルなオーバーヘッドをもたらす。
このオーバーヘッドはエージェントディープと呼ばれ、禁止されたレイテンシを発生させ、システムレベルのスループットを著しく制限します。
本稿では,エージェントレベルの投機的アクセラレーションフレームワークであるSpecEyesを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:45:47Z) - OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection [0.0]
本稿では,決定論的シミュレーションエンジンが基底真理を維持し,言語モデルが表面の散文のみを生成する検証可能な合成ベンチマークを提案する。
コーパスは51日の模擬日、2,904回のテレメトリ記録を96.4%のノイズレートで記録し、単面と単日のトリアージ戦略を破るために設計された4つの検出シナリオをカバーしている。
論文 参考訳(メタデータ) (2026-03-23T19:03:53Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。