論文の概要: PinSieve: Production Selective VLM Serving and a Governed Memory Flywheel for Enterprise Content-Quality Triage
- arxiv url: http://arxiv.org/abs/2608.24040v1
- Date: Tue, 25 Aug 2026 03:57:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.807178
- Title: PinSieve: Production Selective VLM Serving and a Governed Memory Flywheel for Enterprise Content-Quality Triage
- Title(参考訳): PinSieve: 企業コンテンツ品質トリアージのための生産選択型VLMサービングとGoverned Memory Flywheel
- Abstract要約: 我々は、大規模コンテンツ品質パイプラインのプロダクションケーススタディであるPinSieveを紹介する。
配備されたコンポーネントは、選択視覚モデル(VLM)サービングエージェントであり、軽量上流モデルで未解決のグレーゾーンスライスのみで動作する。
このスライスでは、デプロイされたシステムでは、以前の生産モジュールよりも2.05倍の非動作可能なアイテムをフィルタリングすると同時に、推定ミス率をわずかに削減する。
昇進後、レビューの生産性を25.7%改善し、通常の運用コストを16.2%削減し、翌日から翌日に信号配信を移行した。
- 参考スコア(独自算出の注目度): 3.82270579796277
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise AI agents in production often need to be bounded, stateful, observable, and governable rather than fully autonomous. We present PinSieve, a production case study in a large-scale content-quality pipeline. Its deployed component is a selective vision-language-model (VLM) Serving Agent that operates only on the grey-zone slice left unresolved by lightweight upstream models, exposes a scalar routing score online, and preserves controlled human escalation. On this slice, the deployed system filters 2.05x more non-actionable items than the previous production module while slightly reducing estimated miss rate; after promotion, it improves review productivity by 25.7%, reduces normalized operating cost by 16.2%, and moves signal delivery from next-day to same-day. We then study maintenance through a governed memory flywheel under selective feedback, where escalated items are reviewed by default and auto-passed items are labeled mainly through audit sampling. Feedback Memory records routing traces, observation paths, audit propensities, and replay metadata for evaluation and debugging. The Data Curation Agent uses a bounded proposal-verifier loop over representative, uncertainty, recency, and fresh-review replay, with positive-rate and score-bin guardrails before batch acceptance. In chained monthly refresh over six months of production data, this design reduces average FNR@50% from 17.73% under representative random replay to 13.29%. A Reasoning Review Agent audits teacher-generated rationales and supports keep/repair/drop decisions. Production claims are attributed only to the deployed Serving Agent; replay and rationale-review results are offline or sampled-governance evidence. The same serving-agent recipe has been adopted to several additional internal signals, suggesting transferability beyond one task.
- Abstract(参考訳): 運用中のエンタープライズAIエージェントは、完全に自律的ではなく、バウンダリ、ステートフル、オブザーバブル、および管理可能である必要があることが多い。
我々は、大規模コンテンツ品質パイプラインのプロダクションケーススタディであるPinSieveを紹介する。
デプロイされたコンポーネントは、選択視覚言語モデル(VLM)サービングエージェントで、軽量上流モデルで未解決のグレーゾーンスライスのみで動作し、スカラールーティングスコアをオンラインで公開し、コントロールされた人間のエスカレーションを保存する。
このスライスでは、デプロイされたシステムでは、以前の生産モジュールよりも2.05倍多くの非動作可能なアイテムをフィルタし、予測ミス率をわずかに低減し、プロモーション後のレビュー生産性を25.7%改善し、正規化された運用コストを16.2%削減し、翌日から翌日に信号配信を移動させる。
次に,選択的フィードバックの下で制御されたメモリフライホイールを用いて,エスカレーションされたアイテムをデフォルトでレビューし,自動通過アイテムを主に監査サンプリングによってラベル付けする。
フィードバックメモリは、ルーティングトレース、観察パス、監査の妥当性、評価とデバッグのためのメタデータを再生する。
Data Curation Agentは、代表、不確実性、正確性、再レビューのリプレイに境界付きプロポーザル検証ループを使用し、バッチ受理前に正のレートとスコアビンのガードレールを使用する。
6ヶ月にわたる月次リフレッシュでは、FNR@50%が17.73%から13.29%に減少する。
推論レビューエージェント(Reasoning Review Agent)は、教師が生成した合理性を監査し、保持/再生/ドロップ決定をサポートする。
プロダクションクレームはデプロイされたServing Agentにのみ対応している。
同じサービスエージェントのレシピがいくつかの内部シグナルに採用され、ひとつのタスクを超えて転送可能であることが示唆されている。
関連論文リスト
- IPM-FM: A Foundation Model with Consensus Feature Selection for Industrial Process Monitoring [59.59850511287819]
産業プロセス監視基盤モデル(IPM-FM)を提案する。
まず、自己教師付き事前学習を通じて、ラベルのない産業プロセスデータから汎用的な表現を学習する。
少数のタスクラベル付きデータを使用して特定の監視タスクに適応し、最終的に校正された予測を生成する。
論文 参考訳(メタデータ) (2026-09-08T07:43:04Z) - VST: Verifiable Structured Transport for Auditable Agent-to-Agent Alpha Discovery [11.790070440436294]
エージェント・ツー・エージェント(A2A)アルファ発見は、マイニングと評価エージェント間の繰り返しのフィードバックサイクルによって遅くなる。
我々はまず、この通信をEmphtyped, causally addressable, unicast recordの構造化エージェント対エージェントプロトコルとして再構成する。
型付けが提供するものは、スキーマチェック、決定論的にリプレイされ、構築によって予測を評価者にリークすることを防ぐ状態である。
論文 参考訳(メタデータ) (2026-09-07T05:43:50Z) - RefactorPlatform: An Open-Source Harness for Controlled Evaluation of Repository-Scale Refactoring Agents [0.09320657506524148]
RefactorPlatformは、環境を固定し、各設計軸を変化させるオープンソースの評価ハーネスである。
各実行は、ライブ端末ストリーミング、トークン、差分、およびトランスクリプトのタスクごとのロギング、ASTベースの検証、監査と再生のためのエクスポート可能なテレメトリを備えた、独立したワークスペースで実行される。
論文 参考訳(メタデータ) (2026-09-04T08:58:10Z) - From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement [56.26277769790695]
RLVR(Reinforcement Learning with Verifiable Rewards)は、推論指向の大規模言語モデル(LLM)の最近の進歩を推進している。
本稿では、RLVRをオープンなタスクに拡張するためのタスク変換に基づくトレーニングパラダイムであるRLSVR(Reinforcement Learning with Self-Verifiable Rewards)を提案する。
ソーシャルデダクションゲームにインスパイアされた自己PlaY強化学習手法SpyRLでRTSVRをインスタンス化する。
論文 参考訳(メタデータ) (2026-07-26T19:04:33Z) - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training [14.51193578486111]
CLAPはビジネスデータを構造化されたSFTサンプル、意思決定基準サンプル、ホールドアウトセット、リスク診断、リリースゲートレコードに変換する。
匿名化された5つの製造・scenarioバッチでは、QLoRAスタイルのLoRA-SFTが平均利得を抑える。
論文 参考訳(メタデータ) (2026-07-02T08:07:56Z) - Runtime Compliance Verification for AI Agents [0.19116784879310025]
現在のテストプラクティスは、オフラインのレッドチームや静的レビューに依存しているが、エージェントの動作がルールに従うことを保証していない。
本稿では,C-Trace (Compliance Trace Enforcement) を提案する。
論文 参考訳(メタデータ) (2026-06-17T16:22:34Z) - CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search [16.32525191514382]
今回紹介するCoReは、毎週5か月以上、大規模なショートビデオ検索エンジンに再デプロイするシステムだ。
我々の報酬は、デプロイされたマルチモーダルレバレンスモデルをソースとし、生産核融合代数を反映する乗法比形式を用いる。
半オンラインMixed Preference Optimizationループは、この報酬を毎週数百万のインスタンススケールで手頃な価格で提供する。
論文 参考訳(メタデータ) (2026-06-12T05:19:40Z) - From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing [79.19755531338872]
既存のルーティングメソッドは、クエリに対するモデルの単一応答を、トレーニングの能力ラベルとして扱う。
この仮定はルーティング管理にシステマティックノイズを導入し、学習されたルーティングポリシーの信頼性を低下させることを示す。
本稿では, DARS(Distribution-Aware Routing Supervision)を提案する。
論文 参考訳(メタデータ) (2026-06-05T05:42:00Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents [6.158612515104146]
エージェントフィードバックとレビュアーフィードバックのトレードオフを測定するために、ヘルプフルネス・ハームフルネスメトリクスを導入します。
我々はBFCLとTau2-Bench(マルチターンステートフルシナリオ)に対するアプローチを評価し、無関係検出では+5.5%、マルチターンタスクでは+7.1%を達成した。
GPT-4oでは,評価モデルo3-miniが3:1の利益率と2.1:1の利益率を達成した。
論文 参考訳(メタデータ) (2026-04-29T22:09:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。