論文の概要: A Structured Knowledge Infrastructure for Domain-Specific Data Asset Discovery
- arxiv url: http://arxiv.org/abs/2607.27748v1
- Date: Thu, 30 Jul 2026 06:40:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.424721
- Title: A Structured Knowledge Infrastructure for Domain-Specific Data Asset Discovery
- Title(参考訳): ドメイン特化データアセット発見のための構造化知識基盤
- Abstract要約: 本稿では,Xiaohongshuの商用広告データウェアハウスに展開する2層ソリューションについて紹介する。
3階層の二重目的知識ベースは、検索と生成の両方に役立っている。
Graph-Guided Retriever (GGR)は、2,859ノードのナレッジグラフを、意図的なルーティングを備えた候補ゲートとして使用して、71.6倍のトークン削減を実現している。
- 参考スコア(独自算出の注目度): 3.199771721348483
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise data analytics agents face two structural failures: generic RAG retrieves the wrong asset (Hit@10=19.1%) and delivers no usage knowledge to prevent metric misinterpretation---stemming from four root causes (C1--C4) ranging from semantic gap and entity ambiguity to schema drift and asset-usage gap. We present a two-layer solution deployed in the commercial advertising data warehouse at Xiaohongshu (5,300+ Hive tables, 14 domains). A three-tier dual-purpose knowledge base (179 documents, eight-section annotation template) serves both retrieval and generation, with a closed-loop refresh pipeline maintaining day-level freshness (one yes/no approval, 30s hot-reload). The Graph-Guided Retriever (GGR) uses a 2,859-node knowledge graph as a candidate gate with intent routing to deliver 71.6x token reduction. The Scene-Aware Ranker (SAR) applies 19-class entity recognition and explicit scenario annotations; negative knowledge alone contributes 25 percentage points of Hit@10 gain. On two 100-question benchmarks, Hit@10 rises from 19.1% to 96.6% (+77.5pp) and knowledge coverage from 56% to 77%, at 4.84--5.33s end-to-end latency.
- Abstract(参考訳): ジェネリックRAGは間違ったアセット(Hit@10=19.1%)を取得し、メトリクスの誤解釈を防ぐための使用知識を提供しない。
本稿では,Xiaohongshu (5,300以上のHiveテーブル,14ドメイン) の商用広告データウェアハウスに展開する2層ソリューションを提案する。
3層二重目的知識ベース(179文書、8節のアノテーションテンプレート)は、検索と生成の両方に役立ち、クローズドループリフレッシュパイプラインは、日々の鮮度を維持している(イエス/ノーの承認、30秒のホットリロード)。
Graph-Guided Retriever (GGR)は、2,859ノードのナレッジグラフを、意図的なルーティングを備えた候補ゲートとして使用して、71.6倍のトークン削減を実現している。
SAR(Scene-Aware Ranker)は19クラスのエンティティ認識と明示的なシナリオアノテーションを適用している。
2つの100クエストベンチマークでは、Hit@10は19.1%から96.6%(+77.5pp)に上昇し、知識カバレッジは56%から77%、エンドツーエンドのレイテンシは4.84--5.33sである。
関連論文リスト
- An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation [1.9674271425998944]
大規模言語モデルは、暗黙的にニューラルウェイトで世界モデルを符号化し、医療や金融といった高精度領域における4つの構造的リスクを露呈する。
我々は、明示的な世界モデルを形式化し、規則の独立の下では、明示的なモデルは、構成可能な反事実分解可能性に十分な条件を提供することを示す。
実装されたシステムは、DaoQLの検証済みストレージ層と明示的なEvalパスに注目し、グラフ、カラム、ベクタ、フルテキストエンジンをひとつのプロセスに統合する。
論文 参考訳(メタデータ) (2026-07-19T14:20:22Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - DisasterLex: An Expert Concept-to-Schema Knowledge Graph for Geospatial Reasoning in Disaster Analytics [7.702420465302456]
DisasterLexは知識グラフを介するフレームワークで、ユーザクエリとデータベースの間に、キュレートされた概念と型付き因果関係のエキスパート知識グラフ(EKG)を挿入する。
EKGには107のコンセプト、117の因果エッジ、52のコンセプト・ツー・テーブルリンクがある。
プロプライエタリおよびオープンウェイトな家庭にまたがる7つのベースモデルにおいて、DeramLexは最先端の4つのベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-28T20:13:02Z) - Human-Inspired Memory Architecture for LLM Agents [0.9507070656654629]
6つの認知機構からなる生体記憶アーキテクチャを提案する。
各メカニズムは、単純メモリ蓄積の特定の障害モードに対処する。
S層スケール(50セッション)では、デダップベースのコンソリデーションにより、好みのリコールが+13.3pp向上する。
論文 参考訳(メタデータ) (2026-05-08T22:52:37Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - Why Agent Caching Fails and How to Fix It: Structured Intent Canonicalization with Few-Shot Learning [0.0]
キャッシュの有効性は、分類精度ではなく、キーの一貫性と精度を必要とする。
構造化意図分解フレームワークであるW5H2を紹介する。
NyayaBench v2 (20クラス)では、SetFitは55.3%を達成し、30言語にまたがる言語間転送を実現している。
論文 参考訳(メタデータ) (2026-02-21T18:25:18Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。