論文の概要: Training a Knowledge Base: Supervised Structure Learning for Agent-Curated Document Stores
- arxiv url: http://arxiv.org/abs/2608.21829v1
- Date: Sat, 22 Aug 2026 07:57:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.48312
- Title: Training a Knowledge Base: Supervised Structure Learning for Agent-Curated Document Stores
- Title(参考訳): 知識ベースをトレーニングする:エージェントキュレートドキュメンテーションストアのための教師付き構造学習
- Authors: Yu Pan, Hongfeng Yu,
- Abstract要約: 教師付き質問を用いてドキュメントストアをキュレートする方法を示す。
トレーニングエージェントは、現在の店舗に対して監督された質問に答え、金が示され、その後、店を編集する。
変化のないリーダは、後に固定されたアクション予算の下で凍結されたスナップショットで検査される。
ストアがトレーニングした質問に対して、変化のない読者は、より高い精度で31%のアクションを消費する。
- 参考スコア(独自算出の注目度): 4.3610200376460035
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation treats the document store as a frozen input, and the systems that instead let an agent curate one never measure what curation does to the store. We invert the framing: the knowledge base is the model. A training agent answers a supervised question against the current store, is shown the gold, then edits the store; an unchanged reader is later examined on a frozen snapshot under a fixed action budget. Where offline graph construction is unsupervised, (question, answer) pairs are our labels -- and that supervision is what makes the structure cheap. Per point of corpus indexed it returns 1.6x the action saving and 1.8x the accuracy of an unsupervised entity index covering everything, using 1,913 links against its 196,112. On questions the store trained on, an unchanged reader spends 31% fewer actions at higher accuracy, and the result reproduces on an official PhantomWiki generation whose questions we did not write. To measure how far this reaches we introduce a key-coverage gradient, a probe varying how much of a question the training set touched, replacing a train/test split's pass/fail with a decay curve. Generalization proves endpoint-dependent: accuracy carries to unseen questions (+0.167 F1 where both of a question's keys were indexed, +0.100 where one was, zero where neither) while the action saving stays on trained questions. Because that decay is indexed by coverage rather than by novelty, more training extends it -- and the store is undertrained, not saturated: coverage grows linearly in new questions and stops the moment training repeats them, so a hundred questions reach a quarter of the corpus and four times as many would close the gap.
- Abstract(参考訳): Retrieval-augmented Generationは、ドキュメントストアをフリーズインプットとして扱い、代わりにエージェントをキュレートさせるシステムは、ストアにキュレーションが何をするかを決して測定しない。
私たちはフレーミングを反転させます。知識ベースはモデルです。
トレーニングエージェントは、現在の店舗に対して監督された質問に回答し、金が表示され、その後、店舗を編集する。
オフライングラフの構築が監視されていない場合、(問い合わせ、回答)ペアは私たちのラベルです。
コーパスインデックスの1ポイント当たり、アクションセーブの1.6倍、すべてをカバーしている教師なしエンティティインデックスの1.8倍の精度を返し、196,112に対して1,913リンクを使用する。
ストアがトレーニングした質問に対して、変化のない読者は、より高い精度でアクションを31%減らし、その結果は、私たちが書かなかった公式のPhantomWiki世代で再現される。
この到達距離を測定するために,学習セットがどの程度の質問に触ったかを調査し,列車/テストのパス/フェイルを崩壊曲線に置き換える。
一般化はエンドポイントに依存していることを証明している: 正確性は未確認の質問(両方の質問のキーがインデックス付けされた+0.167 F1、どちらかの質問がインデックス付けされた+0.100、どちらもゼロだった+0.100、アクションセーブは訓練された質問に留まる。
新しい質問ではカバレッジが直線的に増加し、トレーニングが繰り返される瞬間が停止するので、100の質問がコーパスの4分の1に達し、そのギャップを埋めるでしょう。
関連論文リスト
- Extractable Memorization From First Principles [66.10415626674103]
一致した比較が厳密で校正された暗記の主張を可能にすることを示す。
我々は「抽出可能な記憶」を洗練し、有効な記憶のクレームとほぼ確実な生成を必要とする。
論文 参考訳(メタデータ) (2026-07-14T11:31:36Z) - Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation [0.0]
4つのコーパスの4つのバージョンは、エージェントがどのようにコンテンツに到達するかにのみ異なる、事前登録されたアブレーションを実行する。
私たちは、家族横断の裁判官で検証された金の基準に対して盲目で答える。
この研究は、評価の妥当性に関するケーススタディとして、それを作成したツールに脅威と妥当性の規律を適用した。
論文 参考訳(メタデータ) (2026-07-06T01:03:27Z) - Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA [40.94400211806987]
言語モデルは、QA(Synthetic Question Aswer)の監督によって、ますます教えられている。
この生成ステップが中立的な前処理ではないことを示す。
このような障害モードは,QA生成時の選択から発生し,トレーニングループを変更することなく低減できることを示す。
論文 参考訳(メタデータ) (2026-06-30T17:35:14Z) - Dynamic Mixture of Latent Memories for Self-Evolving Agents [57.20419419302731]
MoLEMは、動的混合(MoE)に基づく潜在メモリフレームワークの生成混合物である。
我々は、数学、科学、コードドメインにまたがる連続的な学習シーケンスに基づいて、このフレームワークを訓練する。
連続学習を完了した後、Vanilla事前学習ベースラインよりも平均精度を10.40%向上させる。
論文 参考訳(メタデータ) (2026-05-21T03:35:10Z) - HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help? [32.54022440678003]
コーディングエージェントは、完全なコンテキストが与えられたときに複雑なタスクを解決します。
現在のベンチマークは、この障害モードに盲目です。
我々はこの選択的エスカレーションスキルを測定するためにHiL-Benchを提案する。
論文 参考訳(メタデータ) (2026-04-10T15:21:44Z) - Gradient Atoms: Unsupervised Discovery, Attribution and Steering of Model Behaviors via Sparse Decomposition of Training Gradients [0.0]
トレーニングデータ属性(TDA)メソッドは、モデルの振る舞いにどのトレーニングドキュメントが責任を持つかを問う。
ドキュメントごとのトレーニング勾配をスパースコンポーネントに分解する、教師なしの方法であるGradient Atomsを提案する。
500個の発見原子のうち、最も高いコヒーレンスな原子は、行動ラベルなしで解釈可能なタスクタイプの挙動を回復する。
論文 参考訳(メタデータ) (2026-03-15T23:39:36Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning [86.19804569376333]
インストラクションチューニングにおいてゼロショットの一般化は非常に早い段階で起こることを示す。
より基礎的なトレーニングデータアレンジメントフレームワークであるテスト中心型マルチターンアレンジメントを提案する。
論文 参考訳(メタデータ) (2024-06-17T16:40:21Z) - Infinite dSprites for Disentangled Continual Learning: Separating Memory Edits from Generalization [36.23065731463065]
Infinite dSpritesは任意の長さの連続的な分類ベンチマークを作成するための擬似ツールである。
この単純なベンチマークでは、十分に長い時間をかけて、全ての主要な連続学習手法の性能が低下していることが示される。
生成因子を直接監督した簡単な設定では、学習階級に依存しない変換が破滅的な忘れを回避できる方法を示している。
論文 参考訳(メタデータ) (2023-12-27T22:05:42Z) - Generating Fact Checking Briefs [97.82546239639964]
本研究では, 事実確認の精度と効率を高めるために, 事実確認を行う前に, クレームに関する情報を提供することにより, 事実確認の精度と効率を高める方法について検討する。
我々は,クレームに条件付き質問セットを生成し,証拠を検索し,回答を生成するモデルQABrieferを開発した。
本研究では,特にQABriefsにおけるブリーフィングによる事実チェックによって,クラウドワーカーの精度が10%向上すると同時に,時間もわずかに低下することを示す。
論文 参考訳(メタデータ) (2020-11-10T23:02:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。