論文の概要: Training a Knowledge Base: Supervised Structure Learning for Agent-Curated Document Stores
- arxiv url: http://arxiv.org/abs/2608.21829v2
- Date: Tue, 25 Aug 2026 05:20:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.95958
- Title: Training a Knowledge Base: Supervised Structure Learning for Agent-Curated Document Stores
- Title(参考訳): 知識ベースをトレーニングする:エージェントキュレートドキュメンテーションストアのための教師付き構造学習
- Abstract要約: Retrieval-augmentedジェネレーションは、ドキュメントストアをフリーズインプットとして扱い、その上にビルド構造を行うオフラインパイプラインは、教師なしで構築する。
我々は、知識ベースを(質問、回答)ペアに基づいて訓練された非パラメトリックモデルとして扱う。
キュレーターエージェントは、現在店舗に対して監督された質問に回答し、金の回答を示し、店舗を編集する。
- 参考スコア(独自算出の注目度): 4.3610200376460035
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation treats the document store as a frozen input, and the offline pipelines that do build structure over it build it unsupervised -- a whole corpus indexed at uniform effort, with no signal about which structure a question will need. We instead treat the knowledge base as a non-parametric model trained on (question, answer) pairs: a curator agent answers a supervised question against the current store, is shown the gold answer, then edits the store. The store carries forward, and we evaluate the curated store with a test set, on two contamination-free benchmarks: KBGym, a fictional-universe generator we release, and PhantomWiki. Generalization is probed with four question groups of decreasing overlap with the training set: the trained questions themselves, and unseen questions sharing both of their keys with training, one key, or neither. The curated store's advantage grows with overlap -- from parity where no key was shared, through +0.176 F1 where both keys were, to 25% fewer actions at +0.294 F1 on the trained questions, the one cell significant on both benchmarks -- while matching HippoRAG's gains with 1,913 links against its 196,112: per point of corpus covered, 1.5x the action saving and 2.1x the accuracy gain. Accuracy rises steadily with the share of the corpus the indexes cover, so training on more questions widens coverage, and with it the generalization.
- Abstract(参考訳): Retrieval-augmented Generationは、ドキュメントストアをフリーズインプットとして扱い、その上にビルド構造を行うオフラインパイプラインは、教師なしで構築する。
キュレーターエージェントは、現在のストアに対して監督された質問に回答し、ゴールドの回答を示し、ストアを編集する。
ストアは前進し、我々はテストセットでキュレートされたストアを評価し、2つの汚染のないベンチマーク、KBGym、我々がリリースした架空のユニバースジェネレータ、PhantomWikiで評価する。
一般化には、トレーニングセットとの重複を減少させる4つの質問グループ – トレーニングされた質問自身と、両方のキーをトレーニングで共有する未確認の質問 – が調査されている。
キーが共有されないパリティから+0.176 F1まで、両方のキーがトレーニングされた質問に対して+0.294 F1でのアクションが25%減少し、両方のベンチマークで重要なセルが増加し、一方HippoRAGの利益は196,112のコーパスに対して1,913のリンクで一致した。
インデックスがカバーするコーパスのシェアによって、精度は着実に上昇するので、より多くの質問に対するトレーニングがカバー範囲を広げ、それが一般化される。
関連論文リスト
- Iris: Climbing to the Search Frontier [21.066541702697112]
我々は35B-A3Bスケールと397B-A17Bスケールでトレーニングされた2つの検索エージェントであるIris-miniとIris-proを紹介する。
論文 参考訳(メタデータ) (2026-09-03T17:51:01Z) - Extractable Memorization From First Principles [66.10415626674103]
一致した比較が厳密で校正された暗記の主張を可能にすることを示す。
我々は「抽出可能な記憶」を洗練し、有効な記憶のクレームとほぼ確実な生成を必要とする。
論文 参考訳(メタデータ) (2026-07-14T11:31:36Z) - Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation [0.0]
4つのコーパスの4つのバージョンは、エージェントがどのようにコンテンツに到達するかにのみ異なる、事前登録されたアブレーションを実行する。
私たちは、家族横断の裁判官で検証された金の基準に対して盲目で答える。
この研究は、評価の妥当性に関するケーススタディとして、それを作成したツールに脅威と妥当性の規律を適用した。
論文 参考訳(メタデータ) (2026-07-06T01:03:27Z) - Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA [40.94400211806987]
言語モデルは、QA(Synthetic Question Aswer)の監督によって、ますます教えられている。
この生成ステップが中立的な前処理ではないことを示す。
このような障害モードは,QA生成時の選択から発生し,トレーニングループを変更することなく低減できることを示す。
論文 参考訳(メタデータ) (2026-06-30T17:35:14Z) - QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards [68.15832368034815]
クエリとルーブリックを共同設計するフレームワークを提案する。
QUBRICはSFTベースラインよりもアリーナハードで+5.5ポイントのゲインを達成している。
論文 参考訳(メタデータ) (2026-06-02T17:53:04Z) - Dynamic Mixture of Latent Memories for Self-Evolving Agents [57.20419419302731]
MoLEMは、動的混合(MoE)に基づく潜在メモリフレームワークの生成混合物である。
我々は、数学、科学、コードドメインにまたがる連続的な学習シーケンスに基づいて、このフレームワークを訓練する。
連続学習を完了した後、Vanilla事前学習ベースラインよりも平均精度を10.40%向上させる。
論文 参考訳(メタデータ) (2026-05-21T03:35:10Z) - HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help? [32.54022440678003]
コーディングエージェントは、完全なコンテキストが与えられたときに複雑なタスクを解決します。
現在のベンチマークは、この障害モードに盲目です。
我々はこの選択的エスカレーションスキルを測定するためにHiL-Benchを提案する。
論文 参考訳(メタデータ) (2026-04-10T15:21:44Z) - Gradient Atoms: Unsupervised Discovery, Attribution and Steering of Model Behaviors via Sparse Decomposition of Training Gradients [0.0]
トレーニングデータ属性(TDA)メソッドは、モデルの振る舞いにどのトレーニングドキュメントが責任を持つかを問う。
ドキュメントごとのトレーニング勾配をスパースコンポーネントに分解する、教師なしの方法であるGradient Atomsを提案する。
500個の発見原子のうち、最も高いコヒーレンスな原子は、行動ラベルなしで解釈可能なタスクタイプの挙動を回復する。
論文 参考訳(メタデータ) (2026-03-15T23:39:36Z) - Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models [64.49342399229529]
我々は、ポストホック帰属を推論問題として再編成し、回答を構成単位に分解し、それぞれ特定の文脈に結び付けることができると論じる。
DecompTuneは、モデルに中間的推論ステップとして解解分解を生成することを教えるポストトレーニング手法である。
DecompTuneは、広範な実験と改善を通じて、属性の品質を大幅に改善し、先行手法より優れ、最先端のフロンティアモデルに適合または超えている。
論文 参考訳(メタデータ) (2025-10-29T17:58:59Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - ConfRAG: Confidence-Guided Retrieval-Augmenting Generation [41.78313747240249]
複数の事実性ベンチマークで幻覚率を20~40%から5%以下に下げる微調整戦略であるConfQAを紹介した。
モデルが不確実に応答した場合のみRAGを起動するトリガー戦略であるConfRAGを提案する。
この枠組みは、不要な外部検索を30%以上削減しつつ、理想的な場合において95%以上の精度を達成する。
論文 参考訳(メタデータ) (2025-06-08T22:51:46Z) - The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning [86.19804569376333]
インストラクションチューニングにおいてゼロショットの一般化は非常に早い段階で起こることを示す。
より基礎的なトレーニングデータアレンジメントフレームワークであるテスト中心型マルチターンアレンジメントを提案する。
論文 参考訳(メタデータ) (2024-06-17T16:40:21Z) - Infinite dSprites for Disentangled Continual Learning: Separating Memory Edits from Generalization [36.23065731463065]
Infinite dSpritesは任意の長さの連続的な分類ベンチマークを作成するための擬似ツールである。
この単純なベンチマークでは、十分に長い時間をかけて、全ての主要な連続学習手法の性能が低下していることが示される。
生成因子を直接監督した簡単な設定では、学習階級に依存しない変換が破滅的な忘れを回避できる方法を示している。
論文 参考訳(メタデータ) (2023-12-27T22:05:42Z) - KEPR: Knowledge Enhancement and Plausibility Ranking for Generative
Commonsense Question Answering [11.537283115693432]
本稿では,ジェネレート・Then-Rankパイプラインアーキテクチャに基づく知識向上と可視性ランキング手法を提案する。
具体的には、キーワードのWiktionary Commonsense知識の観点から質問を拡張し、正規化パターンで修正する。
ELECTRAに基づく回答ランキングモデルを構築し、学習中にロジスティック回帰を行う。
論文 参考訳(メタデータ) (2023-05-15T04:58:37Z) - Multifaceted Improvements for Conversational Open-Domain Question
Answering [54.913313912927045]
対話型オープンドメイン質問回答(MICQA)のための多面的改善フレームワークを提案する。
第一に、提案したKL分割に基づく正規化は、検索と解答のためのより良い質問理解をもたらすことができる。
第二に、追加されたポストランカモジュールは、より関連性の高いパスをトップにプッシュし、2アスペクトの制約で読者に選択できる。
第3に、十分に設計されたカリキュラム学習戦略は、訓練と推論の黄金の通路設定のギャップを効果的に狭め、黄金の通路支援なしで真の答えを見つけることを奨励する。
論文 参考訳(メタデータ) (2022-04-01T07:54:27Z) - C-MORE: Pretraining to Answer Open-Domain Questions by Consulting
Millions of References [47.20656650130518]
主な課題は、タスク固有のアノテーションを使わずに、高品質な質問-回答-コンテキスト三つ子を構築する方法である。
本研究では,ウィキペディアで引用される数百万の参照を参考に,3つの基準をすべて満たす大規模コーパスを自動構築する。
事前学習したレトリバーは,トップ20の精度で2%~10%の絶対ゲインを達成し,事前学習した読者では,システム全体の一致率を最大4%向上させる。
論文 参考訳(メタデータ) (2022-03-16T20:30:05Z) - Question Answering over Electronic Devices: A New Benchmark Dataset and
a Multi-Task Learning based QA Framework [18.255521820251733]
我々は307,957個のEマニュアルからなる巨大なコーパスを作成し、この大きなコーパス上でRoBERTaを事前訓練する。
EMQAP(E-Manual Question Answering Pipeline)を導入し、電子機器に関する質問に答える。
E- Manual Annotated Question-Awer pairs に対して,ROUGE-L F1 スコアは最も競争力のあるベースラインよりも約40%向上した。
論文 参考訳(メタデータ) (2021-09-13T12:11:39Z) - Learning with Instance Bundles for Reading Comprehension [61.823444215188296]
質問応答スコアを複数の関連インスタンスで比較する新しい監視手法を提案する。
具体的には、密接に対照的な質問や回答のさまざまな近所でこれらのスコアを正規化します。
2つのデータセット上のインスタンスバンドルによるトレーニングの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2021-04-18T06:17:54Z) - Generating Fact Checking Briefs [97.82546239639964]
本研究では, 事実確認の精度と効率を高めるために, 事実確認を行う前に, クレームに関する情報を提供することにより, 事実確認の精度と効率を高める方法について検討する。
我々は,クレームに条件付き質問セットを生成し,証拠を検索し,回答を生成するモデルQABrieferを開発した。
本研究では,特にQABriefsにおけるブリーフィングによる事実チェックによって,クラウドワーカーの精度が10%向上すると同時に,時間もわずかに低下することを示す。
論文 参考訳(メタデータ) (2020-11-10T23:02:47Z) - Few-Shot Complex Knowledge Base Question Answering via Meta
Reinforcement Learning [55.08037694027792]
複雑な質問答え(CQA)は、知識ベース(KB)上の複雑な自然言語質問に答える。
従来のニューラルプログラム誘導(NPI)アプローチは、質問の種類が異なる場合、不均一なパフォーマンスを示す。
本稿では,CQAにおけるプログラム誘導のためのメタ強化学習手法を提案する。
論文 参考訳(メタデータ) (2020-10-29T18:34:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。