論文の概要: PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation
- arxiv url: http://arxiv.org/abs/2606.24346v1
- Date: Tue, 23 Jun 2026 09:37:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.860632
- Title: PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation
- Title(参考訳): PETRA: 石油工学ドメイン適応のためのWebテキスト変換
- Authors: Kirill Dubovikov, Omar El Mansouri, Hachem Madmoun, Yanda Li, Sandeep Kumar, Aya El Mir, Supriyo Ghosh, Writabrata Bhattacharya, Adrian Garcia-Garcia, Onkar Pandit, Sunil Kumar Sahu, Federico Castanedo, Larry Murray, Martin Takac, Salem Lahlou,
- Abstract要約: 本稿では,大規模石油工学テキストであるPETRAを提案する。
ノイズの多い公開Webデータをキュレートされたドメインコーパスに変換し、高密度検索と再ランク付けのための合成監視を行う。
1.36Mのキュレートされたチャンク、約2Bのトークン等価値、$approx$859k、$approx$224kアンカーからのトレーニング行の埋め込み、約400kの教師がマークしたリランカ候補行が含まれる。
- 参考スコア(独自算出の注目度): 5.753093060227048
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Petroleum-engineering search exposes a supervision gap for strong general retrievers: relevant evidence exists in public web text, but domain relevance labels are scarce. To address this gap, we propose PETRA, a large-scale Petroleum Engineering Text for Retrieval Adaptation dataset and pipeline that converts noisy public web data into a curated domain corpus and synthetic supervision for dense retrieval and reranking. PETRA contains 1.36M curated chunks, approximately 2B token equivalents, $\approx$859k, embedding training rows from $\approx$224k anchors, and roughly 400k teacher-scored reranker candidate rows. Its construction combines high-recall energy-domain curation, an energy-domain classifier with 98.4% test accuracy, chunk-grounded query generation, LLM-written hard negatives, and retrieval-mined candidate lists. PETRA improves first-stage in-domain Normalized Discounted Cumulative Gain (nDCG) from 0.703 to 0.763 through score fusion. Reranker adaptation improves the public Earth Science benchmark by 44% relative and a six-task reasoning-intensive panel by 23%. Failed training recipes show that high train-holdout accuracy on synthetic labels does not predict retrieval gains; retrieval-mined data helps only after being repackaged as teacher-scored candidate lists sampled from the inference-time candidate distribution.
- Abstract(参考訳): 石油エンジンによる検索は、強力な一般検索者に対する監督のギャップを露呈する:関連する証拠は、パブリックウェブテキストに存在しているが、ドメイン関連ラベルは少ない。
このギャップに対処するため,大規模な検索適応データセットとパイプラインのための石油工学テキストであるPETRAを提案し,ノイズの多い公開Webデータをキュレートされたドメインコーパスに変換し,高密度検索と再ランク付けのための総合的な監視を行う。
PETRAには、1.36Mのキュレートされたチャンク、約2Bのトークン相当、$\approx$859k、$\approx$224kアンカーからのトレーニング行の埋め込み、約400kの教師によるリランカー候補行が含まれている。
その構成には、高リコールエネルギードメインキュレーション、98.4%のテスト精度のエネルギードメイン分類器、チャンクグラウンドクエリ生成、LSMで書き直されたハードネガティブ、検索マイニングされた候補リストが組み合わされている。
PETRAは、スコア融合により、第1段階のドメイン正規化カウント累積ゲイン(nDCG)を0.703から0.763に改善する。
リランカーの適応は、パブリックアース・サイエンスのベンチマークを44%改善し、6タスクの推論集約パネルを23%改善した。
学習レシピの欠陥は, 合成ラベル上での列車留置精度が高いと検索ゲインを予測できないことを示し, 検索マイニングされたデータは, 推論時候補分布からサンプリングした教師付候補リストとして再パッケージされた後にのみ有効である。
関連論文リスト
- When More Documents Hurt RAG: Mitigating Vector Search Dilution with Domain-Scoped, Model-Agnostic Retrieval [2.8753422388037486]
Retrieval-augmentedジェネレーションは、大規模なドキュメントコレクションにスケールすると劣化する。
Top-k検索は意味的に似ているが、文脈的に正しくないチャンクを返す。
本稿では,MASDR-RAG(Multi-Agent Scoped Domain Retrieval for RAG)を提案する。
論文 参考訳(メタデータ) (2026-06-09T18:26:24Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - EmbGen: Teaching with Reassembled Corpora [0.300988853836121]
コーパスをエンティティ記述ペアに分解する合成データ生成パイプラインであるEmbGenを紹介する。
EmbGen を EntiGraph,InstructLab,Knowledge-Instruct に対して,多種多様な意味的不均一性のデータセット上で評価する。
論文 参考訳(メタデータ) (2026-05-19T05:40:12Z) - Mira-Embeddings-V1: Domain-Adapted Semantic Reranking for Recruitment via LLM-Synthesized Data [12.621394200451613]
採用ドメインのセマンティックリグレードシステムであるmira-embeddings-v1を提案する。
実際のJDから始めて、5段階のプロンプトパイプラインを構築し、さまざまな正と強のサンプルを生成する。
次に、JD--JDコントラストトレーニングとJD--CVトリプルトアライメントの2ラウンドLoRA適応を適用した。
論文 参考訳(メタデータ) (2026-04-20T02:51:12Z) - Test-Time Strategies for More Efficient and Accurate Agentic RAG [58.44913384057518]
Retrieval-Augmented Generation (RAG) システムは複雑なマルチホップ問題に直面している。
このような手法は、以前に処理された情報の反復的な検索を含む非効率性を導入することができる。
本稿では,これらの問題を軽減するために,サーチ-R1パイプラインに対するテスト時間修正について検討する。
論文 参考訳(メタデータ) (2026-03-12T19:18:59Z) - Adaptation of Embedding Models to Financial Filings via LLM Distillation [10.744318713371383]
本稿では,基礎として汎用検索埋め込みモデルを用いて,ラベルなしコーパスから特殊モデルを訓練するスケーラブルパイプラインを提案する。
MRR$textt@$5で平均27.7%,DCG$textt@$5で平均44.6%,21,800以上のクエリドキュメントペアで測定された14のファイナンシャルファイリングタイプに対して平均44.6%の改善が得られた。
論文 参考訳(メタデータ) (2025-12-08T22:43:14Z) - AIRwaves at CheckThat! 2025: Retrieving Scientific Sources for Implicit Claims on Social Media with Dual Encoders and Neural Re-Ranking [0.0]
Team AIRwavesはCLEF-2025 CheckThat! LabのSubtask 4bで2位にランクインした。
このベースラインを超えるために、 (i) E5-largeをベースとしたデュアルエンコーダを使用する第1ステージ、および (i) SciBERTクロスエンコーダを用いて、バッチとマイニングされたハードネガを使用して微調整を行い、チャンクトークン化とリッチドキュメントメタデータによって強化された第1ステージ、 (ii) ニューラルネットワーク再ランクステージを導入する。
論文 参考訳(メタデータ) (2025-09-23T19:26:31Z) - Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models [92.85086256871027]
我々は,低品質な文書を学習に役立てるために, guIded Rewrite で Web をリサイクルする REWIRE を提案する。
混在するテキストの約82%が、そうでなければ破棄されるであろう、低品質なドキュメントを変換することによるものであることを実証しています。
論文 参考訳(メタデータ) (2025-06-05T07:12:12Z) - Paloma: A Benchmark for Evaluating Language Model Fit [112.481957296585]
言語モデル (LM) の評価では、トレーニングから切り離されたモノリシックなデータに難易度が報告されるのが一般的である。
Paloma(Perplexity Analysis for Language Model Assessment)は、546の英語およびコードドメインに適合するLMを測定するベンチマークである。
論文 参考訳(メタデータ) (2023-12-16T19:12:45Z) - Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting [65.00288634420812]
Pairwise Ranking Prompting (PRP)は、大規模言語モデル(LLM)の負担を大幅に軽減する手法である。
本研究は,中等級のオープンソースLCMを用いた標準ベンチマークにおいて,最先端のランク付け性能を達成した文献としては初めてである。
論文 参考訳(メタデータ) (2023-06-30T11:32:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。