論文の概要: SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking
- arxiv url: http://arxiv.org/abs/2609.03047v1
- Date: Wed, 02 Sep 2026 18:17:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.825844
- Title: SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking
- Title(参考訳): SHELF: マルチタスク書誌ベンチマークのための合成的ハーネス
- Authors: Michael J. Bommarito,
- Abstract要約: SHELFは、ラベル付き予算、仕様書、データ生成をベンチマークデータと評価タスクに変換するPythonシステムである。
この最初のリリースには、議会図書館の語彙に基づく62,899のモデル文書が含まれている。
TFBench, TF-IDF, BM25, 一般的なエンコーダと, 対象分類のみにおいてゼロショットデコーダを比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Libraries and archives manage large collections with limited staff and computing budgets, yet common benchmarks do not systematically test their bibliographic work. They need to know which methods work for their tasks and what those methods require to run. SHELF, the Synthetic Harness for Evaluating LLM Fitness, addresses this gap. It is a Python system that turns labelled taxonomies, writing specifications, and a generation budget into controlled benchmark data and evaluation tasks. This first release contains 62,899 model-written documents based on Library of Congress vocabularies, with tasks for classification, clustering, retrieval, pair classification, and instruction retrieval. We compare TF, TF-IDF, BM25, popular encoders, and, on subject classification only, zero-shot decoders; each method appears only on tasks that support it. Subject classification reaches 0.8887, while genre-form classification reaches only 0.2605, and several pair and clustering tasks remain near chance. Sparse methods remain competitive on classification, while TF-IDF is the fastest measured arm in the subject timing experiment. SHELF also varies bibliographic facets independently and can generate new, verifiably unseen documents after a model's training cutoff. Comparisons with LCSHBench and Project Gutenberg show that model rankings transfer more reliably than absolute scores, but SHELF scores do not estimate accuracy on production catalogue data. We release all source code and data under permissive licenses on GitHub and Hugging Face.
- Abstract(参考訳): 図書館とアーカイブは、限られたスタッフと計算予算で大規模なコレクションを管理しているが、一般的なベンチマークは、彼らの書誌業務を体系的にテストしていない。
タスクにどのメソッドが動作するのか、そのメソッドが実行する必要があるのかを知る必要がある。
SHELF(Synthetic Harness for Evaluating LLM Fitness)はこのギャップに対処する。
ラベル付き分類、仕様書、生成予算を制御されたベンチマークデータと評価タスクに変換するPythonシステムである。
この最初のリリースには、分類、クラスタリング、検索、ペア分類、命令検索のタスクを含む、議会図書館の語彙に基づく62,899のモデル記述ドキュメントが含まれている。
TF, TF-IDF, BM25, 一般的なエンコーダと, 対象分類のみのゼロショットデコーダを比較する。
対象分類は0.8887に達し、ジャンル形式分類は0.2605に過ぎず、いくつかのペアとクラスタリングタスクは近い確率で残っている。
TF-IDFは被験者タイミング実験において最速の計測アームである。
SHELFはまた、書誌の面も独立して変化し、モデルのトレーニングの切り離し後に、新しい、検証不可能な文書を生成することができる。
LCSHBenchやProject Gutenbergと比較すると、モデルランキングは絶対スコアよりも確実に伝達されるが、SHELFスコアは生産カタログデータの正確さを推定しない。
私たちはすべてのソースコードとデータをGitHubとHugging Faceでパーミッシブライセンスでリリースしています。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - ReLeVAnT: Relevance Lexical Vectors for Accurate Legal Text Classification [5.530730417910086]
ReLeVAnTは法的文書バイナリ分類のためのフレームワークである。
n-gram処理、コントラストスコアマッチング、および差別的分類の原動力として浅いニューラルネットワークを使用する。
99.3%の精度と98.7%のF1スコアがLexGLUEデータセットにある。
論文 参考訳(メタデータ) (2026-04-24T07:13:24Z) - Efficient Few-shot Learning for Multi-label Classification of Scientific Documents with Many Classes [44.51779041553597]
FusionSentは、多くのクラスで科学文書を数ショットで分類するための効率的かつ迅速なアプローチである。
実験の結果、FusionSentは平均6.0$$F_1$labelポイントで強いベースラインを著しく上回ることがわかった。
論文 参考訳(メタデータ) (2024-10-08T07:52:35Z) - Blueprinting the Future: Automatic Item Categorization using
Hierarchical Zero-Shot and Few-Shot Classifiers [6.907552533477328]
本研究では,ゼロショットおよび少数ショット生成事前学習変換器(GPT)を用いた階層的項目分類手法を提案する。
検査ブループリントの階層的な性質はシームレスにナビゲートされ、複数のレベルの項目を階層的に分類することができる。
人工データによる初期シミュレーションは、この方法の有効性を示し、F1スコアで測定された平均精度92.91%を達成する。
論文 参考訳(メタデータ) (2023-12-06T15:51:49Z) - Zero-Shot Listwise Document Reranking with a Large Language Model [58.64141622176841]
本稿では,タスク固有の学習データを用いることなく,言語モデル(LRL)を用いたリスワイズ・リランカを提案する。
3つのTRECウェブサーチデータセットの実験により、LRLは第1段検索結果の再ランク付け時にゼロショットポイントワイズ法より優れるだけでなく、最終段再ランカとしても機能することが示された。
論文 参考訳(メタデータ) (2023-05-03T14:45:34Z) - Precise Zero-Shot Dense Retrieval without Relevance Labels [60.457378374671656]
仮説文書埋め込み(英: hypothetical Document Embeddings, HyDE)は、ゼロショット高密度検索システムである。
我々は,HyDEが最先端の非教師付き高密度検索器であるContrieverを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2022-12-20T18:09:52Z) - Evaluating the Factual Consistency of Large Language Models Through News
Summarization [97.04685401448499]
本稿では,要約タスクに着目したFIB(Factual Inconsistency Benchmark)と呼ばれる新しいベンチマークを提案する。
現実的に一貫した要約では、手作業で事実的に一貫したものとして検証する、人書きの参照要約を使用します。
現実的に矛盾しない要約に対して、我々は、事実的に矛盾しているとして手動で注釈付けした一連の要約モデルから要約を生成する。
論文 参考訳(メタデータ) (2022-11-15T18:50:34Z) - Self-Adaptive Label Augmentation for Semi-supervised Few-shot
Classification [121.63992191386502]
Few-shotの分類は、ラベル付きサンプルがわずかにあれば、新しいタスクをうまく一般化できるモデルを学ぶことを目的としている。
そこで本研究では,手動で定義した指標を用いて,ラベルのない各サンプルに適切なラベルを割り当てる半教師付き小ショット分類手法を提案する。
SALAの目新しいところは、タスク適応計量であり、エンドツーエンドの方法で異なるタスクに対するメトリックを適応的に学習することができる。
論文 参考訳(メタデータ) (2022-06-16T13:14:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。