論文の概要: MiqraBERT: Regression-Based Sentence-BERT Finetuning for Biblical Hebrew Parallel Detection
- arxiv url: http://arxiv.org/abs/2606.19638v1
- Date: Wed, 17 Jun 2026 22:31:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.568873
- Title: MiqraBERT: Regression-Based Sentence-BERT Finetuning for Biblical Hebrew Parallel Detection
- Title(参考訳): MiqraBERT:ビブリカル・ヘブライ・パラレル検出のための回帰に基づく文抽出
- Authors: David M. Smiley,
- Abstract要約: 本稿では,AlephBERTから微調整されたSentence-BERTモデルであるMiqraBERTを紹介した。
MiqraBERTは、事前訓練されたベースライン上の分布分離2.7倍を改善し、曖昧なオーバーラップ領域を約24%から約6%に削減する。
ナラティブ・シントロピック・パラレルは87.1%のリコール@10に達し、詩のパラレルは9%以下である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Textual reuse pervades the Hebrew Bible, yet the computational methods used to detect it still rest largely on lexical overlap, and they falter once a parallel involves paraphrase, lexical substitution, or syntactic reworking. This paper introduces MiqraBERT, a Sentence-BERT model finetuned from AlephBERT (a Modern Hebrew encoder) for verse-level semantic similarity in Biblical Hebrew. The training set comprises 1,650 labeled verse and half-verse pairs: 825 true parallels drawn from the Chronicles synoptic material and from foundational studies of poetic parallelism, balanced against 825 randomly sampled negatives. Through cosine-similarity regression, the model learns an embedding space in which parallel verses cluster together and unrelated verses move apart. We evaluate separation with distribution-based metrics, Wasserstein distance and the overlap coefficient, across ten random seeds. MiqraBERT improves distributional separation 2.7-fold over the pre-trained baseline and reduces the ambiguous overlap region from roughly 24% to about 6%. Narrative synoptic parallels reach a recall@10 of 87.1%; poetic parallels remain difficult, below 9%. This genre-dependent asymmetry confines the model's reliable scope to narrative textual reuse. MiqraBERT is publicly available at https://huggingface.co/davidmsmiley/MiqraBERT
- Abstract(参考訳): テキストの再利用はヘブライ語聖書に及んでいるが、それを検出するための計算手法は依然として語彙の重複に大きく依存しており、パラフレーズや語彙置換、構文的再構成を一度に繰り返すと混乱する。
本稿では,AlephBERT(現代ヘブライ語エンコーダ)を微調整した文-BERTモデルであるMiqraBERTを紹介する。
トレーニングセットは、1,650個のラベル付き詩と半対からなる: 年代記の合成材料から引かれた825個の真の平行線と、詩の並列性の基礎研究から引き出された825個のランダムサンプリングされた負に対してバランスをとる。
コサイン類似性回帰(cosine-similarity regression)を通じて、モデルは、並列バースがクラスタを一緒に移動し、無関係なバースが分離する埋め込み空間を学習する。
分布に基づく測定値,ワッサーシュタイン距離,重なり係数を用いて10個のランダム種子の分離を評価した。
MiqraBERTは、事前訓練されたベースライン上の分布分離2.7倍を改善し、曖昧なオーバーラップ領域を約24%から約6%に削減する。
ナラティブ・シントロピック・パラレルは87.1%のリコール@10に達し、詩のパラレルは9%以下である。
このジャンルに依存した非対称性は、物語のテキスト再利用に対するモデルの信頼性のあるスコープを限定する。
MiqraBERTはhttps://huggingface.co/davidmsmiley/MiqraBERTで公開されている。
関連論文リスト
- 'The Order in the Horse's Heart': A Case Study in LLM-Assisted Stylometry for the Discovery of Biblical Allusion in Modern Literary Fiction [0.0]
本稿では,コーマック・マッカーシー(Cormac McCarthy)の小説に適用する。
ボトムアップ埋め込みトラックは、逆文書周波数を使用して、キングジェームズ聖書と共有される稀な語彙を識別する。
トップダウンレジスタトラックは、比較のために、マッカーシーの散文を特定の聖書の通路で読み取るようLLMに要求する。
論文 参考訳(メタデータ) (2026-04-21T13:26:46Z) - Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models [0.0]
子ども指向音声で訓練された言語モデルにおいて、相互排他性は参照抑制として機能する。
子指向音声における分布学習は、語彙的排他性よりも反復に基づく参照追跡を生成する。
我々は、参照グラウンドディングは、ナチビストではなく、必要な入力構造に関する実証的な主張であるMEにとって必要な要素であるかもしれないと論じる。
論文 参考訳(メタデータ) (2026-03-14T01:59:50Z) - Semantic Novelty at Scale: Narrative Shape Taxonomy and Readership Prediction in 28,606 Books [0.0]
コーパススケールでの物語構造に関する情報理論的尺度として,各段落の文の埋め込みと前段落の走行セントロイドとのコサイン距離について紹介する。
PG19(1920年以前の英文学)の28,606冊の本に適用し、768次元のSBERT埋め込みを用いて段落レベルのノベルティ曲線を計算し、それぞれを16セグメントのPiecewise Aggregate Approximation (PAA)に還元する。
PAAベクトル上のウォード・リンク・クラスタリングは8つの標準的物語形アーチタイプを明らかにする。
論文 参考訳(メタデータ) (2026-02-24T07:52:35Z) - Intertextual Parallel Detection in Biblical Hebrew: A Transformer-Based Benchmark [0.0]
本研究では,ヘブライ語聖書のテキストパラレルを検出するために,E5,AlephBERT,MPNet,LaBSEなどの事前学習言語モデルの有効性を評価する。
I found that E5 and AlephBERT show promise; E5 excels in parallel detection, while AlephBERT shows strong non-parallel differentiation。
論文 参考訳(メタデータ) (2025-06-30T17:57:27Z) - A Connection Between Learning to Reject and Bhattacharyya Divergences [57.942664964198286]
インプットとラベルの両面で共同理想分布を学習することを検討する。
我々は、拒絶と統計的相違の閾値付けを関連づける。
一般に、バタチャリアの発散による拒絶は、Chowのルールよりも攻撃的でないことが分かる。
論文 参考訳(メタデータ) (2025-05-08T14:18:42Z) - CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation [132.00910067533982]
LM世代におけるリテラルコピーと非リテラルコピーの両方を測定するために設計されたベンチマークであるCopyBenchを紹介する。
リテラル複写は比較的稀であるが、イベント複写と文字複写という2種類の非リテラル複写は、7Bパラメータのモデルでも発生する。
論文 参考訳(メタデータ) (2024-07-09T17:58:18Z) - Relational Sentence Embedding for Flexible Semantic Matching [86.21393054423355]
文埋め込みの可能性を明らかにするための新しいパラダイムとして,文埋め込み(Sentence Embedding, RSE)を提案する。
RSEは文関係のモデル化に有効で柔軟性があり、一連の最先端の埋め込み手法より優れている。
論文 参考訳(メタデータ) (2022-12-17T05:25:17Z) - SLUA: A Super Lightweight Unsupervised Word Alignment Model via
Cross-Lingual Contrastive Learning [79.91678610678885]
超軽量非教師付き単語アライメントモデル(SLUA)を提案する。
いくつかの公開ベンチマークによる実験結果から,我々のモデルは性能が向上しても競争力を発揮することが示された。
特に、我々のモデルはバイリンガル単語の埋め込みと単語のアライメントを統一する先駆的な試みであると認識している。
論文 参考訳(メタデータ) (2021-02-08T05:54:11Z) - Online nonparametric regression with Sobolev kernels [99.12817345416846]
我々は、ソボレフ空間のクラス上の後悔の上限を$W_pbeta(mathcalX)$, $pgeq 2, beta>fracdp$ とする。
上界は minimax regret analysis で支えられ、$beta> fracd2$ または $p=infty$ の場合、これらの値は(本質的に)最適である。
論文 参考訳(メタデータ) (2021-02-06T15:05:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。