論文の概要: SinBrief: A Hybrid Framework for Abstractive Text Summarisation of Sinhala Legal Documents
- arxiv url: http://arxiv.org/abs/2609.32397v1
- Date: Sat, 26 Sep 2026 09:17:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 09:32:30.466723
- Title: SinBrief: A Hybrid Framework for Abstractive Text Summarisation of Sinhala Legal Documents
- Title(参考訳): SinBrief: Sinhala法定文書の抽象化テキスト要約のためのハイブリッドフレームワーク
- Abstract要約: SinBriefは、人間による注釈付きトレーニングデータを必要としない、シンハラの法的文書のためのハイブリッド抽象的な要約フレームワークである。
このフレームワークは、カバレッジ、密度、圧縮比、SummaC、Self-BertScoreなどの基準のないメトリクスを使用して、シンハラの法定コーパスで評価される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Legal document summarisation in low-resource languages presents significant challenges due to the scarcity of annotated data and the complexity of domain-specific terminology. This paper presents SinBrief, a hybrid abstractive summarisation framework for Sinhala legal documents that does not require human-annotated training data. The proposed framework combines domain-aware word graph construction with neural sentence scoring to generate abstractive summaries from Sinhala legal text. Five sentence scoring models are evaluated within the framework: mBert, Llama 3.1, Falcon 7B, Laser, and a continually pre-trained Llama model domain-adapted to Sinhala legal text. The framework is evaluated on a Sinhala legal corpus using reference-free metrics, including Coverage, Density, Compression Ratio, SummaC, and Self-BertScore. Experimental results demonstrate that SinBrief produces summaries with lower lexical overlap than extractive baselines while maintaining factual consistency, demonstrating the viability of hybrid, largely annotation-free abstractive summarisation for low-resource legal NLP tasks.
- Abstract(参考訳): 低リソース言語における法的文書要約は、注釈付きデータの不足とドメイン固有の用語の複雑さにより、重大な課題を呈している。
SinBriefはSinhala法定文書のハイブリッド要約フレームワークであり,人手による注釈付きトレーニングデータを必要としない。
提案フレームワークは,ドメイン認識型単語グラフ構築とニューラル文スコアリングを組み合わせて,Sinhala法文から抽象的な要約を生成する。
mBert, Llama 3.1, Falcon 7B, Laser, および Sinhala 法文に適応したLlama モデルである。
このフレームワークは、カバレッジ、密度、圧縮比、SummaC、Self-BertScoreなどの基準のないメトリクスを使用して、シンハラの法定コーパスで評価される。
実験結果から,SinBrief は抽出ベースラインよりも低語彙重なりの要約を生成できるが,実際の一貫性は保たれている。
関連論文リスト
- Using Multimodal and Language-Agnostic Sentence Embeddings for Abstractive Summarization [10.892363692521222]
抽象的な要約は、新しい文を作成することによって簡潔な要約を生成することを目的としており、柔軟な言い換えが可能である。
このアプローチは不正確さ、特にモデルが存在しない情報を導入する幻覚に対して脆弱である可能性がある。
我々は、LaBSE、SONAR、BGE-M3といった事前訓練されたモデルから派生した多モーダルおよび多言語文の埋め込みを利用し、それらを修正されたBARTベースのフランス語モデルに供給する。
デコーダ入力にトークン化された名前付きエンティティを付加する名前付きエンティティ注入機構を導入し、生成された要約の実際の一貫性を改善する。
論文 参考訳(メタデータ) (2026-03-09T11:55:32Z) - AugAbEx : Way Forward for Extractive Case Summarization [4.0360727591181]
本研究の目的は,抽象要約を含む既存の7つの事例要約データセットを,対応する抽出要約を組み込むことで拡張することである。
我々は、研究コミュニティが使うために、パブリックドメインで拡張データセットをリリースすることを約束します。
論文 参考訳(メタデータ) (2025-11-15T16:49:42Z) - Context-Aware Hierarchical Merging for Long Document Summarization [56.96619074316232]
本論文では,階層的なマージをソース文書からコンテキストと統合する手法を提案する。
法的および物語的領域を表すデータセットの実験結果は、文脈的拡張がゼロショットと階層的な融合ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-02-03T01:14:31Z) - FENICE: Factuality Evaluation of summarization based on Natural language Inference and Claim Extraction [85.26780391682894]
自然言語推論とクレーム抽出(FENICE)に基づく要約のファクチュアリティ評価を提案する。
FENICEは、ソース文書内の情報と、要約から抽出されたクレームと呼ばれる一連の原子的事実との間のNLIベースのアライメントを利用する。
我々の測定基準は、事実性評価のためのデファクトベンチマークであるAGGREFACTに関する新しい技術状況を設定する。
論文 参考訳(メタデータ) (2024-03-04T17:57:18Z) - AMRFact: Enhancing Summarization Factuality Evaluation with AMR-Driven Negative Samples Generation [57.8363998797433]
抽象的意味表現(AMR)を用いた摂動要約を生成するフレームワークであるAMRFactを提案する。
提案手法は,AMRグラフに一貫した要約を解析し,制御された事実不整合を注入して負の例を生成し,一貫性のない事実不整合要約を高い誤差型カバレッジで生成する。
論文 参考訳(メタデータ) (2023-11-16T02:56:29Z) - Unsupervised Abstractive Summarization of Bengali Text Documents [0.5249805590164901]
ベンガル文字文書の単一文書設定におけるグラフに基づく教師なし抽象要約システムを提案する。
また、文書と要約のペアによる人間注釈付きデータセットを提供し、我々の抽象モデルを評価し、ベンガル語における将来の抽象的な要約システムの比較を支援する。
論文 参考訳(メタデータ) (2021-01-26T11:41:28Z) - Bengali Abstractive News Summarization(BANS): A Neural Attention
Approach [0.8793721044482612]
本稿では,エンコーダ・デコーダに着目したSeq2seqベースのLong Short-Term Memory(LSTM)ネットワークモデルを提案する。
提案システムでは,単語の長い列を人文や人文で生成する,局所的な注意に基づくモデルを構築している。
また,Bangla.bdnews24.com1から収集した19k以上の記事とそれに対応する人文要約のデータセットも作成した。
論文 参考訳(メタデータ) (2020-12-03T08:17:31Z) - Constrained Abstractive Summarization: Preserving Factual Consistency
with Constrained Generation [93.87095877617968]
本稿では,抽象要約の現実的一貫性を保ちつつ,制約付き抽象要約(CAS)を提案する。
我々は、CASを満たすために、一般的に自己回帰生成モデルに適用される語彙制約付き復号法を採用する。
対話的要約において1つの手動制約のみを使用する場合、最大13.8ROUGE-2ゲインを観測する。
論文 参考訳(メタデータ) (2020-10-24T00:27:44Z) - Extractive Summarization as Text Matching [123.09816729675838]
本稿では,ニューラル抽出要約システムの構築方法に関するパラダイムシフトを作成する。
抽出した要約タスクを意味テキストマッチング問題として定式化する。
我々はCNN/DailyMailの最先端抽出結果を新しいレベル(ROUGE-1の44.41)に推し進めた。
論文 参考訳(メタデータ) (2020-04-19T08:27:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。