論文の概要: Trilingual Topic Modeling of Sri Lankan Parliamentary Debates
- arxiv url: http://arxiv.org/abs/2608.20365v2
- Date: Wed, 26 Aug 2026 10:42:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.284145
- Title: Trilingual Topic Modeling of Sri Lankan Parliamentary Debates
- Title(参考訳): スリランカ議会討論会におけるトリリンガル・トピック・モデリング
- Abstract要約: スリランカの議会討論会(ハンサード)は、シンハラ、タミル、英語における演説の3言語コーパスを構成する。
LLMベースのテキスト抽出により,これらの課題に対処するエンドツーエンドフレームワークを提案する。
ハイブリット・セマンティック・レキシカルな拡張であるBiTopicは、解釈性を改善し、ノイズとして捨てられた音声を復元する。
- 参考スコア(独自算出の注目度): 1.4340451629409516
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sri Lankan parliamentary debates (Hansards) constitute a trilingual corpus of speeches in Sinhala, Tamil, and English, including code-mixed content, yet remain inaccessible to standard NLP pipelines due to layout-complex PDFs, multilingual scripts, and agglutinative morphology. We present an end-to-end framework that addresses these challenges through LLM-based text extraction followed by a multilingual embedding and density-based clustering pipeline for topic modeling. A hybrid semantic-lexical extension, BiTopic, is further explored to improve interpretability and recover speeches otherwise discarded as noise. Applied to 19,553 speeches spanning 2017-2026, the pipeline recovers 30 macro-topics achieving a cluster purity (BCP) of 0.673, whose temporal trajectories align unsupervised with major national events including the 2019 Easter Sunday attacks and the 2022 economic crisis. Traditional LDA fails on this corpus due to cross-lingual fragmentation, whereas the proposed approach successfully identifies thematic structure across all three languages without supervision.
- Abstract(参考訳): スリランカの議会討論会(ハンサード)は、シンハラ、タミル、英語の3言語コーパスを構成し、コード混成コンテンツを含むが、レイアウトが複雑であるPDF、多言語スクリプト、凝集形態学のために標準のNLPパイプラインにはアクセスできない。
トピックモデリングのための多言語埋め込みと密度クラスタリングパイプラインにより、LLMベースのテキスト抽出によってこれらの課題に対処するエンドツーエンドフレームワークを提案する。
ハイブリット・セマンティック・レキシカルな拡張であるBiTopicは、解釈性を改善し、ノイズとして捨てられた音声を復元する。
2017-2026年にわたる19,553のスピーチに応用され、2019年のイースター・サンデー攻撃や2022年の経済危機など、主要な国家イベントと無監督の時間的軌跡を合わせる、クラスタ純度(BCP)が0.673に達する30のマクロトピックを回復した。
従来のLDAは言語間断片化のためこのコーパスでは失敗するが,提案手法では教師なしの3言語にまたがるテーマ構造の同定に成功している。
関連論文リスト
- Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning [80.05116806217397]
大言語モデル(LLM)のアンラーニングは、汎用性を保ちながら、目標とする知識を抑えることを目的としている。
CLLPU(Cross-Lingual and Language-Bound Protocol for LLM Unlearning)は,この問題を2つの設定で定式化する多言語ベンチマークである。
目標とする知識がすべての言語で抑制されるべき共通目標の忘れ、言語条件の忘れ、抑圧は指定された言語に限定されるべきである。
論文 参考訳(メタデータ) (2026-09-05T08:26:15Z) - MIPIAD: Multilingual Indirect Prompt Injection Attack Defense with Qwen -- TF-IDF Hybrid and Meta-Ensemble Learning [0.7161783472741748]
MIPIADは英語とバングラ語で評価された防衛フレームワークである。
これは、Qwen2.5-1.5BからLoRA(XLPID)、TF-IDFレキシカル特徴、検証調整アンサンブルを通じて微調整されたシーケンスを組み合わせたものである。
論文 参考訳(メタデータ) (2026-05-08T05:34:28Z) - BiST: A Gold Standard Bangla-English Bilingual Corpus for Sentence Structure and Tense Classification with Inter-Annotator Agreement [0.17398560678845076]
BiSTは文レベルの文法分類のための厳格に硬化したバングラ英語コーパスである。
コーパスは、オープンライセンスの百科事典ソースと自然に書かれた会話テキストからコンパイルされる。
BiSTは、制御されたテキスト生成、自動フィードバック生成、言語間表現学習を含む文法モデリングタスクをサポートする。
論文 参考訳(メタデータ) (2026-04-06T14:22:46Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - Bolbosh: Script-Aware Flow Matching for Kashmiri Text-to-Speech [2.00542420408131]
カシミリ語は700万人ほどが話しているが、音声技術には批判的だ。
Kashmiri用に設計された,オープンソースのニューラルネットワークシステムについて紹介する。
論文 参考訳(メタデータ) (2026-03-08T07:34:15Z) - MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation [78.75809158246723]
本稿では,SLGのためのマスク付き拡散型言語モデルであるMaDiSについて述べる。
また,トークン・ラテント・ヘアリング・3次元空間の目的から共同で学習する3段階のクロスモーダル事前学習手法を導入する。
MaDiSはDTWエラーと新たに導入された2つのメトリクスであるSiBLEUとSiCLIPを含む複数のメトリクスで優れたパフォーマンスを実現し、推論レイテンシを30%近く削減している。
論文 参考訳(メタデータ) (2026-01-27T13:06:47Z) - Milco: Learned Sparse Retrieval Across Languages via a Multilingual Connector [25.65114670027799]
Learned Sparse Retrieval (LSR) は、2エンコーダの効率と語彙マッチングの透明性を組み合わせている。
MILCOは、異なる言語からのクエリやドキュメントを共通の英語語彙空間にマッピングするLSRアーキテクチャである。
論文 参考訳(メタデータ) (2025-10-01T08:58:25Z) - GemDetox at TextDetox CLEF 2025: Enhancing a Massively Multilingual Model for Text Detoxification on Low-resource Languages [32.22353317193898]
PAN 2025 Multilingual Text Detoxification Challengeについて述べる。
パラメータ効率のよいLoRA SFT微調整を施し、少数ショットやチェーン・オブ・サートのような技法を推し進める。
当社のシステムは、まず、高リソースおよび低リソース言語にランク付けする。
論文 参考訳(メタデータ) (2025-09-24T10:06:40Z) - Multilingual and Explainable Text Detoxification with Parallel Corpora [58.83211571400692]
並列テキストデトックス化コーパスを新しい言語に拡張する。
本研究は, 有毒な文と非有毒な文の両方の記述的特徴について, 自動的, 説明可能な分析を行う。
そこで我々は,Chain-of-Thoughts推論手法に触発された新しいテキスト解毒法を実験した。
論文 参考訳(メタデータ) (2024-12-16T12:08:59Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。