論文の概要: Sentence Splitter: Uncovering Latent Factual Structure for Self-Supervised Learning
- arxiv url: http://arxiv.org/abs/2607.19845v1
- Date: Wed, 22 Jul 2026 07:30:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.013695
- Title: Sentence Splitter: Uncovering Latent Factual Structure for Self-Supervised Learning
- Title(参考訳): Sentence Splitter: 自己指導型学習のための潜在現実構造を明らかにする
- Abstract要約: Sentence SplitterはT5ベースのエンコーダ-デコーダアーキテクチャ上に構築された自己教師型フレームワークである。
提案手法は,プレフィックス(頭)と実際の完了(尾)のセマンティック境界を同定する。
構造化テキストと自然発生テキストの両方の実験では、提案されたスプリッターが合成テンプレートを超えて一般化されることが示されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper introduces Sentence Splitter, a self-supervised framework built upon a T5-based encoder--decoder architecture for uncovering the latent factual structure of natural language sentences. The proposed method identifies the semantic boundary between a descriptive prefix (head) and its factual completion (tail) by formulating sentence splitting as a discrete segmentation problem, where a sentence of length $N$ admits $N$ possible split points but only one recovers the intended head--tail structure. Rather than explicitly searching over all candidate boundaries, the model learns to recover the factual completion through probabilistic sequence generation. To eliminate the need for manual annotation, symbolic head--tail pairs are first verbalized into natural-language templates that provide supervision for training the Sentence Splitter. The trained splitter is then applied to raw text to extract aligned prefix--tail pairs, which are subsequently used to train a generative model that proposes additional plausible completions through a lightweight bootstrapping process. This unified pipeline provides a scalable and structure-aware approach to constructing self-supervised training data while bridging symbolic knowledge and natural language. Experiments on both structured and naturally occurring text demonstrate that the proposed splitter generalizes beyond synthetic templates and that the resulting structure-aware supervision consistently improves downstream performance on knowledge graph completion and commonsense question answering, highlighting the effectiveness of recovering latent factual structure for knowledge-centric NLP.
- Abstract(参考訳): 本稿では,T5-based encoder-decoderアーキテクチャを基盤として,自然言語文の潜在的事実構造を明らかにするための自己教師型フレームワークであるSentence Splitterについて紹介する。本提案手法では,文分割を離散分割問題として定式化することで,文分割を行ない,意図した頭字尾構造を復元する。
モデルでは、すべての候補境界を明示的に探索するのではなく、確率的シーケンス生成を通じて事実的完了を回復することを学ぶ。
手動のアノテーションを不要にするため、シンボリックなヘッドテールペアはまず自然言語テンプレートに言語化され、センテンス・スプリッターのトレーニングの監督を提供する。
その後、トレーニングされたスプリッターを原文に適用し、アライメントされたプレフィックス-テールペアを抽出し、その後、軽量なブートストラッププロセスを通じて、追加可能な完了を提案する生成モデルをトレーニングするために使用される。
この統合パイプラインは、シンボリック知識と自然言語をブリッジしながら、自己教師付きトレーニングデータを構築するためのスケーラブルで構造対応のアプローチを提供する。
構造化テキストと自然発生テキストの両方の実験により,提案したスプリッタが合成テンプレートを超えて一般化し,得られた構造認識の監督により,知識グラフの完成度と常識的質問応答の下流性能が一貫して向上し,知識中心NLPにおける潜在事実構造を復元する効果が強調された。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering [51.7493726399073]
本稿では,長文質問応答を改善するための対話型階層型フレームワークを提案する。
このフレームワークには3つの重要な革新がある: 長文の専門的な談話解析、LLMに基づく談話関係ノードの拡張、構造誘導階層検索である。
論文 参考訳(メタデータ) (2025-05-26T14:45:12Z) - On Eliciting Syntax from Language Models via Hashing [19.872554909401316]
教師なし構文解析は、生のテキストから構文構造を推論することを目的としている。
本稿では,本機能を利用して生テキストから解析木を推定する可能性について検討する。
本手法は,事前学習した言語モデルから高品質な構文解析木を低コストで取得する上で,有効かつ効率的であることを示す。
論文 参考訳(メタデータ) (2024-10-05T08:06:19Z) - Unsupervised Morphological Tree Tokenizer [36.584680344291556]
トークン化のための形態的構造ガイダンスを導入し、単語の文字レベル構造を誘導する深層モデルを提案する。
本手法は,アノテート学習データなしで形態素規則に整合した文字レベルの構造を誘導することができる。
実験の結果,提案手法は完全形態素を効果的に保持し,BPEやWordPieceといった広く採用されている手法よりも優れていた。
論文 参考訳(メタデータ) (2024-06-21T15:35:49Z) - Promptly Predicting Structures: The Return of Inference [31.442123334313035]
ゼロショットと少数ショットの言語構造予測器を構築するためのフレームワークを提案する。
その結果, 整合性の維持は構造的に有効であるだけでなく, 性能も向上することがわかった。
論文 参考訳(メタデータ) (2024-01-12T20:08:39Z) - Unsupervised Chunking with Hierarchical RNN [62.15060807493364]
本稿では,非階層的手法で単語をグループ化する構文的タスクであるチャンキングに対する教師なしアプローチを紹介する。
本稿では,単語-チャンク・チャンク-文合成をモデル化した2層階層型階層型リカレントニューラルネットワーク(HRNN)を提案する。
CoNLL-2000データセットの実験では、既存の教師なし手法よりも顕著な改善が見られ、フレーズF1スコアが最大6ポイント向上した。
論文 参考訳(メタデータ) (2023-09-10T02:55:12Z) - Scalable Learning of Latent Language Structure With Logical Offline
Cycle Consistency [71.42261918225773]
概念的には、LOCCOは、トレーニング対象のセマンティクスを使用してラベルなしテキストのアノテーションを生成する、自己学習の一形態と見なすことができる。
追加ボーナスとして、LOCCOによって生成されたアノテーションは、神経テキスト生成モデルをトレーニングするために自明に再利用することができる。
論文 参考訳(メタデータ) (2023-05-31T16:47:20Z) - CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model [55.321010757641524]
CLIP4STRは,CLIPのイメージエンコーダとテキストエンコーダ上に構築された,シンプルで効果的なSTRメソッドである。
モデルサイズ、事前トレーニングデータ、トレーニングデータの観点からCLIP4STRをスケールし、13のSTRベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-05-23T12:51:20Z) - SLM: Learning a Discourse Language Representation with Sentence
Unshuffling [53.42814722621715]
談話言語表現を学習するための新しい事前学習目的である文レベル言語モデリングを導入する。
本モデルでは,この特徴により,従来のBERTの性能が大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-10-30T13:33:41Z) - Extractive Summarization as Text Matching [123.09816729675838]
本稿では,ニューラル抽出要約システムの構築方法に関するパラダイムシフトを作成する。
抽出した要約タスクを意味テキストマッチング問題として定式化する。
我々はCNN/DailyMailの最先端抽出結果を新しいレベル(ROUGE-1の44.41)に推し進めた。
論文 参考訳(メタデータ) (2020-04-19T08:27:57Z) - StructSum: Summarization via Structured Representations [27.890477913486787]
抽象テキスト要約は、長い資料の情報を要約した要約に圧縮することを目的としている。
モデリング技術の進歩にもかかわらず、抽象的な要約モデルは依然としていくつかの重要な課題に悩まされている。
本稿では,これらの課題に対処するための要約のための文書レベルの構造誘導に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2020-03-01T20:32:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。