論文の概要: Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data
- arxiv url: http://arxiv.org/abs/2608.23391v2
- Date: Tue, 25 Aug 2026 15:17:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.307393
- Title: Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data
- Title(参考訳): ドメイン内トレーニングデータを必要としないクロスドメインマルチタスクデータ-テキスト生成
- Authors: Yifei Song, Kun Efimov-Zhang, Claire Gardent,
- Abstract要約: ドメイン内トレーニングテキストもテスト参照も使用できない環境で、ドメイン間D2T生成について検討する。
データ駆動型知識蒸留とゼロショット推論を比較し,ドメイン外D2Tデータの微調整を行う。
5つのベンチマーク実験により、DDKDはモデルサイズが一定であり、微調整とゼロショットの推論の両方で常に優れていた。
- 参考スコア(独自算出の注目度): 8.283940114367677
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Structured data exists in many forms (tables, knowledge graphs, charts, and time series), and converting it into text may involve different generation tasks. However, most prior work on data-to-text (D2T) generation has focused on specific tasks and datasets, relying either on task-specific training data or on the zero-shot capabilities of large language models. We study cross-domain D2T generation in a setting where neither in-domain training text nor test references are available, and where domains, generation goals, and input structures vary substantially. We compare data-driven knowledge distillation (DDKD) against zero-shot inference and fine-tuning on out-of-domain D2T data, and introduce structure-preserving augmentation via structural subsampling and perturbation. Experiments on five benchmarks show that, at constant model size (1.7B parameters), DDKD consistently outperforms both fine-tuning and zero-shot inference. Moreover, the resulting small models outperform a much larger finetuned model on two of the five domains, achieving comparable performance on the remaining three. We further construct QUINTD-5, a fivefold extension of QUINTD-1, and show that simply scaling real target-domain inputs yields only modest gains, whereas our augmentation strategy remains more effective and more cost-efficient for cross-domain distillation.
- Abstract(参考訳): 構造化データは、多くの形式(表、知識グラフ、チャート、時系列)に存在し、それをテキストに変換するには、異なる生成タスクが必要になる可能性がある。
しかしながら、D2T(Data-to-text)生成に関するこれまでの作業は、タスク固有のトレーニングデータや、大規模言語モデルのゼロショット機能に依存する、特定のタスクとデータセットに重点を置いていた。
ドメイン内トレーニングテキストもテストリファレンスも利用できない、ドメイン、生成目標、入力構造が大きく異なる設定でドメイン間D2T生成について検討する。
我々は,データ駆動型知識蒸留(DDKD)とゼロショット推論とドメイン外D2Tデータの微調整を比較し,構造的サブサンプリングと摂動による構造保存強化を導入する。
5つのベンチマークの実験では、一定のモデルサイズ(1.7Bのパラメータ)でDDKDは微調整とゼロショットの推論の両方で常に優れていた。
さらに、結果として得られる小さなモデルは、5つの領域のうち2つの領域においてはるかに大きな微調整モデルより優れ、残りの3つの領域で同等のパフォーマンスを達成する。
さらに、QUINTD-1の5倍拡張であるQUINTD-5を構築し、実際のターゲットドメイン入力を単純にスケーリングするだけで、モデムゲインしか得られないことを示した。
関連論文リスト
- Diffusion Domain Teacher: Diffusion Guided Domain Adaptive Object Detector [0.0]
拡散に基づく生成モデルは、高品質で多様な画像を生成する際、顕著な能力を示している。
我々は、ソースドメイン上の凍結拡散モデルを用いて検出器を訓練し、それを教師モデルとして使用し、ラベルのないターゲットドメイン上で擬似ラベルを生成する。
本手法は6つのデータセットのベースラインと比較して平均mAP改善率21.2%を達成する。
論文 参考訳(メタデータ) (2025-06-04T17:56:46Z) - Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation [66.66243874361103]
1) 生成されたサンプルを対象のドメインに整列させ、2) トレーニングデータ以外の情報的なサンプルを生成する。
本稿では,ドメインアライメントに必要な概念に関連する重みのみを選択的に識別・更新する,新しい微調整手法であるConcept-Aware LoRAを提案する。
都市・シーンのセグメンテーション, ベースライン, 最先端の手法をドメイン内設定で生成する上での有効性を実証する。
論文 参考訳(メタデータ) (2025-03-28T06:23:29Z) - On the Impact of Cross-Domain Data on German Language Models [20.758967185444416]
高品質なデータを含むことを目的とした別のデータセットとともに、5つのドメインのテキストからなるドイツのデータセットを提案する。
両方のデータセット上で122Mから750Mパラメータの一連のモデルをトレーニングすることにより、複数の下流タスクに関する包括的なベンチマークを行う。
この結果から、クロスドメインデータセットでトレーニングされたモデルは、品質データだけでトレーニングされたモデルよりも優れており、前回の最先端データよりも最大4.45%の改善が達成された。
論文 参考訳(メタデータ) (2023-10-11T09:09:55Z) - Measuring the Robustness of NLP Models to Domain Shifts [50.89876374569385]
ドメインロバストネス(DR)に関する既存の研究は、異なる設定、限られたタスクの多様性、コンテキスト内学習のような最近の能力に関する研究が不足している。
現在の研究は、チャレンジセットに焦点を当て、ソースドロップ(SD: Source Drop)のみに依存している。
我々は、ドメイン内パフォーマンスの劣化を測定するターゲットドロップ(TD)を相補的な視点として使うべきであると論じる。
論文 参考訳(メタデータ) (2023-05-31T20:25:08Z) - SALUDA: Surface-based Automotive Lidar Unsupervised Domain Adaptation [62.889835139583965]
我々は、ソースデータとターゲットデータに基づいて、暗黙の基盤となる表面表現を同時に学習する教師なし補助タスクを導入する。
両方のドメインが同じ遅延表現を共有しているため、モデルは2つのデータソース間の不一致を許容せざるを得ない。
実験の結果,本手法は実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-
論文 参考訳(メタデータ) (2023-04-06T17:36:23Z) - What Makes Data-to-Text Generation Hard for Pretrained Language Models? [17.07349898176898]
構造化された事実や関係(D2T)の自然言語記述を表現することで、構造化された知識リポジトリのアクセシビリティが向上する。
従来の研究は、タスク固有のトレーニングデータを大幅に微調整した後、事前学習された言語モデル(PLM)が、このタスクに対して驚くほどうまく機能していることを示している。
DARTマルチドメインD2Tデータセット上で、微調整と自動回帰PLMの両方について実証的研究を行う。
論文 参考訳(メタデータ) (2022-05-23T17:58:39Z) - Domain Adaptation for Learning Generator from Paired Few-Shot Data [72.04430033118426]
十分なソースデータと少数のターゲットデータを持つジェネレータを学習するためのペアドフェーショットGAN(PFS-GAN)モデルを提案する。
提案手法は,複数のベースラインと比較して,より多様性の高い生成対象ドメインデータに対して,定量的,定性的な結果が得られる。
論文 参考訳(メタデータ) (2021-02-25T10:11:44Z) - Domain Adaptation for Semantic Parsing [68.81787666086554]
本稿では,ドメイン適応のための新しいセマンティクスを提案する。このセマンティクスでは,ソースドメインと比較して,対象ドメインのアノテーション付きデータがはるかに少ない。
我々のセマンティックな利点は、2段階の粗大なフレームワークから得ており、2段階の異なる正確な処理を提供できる。
ベンチマークデータセットの実験により、我々の手法はいくつかの一般的なドメイン適応戦略より一貫して優れていることが示された。
論文 参考訳(メタデータ) (2020-06-23T14:47:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。