論文の概要: Semi-Supervised Text-Attributed Graph Distillation
- arxiv url: http://arxiv.org/abs/2607.20477v1
- Date: Wed, 27 May 2026 14:52:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.190832
- Title: Semi-Supervised Text-Attributed Graph Distillation
- Title(参考訳): 半教師付きテキスト分散グラフ蒸留
- Authors: Yurui Lai, Samir Moustafa, Renchi Yang, Tsz Nam Chan,
- Abstract要約: em Text-Attributed Graphs (TAG)は、グラフトポロジとリッチテキストセマンティクスを統合するための表現型データモデルとして登場した。
我々は、Em Wasserstein Distance (WSD)によってガイドされる統合された半教師付きフレームワークであるalgoを提案する。
- 参考スコア(独自算出の注目度): 15.73558394941586
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: {\em Text-Attributed Graphs} (TAGs) have emerged as an expressive data model for integrating graph topology with rich textual semantics. Existing representation learning methods over TAGs suffer from severe scalability bottlenecks, particularly together with {\em Large Language Models} (LLMs). While data distillation offers a promising data-centric solution, existing methods fail to capture the complex interplay between graph and text modalities, struggle with the label scarcity inherent in semi-supervised settings, and lack the ability to produce the human-readable textual attributes required for downstream LLM-based tasks. To address these challenges, we propose \algo{}, a unified semi-supervised framework guided by the {\em Wasserstein Distance} (WSD). Grounded in our empirical findings on real TAGs, \algo{} introduces a graph-text collaborative encoding module that utilizes dual-pathway encoders (graph-aware and -free) within a collaborative self-training scheme to harvest reliable pseudo-labels and fuse complementary graph-text features. Furthermore, we develop a theoretically grounded WSD-based graph sketching algorithm and a cost-effective LLM text synthesis module, which leverages cluster-based keyword extraction to generate coherent, human-readable summaries for condensed nodes. Extensive experiments on benchmark datasets demonstrate that \algo{} achieves a state-of-the-art performance-compression trade-off in terms of both GNN- and LLM-based downstream tasks, enabling effective and efficient TAG learning or analytics.
- Abstract(参考訳): グラフトポロジとリッチテキストセマンティクスを統合するための表現型データモデルとして、.em Text-Attributed Graphs} (TAGs) が登場した。
既存のTAG上の表現学習手法は、特にLLM(Large Language Models)とともに、厳しいスケーラビリティのボトルネックに悩まされている。
データ蒸留は有望なデータ中心のソリューションを提供するが、既存の手法ではグラフとテキストのモダリティの複雑な相互作用を捉えることができず、半教師付きセッティングに固有のラベル不足に悩まされ、下流のLLMベースのタスクに必要な可読なテキスト属性を生成する能力が欠如している。
これらの課題に対処するために、我々は、WSD ( {\displaystyle {\em Wasserstein Distance}) によってガイドされる統合された半教師付きフレームワークである \algo{} を提案する。
実TAGに関する実証的な知見を基盤として,2経路エンコーダ(グラフ認識および自由)を協調的な自己学習方式で活用し,信頼性の高い擬似ラベルを抽出し,補完的なグラフテキスト特徴を融合するグラフテキスト協調符号化モジュールを導入している。
さらに, クラスタベースのキーワード抽出を利用して, 凝縮ノードの一貫性のある人間可読要約を生成する, コスト効率の高いLLMテキスト合成モジュールを理論的に構築する。
ベンチマークデータセットに関する大規模な実験は、GNNとLLMベースの下流タスクの両方の観点から、最先端のパフォーマンス圧縮トレードオフを実現し、効果的で効率的なTAG学習や分析を可能にすることを実証している。
関連論文リスト
- GraspLLM: Towards Zero-Shot Generalization on Text-Attributed Graphs with LLMs [11.267446729081412]
グラフ構造理解とLarge Language Models (LLM) の意味理解技術を組み合わせたフレームワークであるGraspLLMを導入し、クロスデータセットとクロスタスクの一般化性を向上させる。
実験の結果,GraspLLM は,特にゼロショットシナリオにおいて,従来の LLM ベースのTAG メソッドよりも一貫して優れていたことがわかった。
論文 参考訳(メタデータ) (2026-06-10T10:25:59Z) - Semi-supervised Instruction Tuning for Large Language Models on Text-Attributed Graphs [62.544129365882014]
本稿では,SIT-Graph というグラフ学習用セミ教師付きインストラクションチューニングパイプラインを提案する。
SIT-Graphはモデルに依存しず、LSMを予測子として利用するグラフ命令チューニングメソッドにシームレスに統合することができる。
SIT-Graphは、最先端グラフチューニング手法に組み込むと、テキスト分散グラフベンチマークの性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-01-19T08:10:53Z) - DGP: A Dual-Granularity Prompting Framework for Fraud Detection with Graph-Enhanced LLMs [55.13817504780764]
実世界の不正検出アプリケーションは、しばしばテキストデータに富んだノード特徴とグラフ構造情報を共同で活用するグラフ学習技術の恩恵を受ける。
グラフ強化LSMは、グラフ情報をプロンプトに変換する、有望なグラフ学習アプローチとして登場します。
目的ノードの細粒度テキストの詳細を保存し,情報過負荷を軽減するDGPを提案する。
論文 参考訳(メタデータ) (2025-07-29T10:10:47Z) - Dynamic Bundling with Large Language Models for Zero-Shot Inference on Text-Attributed Graphs [56.73437142790496]
大規模言語モデル(LLM)は多くのゼロショット学習問題で使われている。
LLMは、グラフトポロジから分離されたテキスト属性と競合する。
これらは、情報不足とLLMの固有の弱点の両方により、信頼性の低い予測をもたらす。
論文 参考訳(メタデータ) (2025-05-23T08:12:16Z) - LLM as GNN: Graph Vocabulary Learning for Text-Attributed Graph Foundation Models [87.68057302738457]
Text-Attributed Graphs (TAG) は、現実のシナリオにおいてユビキタスである。
大規模言語モデル(LLMs)とグラフニューラルネットワーク(GNNs)をTAGsに統合する努力にもかかわらず、既存のアプローチは分離されたアーキテクチャに悩まされている。
本稿では,グラフ語彙学習に基づくTAGのための汎用GFMであるPromptGFMを提案する。
論文 参考訳(メタデータ) (2025-03-05T09:45:22Z) - SaVe-TAG: Semantic-aware Vicinal Risk Minimization for Long-Tailed Text-Attributed Graphs [16.24571541782205]
実世界のグラフデータは、しばしば長い尾の分布に従うため、グラフニューラルネットワーク(GNN)が頭と尾の両方のクラスをうまく一般化することは困難である。
ウイルスリスク最小化(VRM)の最近の進歩は、クラス不均衡と数値意味論の緩和の可能性を示唆している。
論文 参考訳(メタデータ) (2024-10-22T10:36:15Z) - Unleashing the Potential of Text-attributed Graphs: Automatic Relation Decomposition via Large Language Models [31.443478448031886]
RoSE (Relation-oriented Semantic Edge-Decomposition) は、生のテキスト属性を分析してグラフ構造を分解する新しいフレームワークである。
我々のフレームワークは、さまざまなデータセットのノード分類性能を大幅に向上させ、ウィスコンシンデータセットでは最大16%の改善を実現した。
論文 参考訳(メタデータ) (2024-05-28T20:54:47Z) - Leveraging Large Language Models for Node Generation in Few-Shot Learning on Text-Attributed Graphs [5.587264586806575]
本稿では,Large Language Models (LLMs) を用いたノード生成によるテキスト分散グラフの強化のためのプラグイン・アンド・プレイ手法を提案する。
LLMはラベルから意味情報を抽出し、模範としてカテゴリに属するサンプルを生成する。
エッジ予測器を用いて、生のデータセットに固有の構造情報をキャプチャし、新たに生成されたサンプルを元のグラフに統合する。
論文 参考訳(メタデータ) (2023-10-15T16:04:28Z) - Harnessing Explanations: LLM-to-LM Interpreter for Enhanced
Text-Attributed Graph Representation Learning [51.90524745663737]
重要なイノベーションは、機能として説明を使用することで、下流タスクにおけるGNNのパフォーマンス向上に利用できます。
提案手法は、確立されたTAGデータセットの最先端結果を実現する。
本手法はトレーニングを著しく高速化し,ogbn-arxivのベースラインに最も近い2.88倍の改善を実現した。
論文 参考訳(メタデータ) (2023-05-31T03:18:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。