論文の概要: LLMs Can Annotate Attribution Graphs
- arxiv url: http://arxiv.org/abs/2608.02632v1
- Date: Tue, 28 Jul 2026 04:12:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 17:47:10.49654
- Title: LLMs Can Annotate Attribution Graphs
- Title(参考訳): LLMは属性グラフに注釈を付けることができる
- Abstract要約: 回路トレースは言語モデルの内部計算を明らかにするためのエキサイティングな手法である。
本稿では,機能記述をスーパーノードにグループ化する言語モデルに提示するための簡単なパイプラインを提案する。
自動解釈可能性指標を用いて、パイプラインによって生成されたスーパーノードが、人間のアノテータによって生成されたものと同じくらい解釈可能であることを確認した。
- 参考スコア(独自算出の注目度): 1.120047524339062
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Circuit tracing is an exciting technique for revealing the internal computation of language models, but it requires a time-intensive manual step of grouping individual features or MLP neurons into supernodes. We present a simple pipeline for automating this step: directly presenting feature descriptions to a language model that groups them into supernodes. Using automated interpretability metrics, we confirm that supernodes generated by our pipeline are as interpretable as those generated by human annotators. On a two-hop Capitals task, our pipeline recovers a supernode corresponding to the intermediate hop in 97 of 100 prompts. Finally, we present a simple proof of concept using our pipeline for open-ended exploration, where we automatically annotate 1000 attribution graphs from Wikipedia prompt completions and then use an LLM judge to flag interesting graphs worth human review. We hope this work demonstrates that even simple automation can produce meaningful attribution graph annotations, motivating further work on automated circuit tracing.
- Abstract(参考訳): 回路追跡は言語モデルの内部計算を明らかにするためのエキサイティングな手法であるが、個々の特徴やMLPニューロンをスーパーノードにグループ化するための時間を要する手作業が必要である。
機能記述を直接言語モデルに提示し、それらをスーパーノードにグループ化する。
自動解釈可能性指標を用いて、パイプラインによって生成されたスーパーノードが、人間のアノテータによって生成されたものと同じくらい解釈可能であることを確認した。
2ホップのCapitalsタスクでは、パイプラインが中間ホップに対応するスーパーノードを100プロンプトの97でリカバリします。
最後に、オープンエンド探索のためにパイプラインを使用して簡単な概念実証を行い、ウィキペディアから1000の属性グラフを自動的に注釈付けし、LLMの判断を使って人間のレビューに値する興味深いグラフにフラグを付ける。
この研究は、単純な自動化でさえ有意義な属性グラフアノテーションを生成できることを示し、自動回路トレースへのさらなる取り組みを動機付けていることを願っている。
関連論文リスト
- ADAG: Automatically Describing Attribution Graphs [50.460651620833055]
完全自動化されたこれらの属性グラフを記述するためのエンドツーエンドパイプラインである textbfADAG を導入する。
次に、特徴群をグループ化するための新しいクラスタリングアルゴリズムと、これらの特徴群の機能的役割に関する自然言語的説明を生成・スコアするLLM説明器-シミュレータ構成を導入する。
我々は、既知の人為的な回路追跡タスクでシステムを実行し、解釈可能な回路を復元し、さらに、Llama 3.1 8Bインストラクトにおける有害なアドバイスジェイルブレイクの原因となる、ステアブルクラスタを見つけることができることを示す。
論文 参考訳(メタデータ) (2026-04-08T21:34:37Z) - Is One Token All It Takes? Graph Pooling Tokens for LLM-based GraphQA [1.2239546747355887]
マルチトークンプーリングにより,グラフ・ツー・LLMインタフェースの帯域幅を拡大する方法を示す。
また,グローバルアテンション機構を用いて,グラフエンコーダのセマンティック品質を向上させる。
分析の結果,GraphQAベンチマークは表現飽和に悩まされていることがわかった。
論文 参考訳(メタデータ) (2026-04-01T00:34:10Z) - Towards Improved Sentence Representations using Token Graphs [41.412173502714225]
GLOTは構造を意識したプールモジュールで、リレーショナル学習後にアグリゲーションとしてプールを再構成する。
トークンの90%がランダムなイントラクタである診断ストレステストでは、GLOTは97%以上の精度を維持し、ベースラインメソッドは崩壊する。
GLUEやMTEBのようなベンチマークの最先端技術と競合し、トレーニング可能なパラメータは20倍少なく、パラメータ効率のよい微調整手法と比較してトレーニング時間を100倍以上高速化する。
論文 参考訳(メタデータ) (2026-03-03T09:00:01Z) - Semi-supervised Instruction Tuning for Large Language Models on Text-Attributed Graphs [62.544129365882014]
本稿では,SIT-Graph というグラフ学習用セミ教師付きインストラクションチューニングパイプラインを提案する。
SIT-Graphはモデルに依存しず、LSMを予測子として利用するグラフ命令チューニングメソッドにシームレスに統合することができる。
SIT-Graphは、最先端グラフチューニング手法に組み込むと、テキスト分散グラフベンチマークの性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-01-19T08:10:53Z) - GraphTranslator: Aligning Graph Model to Large Language Model for
Open-ended Tasks [44.02825843494608]
ChatGPTのような大規模言語モデル(LLM)は強力なゼロショットと命令追従機能を備えている。
GraphTranslatorは、事前に定義されたタスクを効果的に処理するためにGMを活用することを目的としている。
ノード表現をトークンに変換することで、GraphTranslatorはLLMに言語命令に基づいた予測を行う権限を与える。
論文 参考訳(メタデータ) (2024-02-11T13:24:13Z) - Exploring the Potential of Large Language Models (LLMs) in Learning on
Graphs [59.74814230246034]
大規模言語モデル(LLM)は、広範な共通知識と強力な意味理解能力を持つことが証明されている。
LLMs-as-EnhancersとLLMs-as-Predictorsの2つのパイプラインについて検討する。
論文 参考訳(メタデータ) (2023-07-07T05:31:31Z) - Guiding Large Language Models via Directional Stimulus Prompting [114.84930073977672]
我々は,特定の所望の出力に対して,ブラックボックス大言語モデル(LLM)を導くための新しいフレームワークであるDirectional Stimulus Promptingを紹介する。
LLMを直接調整するのではなく、小さな調整可能なポリシーモデルを用いて各入力インスタンスに対して補助的な指向性刺激プロンプトを生成する。
論文 参考訳(メタデータ) (2023-02-22T17:44:15Z) - Node Feature Extraction by Self-Supervised Multi-scale Neighborhood
Prediction [123.20238648121445]
我々は、新しい自己教師型学習フレームワーク、グラフ情報支援ノード機能exTraction (GIANT)を提案する。
GIANT は eXtreme Multi-label Classification (XMC) 形式を利用しており、これはグラフ情報に基づいた言語モデルの微調整に不可欠である。
我々は,Open Graph Benchmarkデータセット上での標準GNNパイプラインよりもGIANTの方が優れた性能を示す。
論文 参考訳(メタデータ) (2021-10-29T19:55:12Z) - Very Deep Graph Neural Networks Via Noise Regularisation [57.450532911995516]
グラフニューラルネットワーク(GNN)は、入力グラフを介して学習されたメッセージパッシングを実行する。
最大100のメッセージパッシングステップを持つディープGNNをトレーニングし、いくつかの最先端の結果を得る。
論文 参考訳(メタデータ) (2021-06-15T08:50:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。