論文の概要: Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes
- arxiv url: http://arxiv.org/abs/2608.02879v1
- Date: Mon, 03 Aug 2026 21:01:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.946814
- Title: Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes
- Title(参考訳): 文レベルエネルギー景観を用いたブラックボックス大言語モデルの解釈
- Abstract要約: 文レベルで動作するモデルに依存しないポストホック帰属インタプリタを提案する。
グローバルにローカルインタプリタをトレーニングすることで、我々のフレームワークはより広範な生成パターンをキャプチャし、インスタンス固有のバイアスを軽減する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The widespread adoption of proprietary Large Language Models (LLMs) accessed strictly through closed APIs has created a critical challenge for responsible deployment: a fundamental lack of interpretability. To address this, we propose a model-agnostic, post-hoc attribution interpreter operating at the sentence level. Our approach trains an Energy-Based Model (EBM) as a surrogate to capture the LLM's internal conceptual consistency between prompts and responses. This energy landscape guides the training of a lightweight interpreter network. Uniquely, our interpreter operates as a standalone tool; once trained, it quantifies the influence of prompt sentences on a user-specified target output without requiring further API queries to the LLM. By globally training a local interpreter across diverse inputs, our framework captures broader generation patterns and mitigates instance-specific biases. Experiments demonstrate that our EBM accurately simulates the target LLM, allowing the interpreter to effectively identify the prompt sentences most influential in generating specific target outputs.
- Abstract(参考訳): プロプライエタリなLarge Language Models(LLM)がクローズドAPIを通じて厳密にアクセスされることで、責任あるデプロイメントにおいて重要な課題が生まれました。
これを解決するために,文レベルで動作しているモデルに依存しないポストホック帰属インタプリタを提案する。
提案手法は,省エネルギーモデル (EBM) をサロゲートとして訓練し,プロンプトと応答の間のLLMの内部的概念的整合性を捉える。
このエネルギーランドスケープは、軽量インタプリタネットワークのトレーニングをガイドする。
インタプリタはスタンドアロンのツールとして動作し、一度訓練されると、LLMにさらなるAPIクエリを必要とせずに、ユーザ指定のターゲット出力に対するプロンプト文の影響を定量化する。
ローカルインタプリタを多種多様な入力にわたってグローバルにトレーニングすることにより、我々のフレームワークはより広範な生成パターンを捕捉し、インスタンス固有のバイアスを軽減する。
実験により,EBMは目標LLMを正確にシミュレートし,特定の目標出力の生成に最も影響を及ぼすプロンプト文をインタプリタが効果的に識別できることを示した。
関連論文リスト
- RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs [55.44696796126619]
地球観測システムは、曖昧な自然言語を通じて要求を表現するドメインの専門家を支援するように設計されている。
実用的なEOAIシステムは、あいまいな人間のクエリと適切な多粒度視覚分析タスクのギャップを埋めなければならない。
MLLMの能力固有の境界を戦略的に尊重するエージェントフレームワークであるRemoteAgentを提案する。
論文 参考訳(メタデータ) (2026-04-09T03:40:46Z) - Learning to Explain: Prototype-Based Surrogate Models for LLM Classification [1.7373859011890633]
大規模言語モデル (LLM) は、自然言語処理における顕著な性能を示しているが、その決定過程はほとんど不透明である。
プロトタイプベースのサロゲートフレームワークである textbfProtoSurE を提案する。
論文 参考訳(メタデータ) (2025-05-25T04:25:28Z) - Probing Large Language Models in Reasoning and Translating Complex Linguistic Puzzles [0.6144680854063939]
本稿では,複雑な言語パズルの解法としてLarge Language Models (LLMs) を用いる。
パズリングマシンコンペティションと各種言語オリンピアードのデータセットを用いて、GPT-4 0603の性能を評価する。
論文 参考訳(メタデータ) (2025-02-02T14:53:14Z) - PromptExp: Multi-granularity Prompt Explanation of Large Language Models [16.259208045898415]
PromptExpは,トークンレベルの洞察を集約することで,複数の粒度を自動生成するフレームワークである。
PromptExpは、ホワイトボックスとブラックボックスの説明の両方をサポートし、説明をより高い粒度レベルまで拡張する。
PromptExpを感情分析などのケーススタディで評価し,摂動に基づくアプローチが優れていることを示す。
論文 参考訳(メタデータ) (2024-10-16T22:25:15Z) - Large Language Models are Interpretable Learners [53.56735770834617]
本稿では,Large Language Models(LLM)とシンボルプログラムの組み合わせによって,表現性と解釈可能性のギャップを埋めることができることを示す。
自然言語プロンプトを持つ事前訓練されたLLMは、生の入力を自然言語の概念に変換することができる解釈可能な膨大なモジュールセットを提供する。
LSPが学んだ知識は自然言語の記述と記号規則の組み合わせであり、人間(解釈可能)や他のLLMに容易に転送できる。
論文 参考訳(メタデータ) (2024-06-25T02:18:15Z) - From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems [59.40480894948944]
大規模言語モデル (LLM) は、物理世界の意思決定問題を解くことができる。
このモデルの下で、LLM Plannerは、プロンプトを介して言語ベースのサブゴールを反復的に生成することにより、部分的に観測可能なマルコフ決定プロセス(POMDP)をナビゲートする。
我々は,事前学習したLLMプランナーが,文脈内学習を通じてベイズ的集計模倣学習(BAIL)を効果的に行うことを証明した。
論文 参考訳(メタデータ) (2024-05-30T09:42:54Z) - Machine Translation with Large Language Models: Prompt Engineering for
Persian, English, and Russian Directions [0.0]
生成型大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクにおいて、例外的な習熟性を示している。
我々は,ペルシャ語,英語,ロシア語の言語間組み合わせに着目した2つの普及促進手法とその組み合わせについて調査を行った。
論文 参考訳(メタデータ) (2024-01-16T15:16:34Z) - Sparsity-Guided Holistic Explanation for LLMs with Interpretable
Inference-Time Intervention [53.896974148579346]
大規模言語モデル(LLM)は、様々な自然言語処理領域において前例のないブレークスルーを達成した。
LLMの謎的なブラックボックスの性質は、透過的で説明可能なアプリケーションを妨げる、解釈可能性にとって重要な課題である。
本稿では,LLMの全体的解釈を提供することを目的として,スポーシティ誘導技術に係わる新しい方法論を提案する。
論文 参考訳(メタデータ) (2023-12-22T19:55:58Z) - Prompt Highlighter: Interactive Control for Multi-Modal LLMs [50.830448437285355]
本研究では,マルチモーダル LLM (LLMs&VLMs) 推論における重要な側面として,明示的な制御可能なテキスト生成を目標とする。
本稿では,新しい推論手法であるPrompt Highlighterを導入し,ユーザが特定のプロンプトスパンをハイライトし,生成中のフォーカスをインタラクティブに制御できるようにする。
推論中、注意重みを通して強調されたトークンでモデルを導くことで、より望ましい出力が得られます。
論文 参考訳(メタデータ) (2023-12-07T13:53:29Z) - Proto-lm: A Prototypical Network-Based Framework for Built-in
Interpretability in Large Language Models [27.841725567976315]
大規模言語モデル(LLM)は自然言語処理(NLP)の分野を著しく進歩させてきたが、その解釈可能性の欠如が大きな関心事となっている。
本稿では,LLMが即座に解釈可能な埋め込みを学習できるネットワークベースのホワイトボックスフレームワークであるproto-lmを紹介する。
提案手法の適用性と解釈性は,幅広いNLPタスクの実験を通じて実証され,性能を犠牲にすることなく解釈可能なモデルを作成する新たな可能性を示す。
論文 参考訳(メタデータ) (2023-11-03T05:55:32Z) - Let Models Speak Ciphers: Multiagent Debate through Embeddings [84.20336971784495]
この問題を解決するためにCIPHER(Communicative Inter-Model Protocol Through Embedding Representation)を導入する。
自然言語から逸脱することで、CIPHERはモデルの重みを変更することなく、より広い範囲の情報を符号化する利点を提供する。
このことは、LLM間の通信における代替の"言語"としての埋め込みの優越性と堅牢性を示している。
論文 参考訳(メタデータ) (2023-10-10T03:06:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。