論文の概要: Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models
- arxiv url: http://arxiv.org/abs/2607.00852v1
- Date: Wed, 01 Jul 2026 12:18:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.886014
- Title: Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models
- Title(参考訳): 隠れ状態から入力テキストを復元する:デコーダオンリー言語モデルのグラディエント・ベース・インバージョンに関する研究
- Abstract要約: 隠れ状態反転問題を連続埋め込み空間最適化として検討する。
我々は、どのトークンが再構成を破るかを分析し、鋭い分類的非対称性を見つける。
GPT-2の最後の層が隠された状態は、原文と同じくらい敏感である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This work studies the hidden-state inversion problem: recovering the original input token sequence of a decoder-only language model from its last-layer hidden states. Rather than treating inversion as a one-shot reconstruction, we study it as a continuous embedding-space optimisation in which a soft proxy is driven towards the leaked target without any hard-token projection during the search, and a token is committed only once, at the end of the inner loop. This design choice has two consequences which are the main focus of this paper. First, keeping the optimisation entirely in continuous space exposes a rich set of internal signals: rank trajectories of the ground-truth token, per-position loss curves, and a discrete loss measured at commit time. Second, the discrete loss allows assessing the correctness of recovery via cumulative discrete loss. We further analyse which tokens break the reconstructions and find a sharp categorical asymmetry: space-prefixed, high-frequency function words in dense regions of the embedding matrix dominate the failures, while content-bearing tokens are recovered almost perfectly. On 10-token C4 prompts the exact-match rate rises from 66.9% to 97.5% (mean similarity 0.994) as the candidate window is widened, confirming that most errors are recoverable near-misses rather than genuine ambiguities. A comparison with the released SIPIT reference situates these findings: per-step hard projection is faster, but the continuous formulation is what makes the optimisation observable and its failures detectable. The results show that last-layer hidden states of GPT-2 are as sensitive as the original text.
- Abstract(参考訳): 本研究は,デコーダのみの言語モデルの入力トークン列を最終層に隠された状態から復元する,隠れ状態反転問題について検討する。
インバージョンをワンショット再構成として扱うのではなく,ソフトプロキシが検索中に難解なプロジェクションを伴わずに漏れたターゲットに向かって駆動され,内部ループの終端でトークンが1回だけコミットされるような,連続的な埋め込み空間最適化として検討する。
この設計選択には、本論文の主な焦点となる2つの結果がある。
第一に、最適化を完全に連続空間に維持することは、基底トラストークンのランクトラジェクトリ、位置当たりの損失曲線、コミット時に測定された離散損失といった、豊富な内部信号の集合を公開する。
第二に、離散損失は累積離散損失による回復の正しさを評価することができる。
さらに、どのトークンが再構成を破るかを分析し、鋭いカテゴリー非対称性を見出す: 埋め込み行列の密集領域における空間固定された高周波関数ワードが障害を支配し、コンテンツを含むトークンはほぼ完全に復元される。
10-token C4では、候補ウィンドウが拡張されるにつれて、正確なマッチレートが66.9%から97.5%に上昇し、ほとんどのエラーが真の曖昧さではなく、回復可能なニアミスであることを確認している。
リリースされたSIPITリファレンスと比較すると、これらの結果は以下の通りである: ステップごとのハードプロジェクションは高速であるが、連続的な定式化は最適化を観測可能とし、その失敗を検出する。
その結果, GPT-2の最後の層状隠蔽状態は原文と同じくらい感度が高いことがわかった。
関連論文リスト
- GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning [61.67411833252235]
本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
論文 参考訳(メタデータ) (2026-08-03T17:55:24Z) - Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs [69.52853771994451]
我々はLLaDA 2.0の復号軌道を解析し、繰り返し拡散信頼トラップを同定する。
本稿では,拡散復号化を進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである進化復号法を提案する。
論文 参考訳(メタデータ) (2026-08-01T11:48:25Z) - Progressive Cramming: Reliable Token Compression and What It Reveals [5.7789316833104225]
Token crammingは、ほぼ完璧に再構成された学習された埋め込みにシーケンスを圧縮する。
プログレッシブクラミング(progressive cramming)を導入し、ターゲットの接頭辞のトークン・バイ・トケン(token)を成長させ、再構成が不可能な場合にのみ停止する。
論文 参考訳(メタデータ) (2026-07-23T11:46:36Z) - Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding [92.1521161575198]
我々は、最も信頼性の高いニアファイナル層を動的に選択する、トレーニング不要なデコーディング戦略であるConfident Decodingを紹介する。
密集型および混合型LLMの実験は、挑戦的推論ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-06-20T07:03:26Z) - When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis [1.0829694003408499]
線形探索は、隠された状態の分類器が高い精度を達成したときに「符号化された」プロパティを宣言する。
標準的な線形探査は最初の数千歩以内に飽和し、ほとんどの訓練は楽器に見えないままである。
我々は,プローブ精度が崩壊するアクティベーションノイズレベルとして定義される,層ごとの相補的測定値であるフラキシビリティを導入する。
論文 参考訳(メタデータ) (2026-06-09T19:00:23Z) - Continuous Language Diffusion as a Decoder-Interface Problem [9.603960937964183]
連続拡散言語モデルはガウス崩壊文の埋め込みから流動的なテキストを生成することができる。
組込み言語フロー(ELF)を用いてこのパズルを学習し,デコーダベース機構を同定する。
本稿では,難読性,セマンティックリカバリ性,順序感度,デコーダの互換性,トラジェクトリ信頼性の診断プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-07T20:00:33Z) - Measuring Temporal Linguistic Emergence in Diffusion Language Models [0.0]
拡散言語モデルは明示的な聴覚的軌跡を露呈する。
WikiText-103テキスト上でLLaDA-8B-Baseの3つの独立した32ステップ実行について検討する。
論文 参考訳(メタデータ) (2026-04-25T10:17:47Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - The Remarkable Robustness of LLMs: Stages of Inference? [5.346230590800585]
本研究では,Large Language Models (LLM) の構造的介入に対するロバスト性について検討する。
驚くべきことに、モデルは微調整なしでオリジナルのトップ1予測精度の72-95%を維持している。
論文 参考訳(メタデータ) (2024-06-27T17:57:03Z) - Robust Depth Completion with Uncertainty-Driven Loss Functions [60.9237639890582]
本研究では,不確実性による損失関数を導入し,深度補修の堅牢性を改善し,深度補修の不確実性に対処する。
提案手法は,KITTI深度評価ベンチマークでテストされ,MAE, IMAE, IRMSEの計測値を用いて最先端のロバスト性性能を達成した。
論文 参考訳(メタデータ) (2021-12-15T05:22:34Z) - Pseudo-Convolutional Policy Gradient for Sequence-to-Sequence
Lip-Reading [96.48553941812366]
唇読解は唇運動系列から音声内容を推測することを目的としている。
seq2seqモデルの伝統的な学習プロセスには2つの問題がある。
本稿では,これら2つの問題に対処するために,PCPGに基づく新しい手法を提案する。
論文 参考訳(メタデータ) (2020-03-09T09:12:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。