論文の概要: Poisoned Identifiers Survive LLM Deobfuscation: A Case Study on Claude Opus 4.6
- arxiv url: http://arxiv.org/abs/2604.04289v1
- Date: Sun, 05 Apr 2026 22:08:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.026603
- Title: Poisoned Identifiers Survive LLM Deobfuscation: A Case Study on Claude Opus 4.6
- Title(参考訳): 消毒剤によるLCM難治性消毒 : クロードオプス4.6を事例として
- Authors: Luis Guzmán Lorenzo,
- Abstract要約: 192の推論でClaude Opus 4.6を2つのコードアーチタイプで実行すれば、3つの一貫性のあるパターンが見つかる。
パーシステンスは正しい意味論と共存した。
タスクフレーミングは永続性を変えたが、明示的な検証プロンプトは効果がなかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When an LLM deobfuscates JavaScript, can poisoned identifier names in the string table survive into the model's reconstructed code, even when the model demonstrably understands the correct semantics? Using Claude Opus 4.6 across 192 inference runs on two code archetypes (force-directed graph simulation, A* pathfinding; 50 conditions, N=3-6), we found three consistent patterns: (1) Poisoned names persisted in every baseline run on both artifacts (physics: 8/8; pathfinding: 5/5). Matched controls showed this extends to terms with zero semantic fit when the string table does not form a coherent alternative domain. (2) Persistence coexisted with correct semantic commentary: in 15/17 runs the model wrote wrong variable names while correctly describing the actual operation in comments. (3) Task framing changed persistence: explicit verification prompts had no effect (12/12 across 4 variants), but reframing from "deobfuscate this" to "write a fresh implementation" reduced propagation from 100% to 0-20% on physics and to 0% on pathfinding, while preserving the checked algorithmic structure. Matched-control experiments showed zero-fit terms persist at the same rate when the replacement table lacks a coherent alternative-domain signal. Per-term variation in earlier domain-gradient experiments is confounded with domain-level coherence and recoverability. These observations are from two archetypes on one model family (Opus 4.6 primary; Haiku 4.5 spot-check). Broader generalization is needed
- Abstract(参考訳): LLMがJavaScriptを難読化する場合、モデルが正しいセマンティクスを実証的に理解している場合でも、文字列テーブル内の有毒な識別子名がモデルの再構成コードに生き残ることができるだろうか?
Claude Opus 4.6は192の推論で2つのコードアーチタイプ(フォース指向グラフシミュレーション、A*パスフィンディング、50条件、N=3-6)で動作し、3つの一貫したパターンを発見した。
マッチした制御は、文字列テーブルがコヒーレントな代替ドメインを形成しない場合に、意味論的適合がゼロとなるように拡張した。
2) 正しい意味論と共存する永続性: 15/17 では、間違った変数名を書いたモデルを実行し、実際の操作をコメントで正しく記述する。
3) タスクフレーミングは永続性を変化させた: 明示的な検証プロンプトには効果がなかった(4つの変種で12/12)が、"難読化"から"新しい実装を記述"への再フレーミングは、チェックされたアルゴリズム構造を維持しながら、物理で100%から0-20%、パスフィンディングで0%まで伝搬を減らした。
整合制御実験では、置換テーブルがコヒーレントな代替ドメイン信号を持たない場合、ゼロフィット項は同じ速度で持続することを示した。
初期のドメイン・グラディエント実験における長期変動は、ドメインレベルのコヒーレンスとリカバリ可能性とを併せ持つ。
これらの観測は1つの模型群(Opus 4.6プライマリ、Haiku 4.5スポットチェック)の2つのアーチタイプからなされている。
より広範な一般化が必要である
関連論文リスト
- ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Where Do Flow Semantics Reside? A Protocol-Native Tabular Pretraining Paradigm for Encrypted Traffic Classification [5.044786941116112]
自己監督型マスクドモデリングは、生のバイトをマスキングして再構築することで、暗号化されたトラフィック分類を約束する。
最近の研究によると、これらの手法はコストのかかる事前訓練にもかかわらずラベル付きデータへの依存を減らすことができない。
トラフィックをシーケンスバイトにフラットにすることで、プロトコル定義のセマンティクスを破壊します。
論文 参考訳(メタデータ) (2026-03-09T15:15:23Z) - LLM Self-Explanations Fail Semantic Invariance [27.126691338850254]
機能状態が固定されている間、セマンティックコンテキストだけが変化するとき、忠実な自己レポートは安定していなければならない。
このテストは、4つのフロンティアモデルが意図的に不可能なタスクに直面しているエージェント環境で運用する。
論文 参考訳(メタデータ) (2026-03-01T20:18:43Z) - Agents Learn Their Runtime: Interpreter Persistence as Training-Time Semantics [4.774525456207306]
ツール拡張LDMは、自然言語推論と実行可能なPythonアクションをインターリーブするエージェントとして、ますます多くデプロイされている。
インタプリタの永続化は単に実行時の足場なのか、それともエージェントがインタープリタの使い方を学習する方法を形作るトレーニングデータの特性なのかを問う。
ワンショットソリューションを避けるために設計された、部分的に観測可能な最適化タスクの手続き的に生成されたファミリーであるOpaque Knapsackを紹介する。
論文 参考訳(メタデータ) (2026-03-01T18:08:02Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems [0.0]
外部からのフィードバックのない再帰的な自己評価は、進歩よりもむしろ改革をもたらすことが多い。
3つのモデル(OpenAI GPT-4o-mini, Anthropic Claude 3 Haiku, Google Gemini 2.0 Flash)と4つのタスクファミリー(パラメータ、コード、説明、リフレクション)にまたがる144の推論シーケンスについて検討する。
我々はこれを、生成的推論における自己補正の構造的限界の証拠として解釈する。
論文 参考訳(メタデータ) (2025-10-23T07:53:26Z) - When Names Disappear: Revealing What LLMs Actually Understand About Code [7.691597373321699]
大規模言語モデル(LLM)は、コードタスクにおいて強力な結果をもたらすが、どのようにプログラムの意味を導き出すかは、まだ不明である。
形式的な振る舞いを定義する構造的意味論と、意図を伝える人間の解釈可能な命名という2つのチャンネルを通じてコードがコミュニケーションすると主張する。
命名チャンネルの削除は、モデルが行ごとの記述に回帰する、要約のような意図レベルのタスクを著しく低下させる。
論文 参考訳(メタデータ) (2025-10-03T16:53:13Z) - Theoretically Achieving Continuous Representation of Oriented Bounding Boxes [64.15627958879053]
本論文は,オブジェクト指向境界ボックス表現における不連続性を完全に解決しようとする試みである。
本研究では,既存の検出器に容易に統合可能なCOBB(Continuous OBB)という新しい表現法を提案する。
OOD評価のためのオープンソースのディープラーニングフレームワークJittorの検出ツールボックスJDetをベースとした,モジュール化されたベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-29T09:27:40Z) - Mitigating Generation Shifts for Generalized Zero-Shot Learning [52.98182124310114]
一般化ゼロショット学習(英: Generalized Zero-Shot Learning、GZSL)は、学習中に見知らぬクラスが観察できない、見つからないサンプルを認識するために意味情報(属性など)を活用するタスクである。
本稿では,未知のデータ合成を効率よく,効率的に学習するための新しい生成シフト緩和フローフレームワークを提案する。
実験結果から,GSMFlowは従来のゼロショット設定と一般化されたゼロショット設定の両方において,最先端の認識性能を実現することが示された。
論文 参考訳(メタデータ) (2021-07-07T11:43:59Z) - Contrastive Learning and Self-Training for Unsupervised Domain
Adaptation in Semantic Segmentation [71.77083272602525]
UDAはラベル付きソースドメインからラベルなしターゲットドメインへの効率的な知識伝達を試みている。
本稿では,領域にまたがるカテゴリ別センタロイドを適応させるコントラスト学習手法を提案する。
提案手法を自己学習で拡張し,メモリ効率の良い時間アンサンブルを用いて一貫性と信頼性の高い擬似ラベルを生成する。
論文 参考訳(メタデータ) (2021-05-05T11:55:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。