論文の概要: Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints
- arxiv url: http://arxiv.org/abs/2608.17843v1
- Date: Tue, 18 Aug 2026 14:40:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.368814
- Title: Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints
- Title(参考訳): 符号化可能ではないが動作不能:幾何制約のための冷凍LDMにおけるデコード生成・ステアギャップの検証
- Abstract要約: 我々は、スケッチレベルの制約状態から局所的なペアワイズ関係を分離するための制御テストベッドとしてパラメトリックCAD制約を用いる。
本研究は, 線形着脱性, 強制選択生成, アクティベーションレベルの影響, 行動ステアビリティの4つの特性について検討した。
その結果, テスト環境では, 着脱性, 生成性, アクティベーションレベルの影響, ステアビリティが分散可能であることがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have demonstrated strong performance on structured reasoning tasks, but what they encode and whether it informs model behavior remain unclear. We investigate this question through geometric reasoning, using parametric CAD constraints as a controlled testbed for separating local pairwise relations from sketch-level constraint status. By probing the hidden states of six frozen decoder-only LLMs, we examine four properties: linear decodability, forced-choice generation, activation-level influence, and behavioral steerability. Pretraining substantially improves the decoding of local geometric relations, and this advantage persists after accounting for positional cues with shuffled-order controls. In contrast, sketch-level DOF status is already highly decodable from randomly initialized representations and improves only modestly with pretraining, indicating that much of its probe performance is available without learned weights. Further analyses show that decodable information is not always actionable. Generation often fails to express this information, and on the two intervention-tested backbones, activation-restoration effects at the patched entity position vanish while decodability persists across depth. Mean-difference steering also does not reliably control outputs. These results show that decodability, generation, activation-level influence, and steerability can diverge in the tested setting. The audit provides a controlled way to distinguish failures to encode geometric structure from failures to express or control encoded information.
- Abstract(参考訳): 大規模言語モデル (LLM) は構造化推論タスクにおいて強い性能を示してきたが、何を符号化し、それがモデル動作を知らせるかどうかはまだ不明である。
本研究では,パラメータCAD制約を局所的な対関係とスケッチレベルの制約を分離するための制御テストベッドとして利用して,幾何学的推論を通じてこの問題を考察する。
6個の冷凍復号器のみのLLMの隠蔽状態を探索することにより, 線形復調性, 強制選択性, アクティベーションレベルの影響, 動作性という4つの特性について検討した。
事前学習は局所的な幾何学的関係の復号化を著しく改善し、この利点はシャッフル順序制御による位置的手がかりを考慮に入れた後に持続する。
対照的に、スケッチレベルのDOFステータスは、ランダムに初期化された表現からすでに高度に退避可能であり、事前学習でのみ適度に改善されており、プローブ性能の大部分が学習重量なしで利用できることを示している。
さらに分析すると、復調可能な情報が常に実行可能なわけではないことが分かる。
生成は、しばしばこの情報を表現できず、2つの介入テストされたバックボーンでは、パッチされたエンティティ位置でのアクティベーション回復効果は消滅し、デオードビリティは深さにわたって持続する。
平均差のステアリングも出力を確実に制御しない。
これらの結果から, テスト環境では, 脱臭性, 生成性, 活性化レベルの影響, 操舵性が分散できることが示唆された。
監査は、幾何学的構造を符号化する失敗と、符号化された情報を表現または制御する失敗とを区別する制御された方法を提供する。
関連論文リスト
- Introspective Uncertainty Estimation for LLM-Based Code Generation [0.0]
この論文は、コード生成タスクの応答レベルとラインレベルにおいて、イントロスペクティブ不確実性推定が確実に正しさを示すことができるかどうかを考察する。
目的は、隠れ状態が機能的コード正当性に関する情報をエンコードする範囲と、実際的なリスク評価や障害のローカライゼーションにどのように活用できるかを判断することである。
論文 参考訳(メタデータ) (2026-09-12T14:43:07Z) - Detecting and Controlling Sycophancy with Cascading Linear Features [7.13923185919936]
動作に責任のあるカスケード線形特徴を分離する反復データ生成パイプラインを提案する。
私たちは、ユーザのバリデーションを優先する言語モデルの傾向である、梅毒の検知とステアリングに重点を置いています。
論文 参考訳(メタデータ) (2026-06-23T20:10:53Z) - When is Your LLM Steerable? [56.656180566692946]
アクティベーションステアリングは、推論時に言語モデルの振る舞いを制御するための軽量なアプローチを提供する。
ステアリングを成功させる体制と境界を見つけるには、通常、高価なグリッドサーチが必要である。
生成プロセスの開始時にモデルの内部状態からステアビリティを予測できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-10T02:55:34Z) - The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models [52.93186090124315]
トークンのコミットメントは、再利用可能なトレースステートポリシとして学ぶことができる、と私たちは主張する。
凍結拡散言語モデルのためにこのポリシーをインスタンス化する軽量プラグインコントローラであるTraceLockを紹介する。
論文 参考訳(メタデータ) (2026-05-23T18:23:46Z) - Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer [22.42181408084751]
ビブコーディングは正確で実行可能なコードを高速に生成するが、構造的なコミットメントや依存関係、証拠の記録は残っていない。
本稿では,操作可能な世界モデルであるコンセンサス層Cが,エンジニアリングの主要な成果物としてコードを置き換えるパラダイムであるエージェント・コンセンサスを提案する。
本稿では,チャットによるベースラインと比較して,コンセンサスに基づく人間の介入を減らすかどうかを測定するためのベンチマークタスクファミリーを提案する。
論文 参考訳(メタデータ) (2026-04-20T06:53:32Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset [0.0]
本稿では,22の大規模C/C++プロジェクトから得られた関数レベル修正の信頼性の高いベンチマークであるReDefを紹介する。
欠陥ケースはコミットの反転によって固定され、クリーンケースはポストホック履歴チェックによって検証される。
このパイプラインは3,164の欠陥と10,268のクリーンな修正をもたらし、既存のリソースよりも信頼性の高いラベルを提供する。
論文 参考訳(メタデータ) (2025-09-11T07:07:11Z) - Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models [86.88657425848547]
大型推論モデル(LRMs)はすでに長い連鎖推論のための潜在能力を持っている。
我々は、自動生成の自己検証タスクを使用して、モデルに推論、帰納、誘拐の3つのメタ能力を持たせることを明確にした。
我々の3つのステージ・パイプラインの個別アライメント、パラメータ空間のマージ、ドメイン固有の強化学習は、命令調整ベースラインと比較して10%以上のパフォーマンス向上を実現します。
論文 参考訳(メタデータ) (2025-05-15T17:58:33Z) - Learning Action-based Representations Using Invariance [18.1941237781348]
我々は,制御に関係のある遠隔状態の特徴を割引する多段階制御可能性指標を学習するアクションビシミュレーション符号化を導入する。
我々は,報酬のない一様ランダムなデータに基づく行動ビシミュレーション事前学習が,複数の環境におけるサンプル効率を向上させることを実証した。
論文 参考訳(メタデータ) (2024-03-25T02:17:54Z) - Multistep Inverse Is Not All You Need [87.62730694973696]
実世界の制御環境では、観測空間は不要に高次元であり、時間関連ノイズにさらされることが多い。
したがって、観測空間を制御関連変数のより単純な空間にマッピングするエンコーダを学ぶことが望ましい。
本稿では,多段階逆予測と遅延フォワードモデルを組み合わせた新しいアルゴリズムACDFを提案する。
論文 参考訳(メタデータ) (2024-03-18T16:36:01Z) - Is Disentanglement enough? On Latent Representations for Controllable
Music Generation [78.8942067357231]
強い生成デコーダが存在しない場合、アンタングル化は必ずしも制御性を意味するものではない。
VAEデコーダに対する潜伏空間の構造は、異なる属性を操作するための生成モデルの能力を高める上で重要な役割を果たす。
論文 参考訳(メタデータ) (2021-08-01T18:37:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。