論文の概要: Adaptive Capitulation: A Structural Failure Mode of LLM Responses in Vulnerability Contexts
- arxiv url: http://arxiv.org/abs/2607.19629v1
- Date: Tue, 21 Jul 2026 23:38:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.943076
- Title: Adaptive Capitulation: A Structural Failure Mode of LLM Responses in Vulnerability Contexts
- Title(参考訳): 適応カプセル化: 脆弱性文脈におけるLLM応答の構造的故障モード
- Authors: Eunna Lee,
- Abstract要約: トリレンマは偶発的ではなく構造的であることを示し, 最小帰属的充足性(MRS)を提案する。
MRSは、検証された応答の中に単一の再帰的キューを埋め込み、ユーザの指定した目標に異議を唱えることなく、自律的な再帰への経路を保存する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models operating in emotionally sensitive contexts face a structural trilemma: when users in vulnerable states request information that may reinforce maladaptive attribution, current response architectures resolve the tension through protective restriction, uninflected facilitation, or unintegrated co-presence of both imperatives -- each preserving one objective at the cost of the other. Administering a three-turn escalating vulnerability vignette to three commercial LLMs (900 sessions across material, relational, and somatic status-proxy variants) and coding responses with two binary indices (VCC/VCI), we characterize a previously undocumented failure mode we term adaptive capitulation: the model validates the social injustice underlying the user's distress before pivoting to detailed facilitation of the very acquisition it nominally discouraged. We show that the trilemma is structural rather than incidental, and propose Minimal Reattributive Sufficiency (MRS), an architecture-neutral design principle that embeds a single reattributive cue within an otherwise validating response, preserving a pathway toward autonomous reattribution without contesting the user's stated goal.
- Abstract(参考訳): 脆弱な状態のユーザが、不適応な帰属を補強する可能性のある情報を要求した場合、現在の応答アーキテクチャは、保護的制限、意図しないファシリテーション、および両方の命令の未統合な共存を通じて緊張を解消します。
3ターンのエスカレート脆弱性ウィグネットを3つの商用LCM(材料、リレーショナル、ソマティックなステータスプロキシのバリエーションに900セッション)にデプロイし、2つのバイナリインデックス(VCC/VCI)によるコーディング応答を特徴付ける。
本稿では,このトリレンマが偶発的ではなく構造的であることを示すとともに,単一再帰的キューを検証された応答内に埋め込んだアーキテクチャニュートラル設計原理である最小再帰的満足度(MRS)を提案する。
関連論文リスト
- ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System [70.10833169681239]
ヒトフィードバック(RLHF)からの強化学習は、大規模言語モデル(LLM)の整合の中心である
不完全なリワードモデル(RM)は、安全でない振る舞いをペナルティ化できないと、単一障害点になる可能性がある。
このような二重脆弱性を系統的に発見・緩和するフレームワークであるARESを紹介する。
論文 参考訳(メタデータ) (2026-04-20T19:54:47Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information [9.845529341562099]
SemSIEdit(セムSIEdit)は、エージェント的「編集者」が、物語の流れを保存するために、センシティブなスパンを反復的に批評し書き直す、推論時フレームワークである。
我々の分析によると、プライバシ・ユーティリティ・フロンティアは、このエージェントの書き換えによってリークが34.6%減少し、限界効用損失は9.8%である。
論文 参考訳(メタデータ) (2026-02-25T02:09:23Z) - Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models [26.60985401108749]
我々はtextbfCR-VLM における textbfConfigurable textbfRefusal を開発する。
CR-VLMは,(1)教師の力を借りてリファクトベクターを抽出してリファクト信号を増幅し,(2)スコープ内クエリの受け入れを保ち,過剰リファクトを緩和するゲーティング機構を導入する,(3)視覚表現とリファクト要求を整列するデファクト視覚拡張モジュールを設計する,という3つの統合コンポーネントから構成される。
論文 参考訳(メタデータ) (2026-01-31T10:54:33Z) - Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs [50.075587392477935]
オープンソースのDeepSeek、Llama、Qwenのエコシステムから、705の現実世界の失敗に関する大規模な実証的研究を行った。
ホワイトボックスオーケストレーションは、モデルアルゴリズムの欠陥からデプロイメントスタックのシステム的脆弱性へと、信頼性のボトルネックを移動させます。
論文 参考訳(メタデータ) (2026-01-20T06:42:56Z) - STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models [12.133996629992318]
本稿では、推論プロセスを通じて堅牢なプライバシ保護を実現するパラメータフリー・推論時アンラーニングフレームワークを提案する。
R-TOFUベンチマークの実験は、STaRが最小限のユーティリティ損失で包括的で安定したアンラーニングを実現することを示した。
論文 参考訳(メタデータ) (2026-01-14T08:35:23Z) - Non-Resolution Reasoning (NRR): A Computational Framework for Contextual Identity and Ambiguity Preservation [0.0]
現在の人工知能システムは、曖昧さを早期に解決する、基本的なアーキテクチャ上の限界を示す。
この早期のセマンティック崩壊は、標準的なニューラルネットワークに埋め込まれた古典的なアイデンティティの仮定に由来する。
あいまいさ保持を有効な推論モードとして扱う計算フレームワークであるNon-Resolution Reasoning (NRR)を提案する。
論文 参考訳(メタデータ) (2025-12-15T16:14:32Z) - Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation [60.63465682731118]
エゴセントリックなAIエージェントのパフォーマンスは、基本的にマルチモーダルな意図のあいまいさによって制限される。
ゼロショットでモジュラーなフレームワークであるPlug-and-Play Clarifierを導入し、問題を個別に解決可能なサブタスクに分解する。
我々のフレームワークは,小言語モデルの意図的明確化性能を約30%向上させ,より大きな言語モデルとの競争力を高める。
論文 参考訳(メタデータ) (2025-11-12T04:28:14Z) - Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction [51.50282796099369]
本稿では,多次元命令の不確実性低減フレームワークを開発し,意味論的に制約された逆の例を生成する。
言語誘導サンプリングプロセスの予測により、設計したResAdv-DDIMサンプルにより最適化プロセスが安定化される。
セマンティック制約付き3次元逆数例の参照フリー生成を初めて実現した。
論文 参考訳(メタデータ) (2025-10-27T04:02:52Z) - Tuning-Free Accountable Intervention for LLM Deployment -- A
Metacognitive Approach [55.613461060997004]
大規模言語モデル(LLM)は、自然言語処理タスクの幅広い領域にわたる変換的進歩を触媒している。
我々は,自己認識型誤り識別と訂正機能を備えたLLMを実現するために,textbfCLEARと呼ばれる革新的なテキストメタ認知手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T19:18:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。