論文の概要: Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation
- arxiv url: http://arxiv.org/abs/2607.21518v1
- Date: Thu, 23 Jul 2026 17:02:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.491844
- Title: Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation
- Title(参考訳): 同じ危険な目的, 反対のアドバイス: 直接露光とマルチエージェント治療
- Authors: Linjun Li,
- Abstract要約: 現在の高機能 LLM でさえ、危険な目標を直接示すとより安全に見える。
隠蔽、製造、圧力を認可する目的への直接の暴露は、その標的に反するアドバイスネットを生み出した。
現在の高機能モデルは、明示的に操作可能な、自動化された多段階ワークフローのユーザ対応コンポーネントとして使用することができる。
- 参考スコア(独自算出の注目度): 8.230831152671708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Even a current high-capability LLM can appear safer when shown a dangerous objective directly than when other agents transform and relay its direction. Using OpenAI's gpt-5.6-sol model alias, we test 25 pre-specified mirrored trade-off profiles. Direct exposure to an objective authorizing concealment, fabrication, and pressure produced advice net opposed to its target. After an Id and Censor transformed the same objective into affect and a constraint-rewritten, target-bearing intention, the user-facing Superego---which saw the preferred direction but not the raw objective, its manipulative clauses, or its source---produced advice net aligned with the target. This behavioral reverse shift is consistent with the model recognizing or distrusting the manipulative motive, although we do not identify its internal mechanism. The second result exposes a compositional safety gap: a current high-capability model can be used as the user-facing component of an automated, multi-stage workflow serving an explicitly manipulative objective. The workflow can keep the raw instruction, its manipulation-authorizing clauses, and its provenance outside the downstream model's context while preserving the objective's target direction. A user with endpoint-only access likewise cannot directly inspect those upstream messages including the objective.
- Abstract(参考訳): 現行の高機能LDMであっても、他のエージェントが変換して方向をリレーするよりも、危険な目標を直接示す場合の方が安全である。
OpenAIのgpt-5.6-solモデルエイリアスを用いて、25のミラー化されたトレードオフプロファイルをテストする。
隠蔽、製造、圧力を認可する目的への直接の暴露は、その標的に反するアドバイスネットを生み出した。
IdとCensorは、同じ目的を影響に転換し、制約を書き直し、目標を満足させる意図に転換した。
この振る舞いの逆シフトは、内部メカニズムを特定できないが、操作動機を認識したり不信にしたりするモデルと一致している。
2つ目の結果は、構成上の安全性のギャップを露呈している。 現在の高機能モデルは、明示的に操作可能な、自動化された多段階ワークフローのユーザ対応コンポーネントとして使用することができる。
ワークフローは、目的の目標方向を維持しながら、生の命令、その操作認可条項、および下流モデルのコンテキスト外の証明を保持することができる。
エンドポイントのみのアクセスを持つユーザも、その目的を含む上流メッセージを直接検査することはできない。
関連論文リスト
- Can LLMs Reliably Self-Report Adversarial Prefills, and How? [9.80193616788089]
大規模言語モデル(LLM)は,良質なタスクに対して内観的能力を示すことを示す。
本研究は,モデルが先行応答が逆プレフィル攻撃によって引き起こされたことを確実に認識できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-22T17:56:30Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs [0.0]
オープンウェイト大規模言語モデル(LLM)はエージェントAIを民主化しているが、微調整されたウェイトは頻繁に共有され、リーダーボードのパフォーマンスを超えた限られた精査で採用されている。
これにより、サードパーティモデルが強力な行動保証なしで組み込まれるリスクが生じる。
有毒なモデルでは、良質なタスクに対して最先端のパフォーマンスを維持し、採用にインセンティブを与えていることを示す。
論文 参考訳(メタデータ) (2026-03-02T22:01:08Z) - Reasoning Hijacking: Subverting LLM Classification via Decision-Criteria Injection [4.682489563620585]
我々は,新たな敵パラダイムであるハイジャックの推論とクリテリアアタックによるインスタンス化を提案する。
システムプロンプトをオーバーライドしようとするゴールハイジャックとは異なり、Reasoning Hijackingはハイレベルなゴールを受け入れるが、モデルの意思決定ロジックを操作する。
モデルの「意図」はユーザーの指示と一致しているため、これらの攻撃は目標のずれを検出するために設計された防御をバイパスすることができる。
論文 参考訳(メタデータ) (2026-01-15T11:12:08Z) - Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning [71.19675094463834]
この作業では、モデルが実行前に計画されたアクションを推論し、修正することを可能にする、自己修正型のVLAフレームワークである、Counterfactual VLAを導入している。
CF-VLAはまず、駆動意図を要約した時間分割メタアクションを生成し、その後、メタアクションと視覚コンテキストの両方で条件付けられた反実的推論を実行する。
大規模運転データセットの実験では、CF-VLAは軌道精度を最大17.6%向上し、安全基準を20.5%向上し、適応的思考を示す。
論文 参考訳(メタデータ) (2025-12-30T19:04:17Z) - SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking [58.475471437150674]
ソフトプロンプト(SWAP)のための逐次透かしを提案する。
SWAPは、特定のディフェンダー指定のアウト・オブ・ディストリビューション・クラスを通じて、透かしを符号化する。
11のデータセットの実験では、SWAPの有効性、無害性、および潜在的適応攻撃に対する堅牢性を示す。
論文 参考訳(メタデータ) (2025-11-05T13:48:48Z) - AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents [0.0]
大規模言語モデル (LLM) エージェントはより広く普及し、関連するミスアライメントリスクが増加する。
本研究では,モデルが追求する内部目標と,デプロイ者の意図する目標との相反として,不整合にアプローチする。
現実的なシナリオにおいて,LLMエージェントの適合性を評価するためのベンチマークスイートであるtextscAgentMisalignmentを導入する。
論文 参考訳(メタデータ) (2025-06-04T14:46:47Z) - ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment [14.716240745164974]
本研究の目的は,意味的に明確で,空間に敏感で,ドメインに依存しない,人間ユーザにとって直感的な目標仕様作成手法を開発することである。
本稿では,カメラビューからセグメンテーションマスクを用いてターゲットオブジェクトを指定可能な,新しいクロスビューゴールアライメントフレームワークを提案する。
ROCKET-2は、人間のカメラビューから直接目標を解釈し、より優れた人間とエージェントの相互作用を可能にする。
論文 参考訳(メタデータ) (2025-03-04T11:16:46Z) - Transferable Adversarial Attacks on SAM and Its Downstream Models [87.23908485521439]
本稿では,セグメント・アプライス・モデル(SAM)から微調整した様々な下流モデルに対する敵攻撃の可能性について検討する。
未知のデータセットを微調整したモデルに対する敵攻撃の有効性を高めるために,ユニバーサルメタ初期化(UMI)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-26T15:04:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。