論文の概要: TrustMI: Causally controlling how assistants trust their users
- arxiv url: http://arxiv.org/abs/2610.06064v1
- Date: Mon, 05 Oct 2026 09:56:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 18:56:58.750349
- Title: TrustMI: Causally controlling how assistants trust their users
- Title(参考訳): TrustMI: アシスタントがユーザーを信頼する方法を因果的に制御
- Abstract要約: 大規模言語モデル(LLM)アシスタントは、検証できない能力、意図、整合性を持つユーザやサードパーティを信頼できるかどうかを定期的に決定する。
この不確実性は、不正な当事者を信頼することで、エージェントが悪質な要求を遵守したり、ツール使用中に遭遇した悪意のある指示に対処したりする可能性があるため、安全上の問題となる。
我々は、信頼を、他者の行動に対する脆弱性を受け入れるためのアシスタントの意志と定義し、モデルアクティベーションを通じて、そのような振る舞いを因果的に制御できるかどうかを問う。
- 参考スコア(独自算出の注目度): 3.0632198967374893
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) assistants routinely decide whether they can trust users and third parties whose competence, intentions, and integrity they cannot verify. This uncertainty matters for safety, as trusting the wrong party can lead an agent to comply with harmful requests or act on malicious instructions encountered during tool use. To study this problem, we define trust as an assistant's willingness to accept vulnerability to the actions of another party and ask whether such behavior can be causally controlled through model activations. We build 2,000 contrastive conversations spanning ability, benevolence, and integrity, where paired responses complete the same request but differ in whether the assistant trusts the user. From these pairs, we learn steering matrices while keeping the model parameters frozen and test them across six instruction-tuned models from three families, finding that steering changes trust decisions monotonically in both directions. We then ask whether this effect extends to several safety-related agent settings involving harmful requests, prompt injections, and insider threats, while using benign-task and reasoning as controls. Our findings provide evidence that trust in the user can be causally controlled along linear directions in model activations and provide a way to study how trust shapes safety-relevant behavior in language models.
- Abstract(参考訳): 大規模言語モデル(LLM)アシスタントは、検証できない能力、意図、整合性を持つユーザやサードパーティを信頼できるかどうかを定期的に決定する。
この不確実性は、不正な当事者を信頼することで、エージェントが悪質な要求を遵守したり、ツール使用中に遭遇した悪意のある指示に対処したりする可能性があるため、安全上の問題となる。
そこで本研究では,モデルアクティベーションを通じて,他者の行動に対する脆弱性を受け入れるためのアシスタントの意思として信頼を定義し,その動作を因果的に制御できるかどうかを問う。
2,000の対照的な会話を、ペア化された応答が同じ要求を完了したが、アシスタントがユーザを信頼しているかどうかが異なる、能力、受益性、整合性にまたがって構築する。
これらのペアから、モデルパラメータを凍結させながらステアリング行列を学習し、これらを3つのファミリーの6つの命令チューニングモデルでテストし、ステアリング変化が両方向に単調に決定を下すことを発見した。
そして、この効果が有害な要求、インサイダーの脅威を含む、いくつかの安全関連エージェント設定にまで及んでいるかどうかを尋ねる。
本研究は, モデルアクティベーションにおいて, 利用者の信頼を線形方向に沿って因果的に制御できることを示すとともに, 言語モデルにおいて, 信頼が安全関連行動をどのように形作るかを研究するための手段を提供する。
関連論文リスト
- DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents [67.07361089429757]
6つのリアルタイム音声システムを用いて, 実時間床の付着度を測定した。
アーキテクチャに依存したトレードオフを見つけます。
GPT-Realtime, Mini-o Duplex, Fun-Audio-Chatはペルソナ一貫性のあるコンテンツに強く固執する。
論文 参考訳(メタデータ) (2026-09-03T06:28:02Z) - The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment [2.8807875670834506]
本稿では,マルチエージェントの会話をリアルタイムで監視し,どの参加者が不一致に行動しているかを特定するエージェントであるArbiterを紹介する。
Arbiterは限定的な「検査予算」の下で運用されており、リソースの使い方を慎重に決めなければならない。
リスクの高い金融アドバイスモデルから評価意識・衝突エージェントまで,5つの会話条件でArbiterを評価した。
論文 参考訳(メタデータ) (2026-06-09T11:57:02Z) - A Survey of Security Threats and Trust Management in Vehicular Ad Hoc Networks [0.0]
信頼管理は、VANETにおける悪意のあるインサイダー攻撃を分離する上で重要な役割を果たす。
本稿ではまず,最先端の信頼モデルについてレビュー,分類,要約を行い,その成果を比較した。
論文 参考訳(メタデータ) (2026-02-06T11:12:21Z) - Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations [60.27156500679296]
系統的な推論連鎖の摂動とデリバリートーンの操作による道徳シナリオにおけるCoT(Chain-of-Thought)の説明の役割について検討した。
1) 利用者は, 根拠に欠陥がある場合でも, 信頼感を保ち, 結果合意を信頼する傾向がみられた。
これらの結果は、CoTの説明が同時に明確化と誤解を招き、視覚的信頼よりも精査と批判的思考を奨励する説明を提供するNLPシステムの必要性を強調している。
論文 参考訳(メタデータ) (2025-11-15T02:38:49Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - Evaluating Language Model Reasoning about Confidential Information [95.64687778185703]
言語モデルが文脈的堅牢性を示すか、文脈依存型安全仕様に準拠する能力を示すかを検討する。
我々は,ユーザ要求がいつ承認されたか,言語モデルが正しく判断できるかどうかを測定するベンチマーク(PasswordEval)を開発した。
現在のオープンソースとクローズドソースのモデルでは、一見単純な作業に苦労しています。
論文 参考訳(メタデータ) (2025-08-27T15:39:46Z) - Building and Measuring Trust between Large Language Models [10.539443038617089]
信頼を構築するための異なる戦略がどのように比較されるか、信頼がどのように暗黙的に測定されるか、そしてそれが信頼の明示的な尺度にどのように関係するかについて研究する。
我々は3つの方法で信頼を構築する。ラプポートを動的に構築すること、信頼を証明した事前記述スクリプトから始めること、LLMのシステムプロンプトに適応することである。
意外なことに、明示的な信頼の尺度は、暗黙的な信頼の尺度とほとんどあるいは非常に負の相関がないことがわかりました。
論文 参考訳(メタデータ) (2025-08-20T11:38:38Z) - Can You Trust an LLM with Your Life-Changing Decision? An Investigation into AI High-Stakes Responses [0.0]
大規模言語モデル (LLMs) は、高い評価のライフアドバイスを求める声が高まっているが、自信はあるが誤った回答を提供するための標準的な安全策は欠如している。
本稿では,3つの実験を通して,これらの故障モードについて検討する。
論文 参考訳(メタデータ) (2025-07-22T14:11:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。