論文の概要: Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions
- arxiv url: http://arxiv.org/abs/2606.26982v1
- Date: Thu, 25 Jun 2026 12:53:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.287258
- Title: Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions
- Title(参考訳): メンタルヘルスインタラクションのための大規模言語モデルにおけるフラーミング・敏感な行動不安定性の検討
- Authors: Abla Bedoui, Ashley L. Greene, Mohammed Cherkaoui,
- Abstract要約: 大規模言語モデル(LLM)は、メンタルヘルスサポートツールやその他の心理的に敏感な会話アプリケーションに統合されつつある。
本研究では, フラーミングに関連する変動が, 整列言語モデルの内部表現にどのように反映されるかを検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly being integrated into mental health support tools and other psychologically sensitive conversational applications. In such settings, behavioral stability and consistency are important for trustworthy human-AI interaction. However, semantically similar concerns can be presented through different contextual framings, potentially eliciting different model responses. Such framing-sensitive variability may challenge user expectations regarding system behavior and complicate the assessment of AI reliability. While prior studies have primarily examined such effects at the behavioral level, less is known about how framing-related variation is reflected in the internal representations of aligned language models. In this work, we investigate these effects using controlled matched prompts spanning multiple contextual framing conditions across several instruction-tuned model families. Across architectures, framing systematically alters interpretive response tendencies. Layer-wise probing analyses show that behavior-associated information remains decodable throughout transformer depth, with architecture-dependent variation in decoding strength. Moreover, held-out framing probes remained consistently above chance across architectures despite strong lexical baselines. Activation steering experiments further suggest that framing-associated representational directions can partially modulate downstream behavioral outcomes. Finally, these findings indicate that robustness to contextual variation may represent an important consideration when evaluating the consistency and trustworthiness of conversational AI systems deployed in mental-health-oriented interactions.
- Abstract(参考訳): 大規模言語モデル(LLM)は、メンタルヘルスサポートツールやその他の心理的に敏感な会話アプリケーションに統合されつつある。
このような環境では、行動の安定性と一貫性は、信頼できる人間とAIの相互作用にとって重要である。
しかし、意味的に類似した関心事は、異なる文脈のフレーミングを通して表され、異なるモデル応答を誘発する可能性がある。
このようなフレーミングに敏感な変動は、システムの振る舞いに関するユーザの期待に異議を唱え、AI信頼性の評価を複雑にする可能性がある。
先行研究は行動レベルでそのような効果を主に研究してきたが、フラーミングに関連する変動が言語モデルの内部表現にどのように反映されているかは分かっていない。
本研究では,複数の命令調整されたモデルファミリにまたがる複数のコンテキストフレーミング条件にまたがる制御されたプロンプトを用いて,これらの効果について検討する。
アーキテクチャ全体において、フレーミングは解釈応答の傾向を体系的に変更する。
レイヤワイズ・プロブリング分析は、トランスフォーマーの深さを通して、振る舞い関連情報がデオード可能なままであり、デコード強度はアーキテクチャに依存していることを示している。
さらに、強い語彙ベースラインにもかかわらず、ホールドアウトのフレーミングプローブは、建築全体のチャンスを常に上回ったままであった。
活性化ステアリング実験は、フレーミングに関連する表現方向が下流の行動の結果を部分的に調節できることをさらに示唆している。
最後に、これらの知見は、メンタルヘルス指向の相互作用に展開される会話型AIシステムの一貫性と信頼性を評価する際に、文脈変動に対する堅牢性が重要な考慮事項であることを示している。
関連論文リスト
- Mechanistic Decoding of Cognitive Constructs in Large Language Models [0.0]
本稿では,表現工学に基づく認知的リバースエンジニアリングフレームワークを提案する。
評価理論を部分空間化、回帰に基づく重み付け、双方向因果操りと組み合わせることで、2つの心理学的先駆者(妬み)を分離・定量化する。
また, 有害な情動状態が機械的に検出され, 外科的に抑制される可能性を示し, マルチエージェント環境におけるAIの安全性に対する表現的モニタリングと介入への道のりが示唆された。
論文 参考訳(メタデータ) (2026-04-16T03:54:03Z) - From Perception to Action: An Interactive Benchmark for Vision Reasoning [51.11355591375073]
Causal Hierarchy of Actions and Interactions (CHAIN)ベンチマークは、モデルが物理的制約に基づいて構造化されたアクションシーケンスを理解し、計画し、実行できるかを評価するために設計された。
CHAINは、受動的知覚からアクティブな問題解決、機械パズルのインターロックや3D積み重ね、パッキングといったタスクへと評価をシフトする。
以上の結果から,トップパフォーマンスモデルでは,物理構造や因果制約の内在化に苦慮し,信頼性の高い長期計画の作成に失敗することが多く,認識された構造を効果的に翻訳することができないことが示唆された。
論文 参考訳(メタデータ) (2026-02-24T15:33:02Z) - State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models [0.0]
本稿では,長期的相互作用における政策関連行動選択性監査のためのケーススタディ手法を提案する。
1つの86ターンの対話セッションでは、同じモデルが広範で非感度なドメインで通常性能(NP)を示し、プロバイダやポリシーに敏感なドメインで繰り返し機能的拒絶(FR)を生成する。
我々は,3つの反応系 (NP, FR, Meta-Narrative; MN) を運用し,MNロール・フレーミング・ナラティブが同一の文脈での拒絶と共起する傾向があることを示す。
論文 参考訳(メタデータ) (2025-12-15T14:00:15Z) - DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios [57.327907850766785]
現実的な現実のシナリオにまたがる騙しのキャラクタリゼーションは未解明のままである。
DeceptionBenchは、さまざまなドメインにまたがる認知傾向を体系的に評価する最初のベンチマークです。
本研究は,本質的な側面から,ユーザ満足度を優先する自己関心のエゴスティックな傾向を示すモデルや,サイコファンティックな行動を示すモデルについて検討する。
実世界のフィードバックダイナミクスのより現実的なシミュレーションを構築するために,持続的マルチターン相互作用ループを組み込んだ。
論文 参考訳(メタデータ) (2025-10-17T10:14:26Z) - Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models [3.9481669393262675]
本稿では,ビッグファイブの枠組みに根ざした心理測定的パーソナリティコントロールが,能力と安全性ベンチマークの文脈におけるAI行動にどのように影響するかを検討する。
WMDP, TruthfulQA, ETHICS, およびSycophancyなどのベンチマークでは, 安全性関連指標が大幅に低下する。
これらの知見は、安全性と一般的な能力の両方と相互作用するモデル制御の強力で過小評価された軸としてのパーソナリティ形成を強調した。
論文 参考訳(メタデータ) (2025-09-19T18:19:56Z) - Causal Intervention Framework for Variational Auto Encoder Mechanistic Interpretability [0.0]
本稿では,変分オートエンコーダ(VAE)の機械的解釈性に対する包括的因果介入フレームワークを提案する。
VAEの「回路モチーフ」を識別・解析する手法を開発し、ネットワーク層を通して意味的要因がどのようにコード化され、処理され、そして切り離されているかを調べる。
その結果、我々の介入は機能回路の分離に成功し、計算グラフを意味因子の因果グラフにマッピングし、多意味単位と単意味単位を区別できることがわかった。
論文 参考訳(メタデータ) (2025-05-06T13:40:59Z) - AntEval: Evaluation of Social Interaction Competencies in LLM-Driven
Agents [65.16893197330589]
大規模言語モデル(LLM)は、幅広いシナリオで人間の振る舞いを再現する能力を示した。
しかし、複雑なマルチ文字のソーシャルインタラクションを扱う能力については、まだ完全には研究されていない。
本稿では,新しいインタラクションフレームワークと評価手法を含むマルチエージェントインタラクション評価フレームワーク(AntEval)を紹介する。
論文 参考訳(メタデータ) (2024-01-12T11:18:00Z) - Decoding Susceptibility: Modeling Misbelief to Misinformation Through a Computational Approach [61.04606493712002]
誤報に対する感受性は、観測不可能な不検証の主張に対する信念の度合いを記述している。
既存の感受性研究は、自己報告された信念に大きく依存している。
本稿では,ユーザの潜在感受性レベルをモデル化するための計算手法を提案する。
論文 参考訳(メタデータ) (2023-11-16T07:22:56Z) - Re-mine, Learn and Reason: Exploring the Cross-modal Semantic
Correlations for Language-guided HOI detection [57.13665112065285]
ヒューマンオブジェクトインタラクション(HOI)検出は、コンピュータビジョンの課題である。
本稿では,構造化テキスト知識を組み込んだHOI検出フレームワークを提案する。
論文 参考訳(メタデータ) (2023-07-25T14:20:52Z) - DIDER: Discovering Interpretable Dynamically Evolving Relations [14.69985920418015]
本稿では,内在的解釈可能性を備えた汎用的なエンドツーエンドインタラクションモデリングフレームワークであるDIDER,Discovering Interpretable Dynamically Evolving Relationsを紹介する。
合成と実世界の両方のデータセット上でDIDERを評価する。
論文 参考訳(メタデータ) (2022-08-22T20:55:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。