論文の概要: LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI
- arxiv url: http://arxiv.org/abs/2606.08131v1
- Date: Sat, 06 Jun 2026 12:15:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.862214
- Title: LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI
- Title(参考訳): LCAM: 会話型AIにおけるインタラクションアライメント障害の診断フレームワーク
- Authors: Manuele Reani, Hongyu Tian,
- Abstract要約: 本稿では,対話型AIにおけるアライメント障害の診断のための層認知アライメントモデル(LCAM)を提案する。
LCAMはアライメントを、システム動作、ユーザ目標、タスク要求、規範的コンテキストの調整された適合として定義している。
我々は、明らかに支持的な反応が有害な信念を強化し、不適切なケアをシミュレートし、役割の境界を曖昧にすることを示している。
- 参考スコア(独自算出の注目度): 1.0742675209112622
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conversational AI is increasingly used for advice, interpretation, reassurance, and decision support in contexts where users may be vulnerable, uncertain, or dependent on the system's apparent competence. Existing alignment work often focuses on model objectives, preference optimization, or output correctness. Yet, many harms arise through interaction: how systems frame authority, express uncertainty, simulate empathy, support reasoning, and make boundaries legible. This paper introduces the Layered Cognitive Alignment Model (LCAM), a conceptual and normative framework for diagnosing interac-tional alignment failures in conversational AI. LCAM defines alignment as a calibrated fit among system behavior, user goals, task demands, and normative context. It distinguishes five layers of fit: perceptual, semantic, affective, cognitive, and ethical, and two diagnostic polarities of misalignment: underfit and overreach. We apply LCAM to a published LLM counseling example, showing how an apparently supportive response can reinforce harmful beliefs, simulate inappropriate care, and obscure role boundaries. By translating conversational failures into audit and governance questions concerning over-reliance, false intimacy, autonomy erosion, boundary confusion, and inappropriate trust, LCAM offers a theoretical and normative lens for evaluating conversational AI beyond accuracy, helpfulness, or trust.
- Abstract(参考訳): 会話型AIは、ユーザが脆弱性があり、不確実性があり、システムの明らかな能力に依存している状況において、アドバイス、解釈、再保証、意思決定支援にますます利用されている。
既存のアライメント作業は、しばしばモデルの目的、好みの最適化、出力の正確性に焦点を当てます。
しかし、相互作用によって多くの害が生じる:システムがどのように権威をフレーム化し、不確実性を表現し、共感をシミュレートし、推論をサポートし、境界を正当化するか。
本稿では,対話型AIにおける終端アライメント障害を診断するための概念的および規範的枠組みである層認知アライメントモデル(LCAM)を紹介する。
LCAMはアライメントを、システム動作、ユーザ目標、タスク要求、規範的コンテキストの調整された適合として定義している。
知覚的、意味的、感情的、認知的、倫理的な5つの階層と、不適応と過度な偏見の2つの診断的極性とを区別する。
LCAMをLLMカウンセリングの例に適用し、明らかに支持的な反応が有害な信念を補強し、不適切なケアをシミュレートし、役割の境界が曖昧であることを示す。
会話の失敗を、過信、偽の近親感、自律的侵食、境界混乱、不適切な信頼に関する監査とガバナンスの質問に翻訳することで、LCAMは、正確性、有用性、信頼以上の会話AIを評価するための理論的で規範的なレンズを提供する。
関連論文リスト
- Contextual Multi-Objective Optimization: Rethinking Objectives in Frontier AI Systems [20.864964136537772]
AIの失敗の多くは、単にスケールや能力の失敗ではなく、客観的な選択の失敗である、と私たちは主張する。
この問題を,文体多目的最適化として定式化する。
私たちのフレームワークは、候補アクション、客観的見積、アクティブ制約、利害関係者、不確実性、コンフリクト解決手順に対するコンテキスト依存の選択ルールとして、AIの振る舞いをモデル化します。
論文 参考訳(メタデータ) (2026-05-05T15:55:19Z) - Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution [80.98492754957466]
公正性、堅牢性、プライバシ、説明可能性といった、信頼性の高いAI目標を同時に達成することは難しい。
本稿では、パフォーマンスにおけるトレードオフを理解しバランスをとるためには因果性が必要であると論じ、信頼できるAIの複数の目的について論じる。
論文 参考訳(メタデータ) (2026-05-04T14:26:28Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions [51.56484100374058]
ヘリコイド力学(Helicoid dynamics)は、その2番目のドメインの特定の障害状態に与えられる名前である。
システムは巧みに働き、エラーに陥り、何がうまくいかなかったかを正確に名付け、さらに高度な技術で同じパターンを再現する。
この先進的な事例シリーズは、7つの主要なシステムにまたがる体制を文書化する。
論文 参考訳(メタデータ) (2026-03-12T05:25:49Z) - A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms [49.66022971508878]
私たちは、推論はモジュラーコンポーネントからシステムの認知コアに高めるべきだと論じています。
応答性推論のトレードオフやソーシャルゲーム推論など,7つの中核的推論課題を導出し,体系化する。
我々は,LLMに基づく推論と,ミリ秒スケールで安全クリティカルな車両制御の要求との間の,高レイテンシ,熟考的特性の根本的かつ未解決な緊張関係を同定する。
論文 参考訳(メタデータ) (2026-03-11T07:40:53Z) - Self-evolving expertise in complex non-verifiable subject domains: dialogue as implicit meta-RL [0.0]
いわゆる「邪悪な問題」は、複雑な多次元の設定、検証不可能な結果、不均一な影響、客観的に正しい答えの欠如など、歴史を通じて人類を悩ませてきた。
現状の人工知能システム(特にLarge Language Modelベースのエージェント)は、そのような問題を解決するために人間と共同で研究されている。
この研究は、Dialecticaとのギャップに対処する。これは、エージェントが定義されたトピックに関する構造化された対話に従事し、メモリによる拡張、自己回帰、ポリシーに制約のあるコンテキスト編集を行うフレームワークである。
論文 参考訳(メタデータ) (2025-10-17T15:59:44Z) - Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts [75.20929587906228]
LLM(Large Language Model)を利用したマルチエージェントシステム(MAS)は、複雑なタスクにおける協調推論、ツールの使用、役割特化調整を急速に進めている。
しかし、信頼性クリティカルなデプロイメントは、体系的な障害モード、すなわち命令の競合による階層的コンプライアンスによって妨げられている。
論文 参考訳(メタデータ) (2025-09-27T08:43:34Z) - The Epistemic Suite: A Post-Foundational Diagnostic Methodology for Assessing AI Knowledge Claims [0.7233897166339268]
本稿では,AI出力の生成と受信の状況を理解するための診断手法であるEpistemic Suiteを紹介する。
真実や虚偽を判断する代わりに、スイートは20個の診断レンズを通して、信頼の洗浄、物語の圧縮、異動した権威、一時的な漂流などのパターンを明らかにする。
論文 参考訳(メタデータ) (2025-09-20T00:29:38Z) - Interpretability as Alignment: Making Internal Understanding a Design Principle [3.6704226968275253]
解釈可能性(Interpretability)は、アウトプットを駆動する計算を明らかにすることによって、内部透明性への道筋を提供する。
我々は、解釈可能性、特に機械的アプローチは、補助的な診断ツールではなく、アライメントのための設計原則として扱うべきであると論じている。
論文 参考訳(メタデータ) (2025-09-10T13:45:59Z) - Tuning-Free Accountable Intervention for LLM Deployment -- A
Metacognitive Approach [55.613461060997004]
大規模言語モデル(LLM)は、自然言語処理タスクの幅広い領域にわたる変換的進歩を触媒している。
我々は,自己認識型誤り識別と訂正機能を備えたLLMを実現するために,textbfCLEARと呼ばれる革新的なテキストメタ認知手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T19:18:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。