論文の概要: Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication
- arxiv url: http://arxiv.org/abs/2605.26397v2
- Date: Mon, 01 Jun 2026 17:07:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 18:24:16.519483
- Title: Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication
- Title(参考訳): LLMによる自閉症コミュニケーションにおけるアルゴリズム的脆弱性とペルソナバイアス
- Abstract要約: 安全アライメントは明らかに有害な出力を減少させるが、衛生的で神経ノルミティブなコミュニケーションの表現を不注意に符号化する。
本研究では、この符号化を二重対人書き直しパラダイムを用いて検討し、10大言語モデルに対して、自閉症または神経型ペルソナから自然に発生する自閉症の言説を書き換えるよう促す。
以上より,現在のアライメントトレーニングは,定性的分析によってのみ,ペルソナ特異的な生成的分解を引き起こすことが示唆された。
- 参考スコア(独自算出の注目度): 4.032192350354742
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety alignment reduces explicitly harmful outputs but inadvertently encodes a sanitized, neuronormative representation of marginalized communication. We investigate this encoding using a dual-persona rewrite paradigm, prompting ten large language models (LLMs) to rewrite naturally occurring autistic discourse from either an autistic or neurotypical persona. We uncover autistic-persona rewrites diverge significantly more in lexical form and affective register than neurotypical rewrites, despite equivalent semantic similarity. Furthermore, most models collapse cross-persona generations into near-identical outputs. To uncover the mechanisms behind this generative breakdown, we introduce a multi-agent qualitative analysis framework. Our results reveal systemic output erasure, stereotyped hallucination, and task-evasive meta-commentary are pervasive failure modes for this task that cluster by alignment strategy rather than parameter scale. Finally, our targeted comparison with autistic human annotators demonstrates that community-insider knowledge produces systematic label reversals relative to LLM classifications. Our findings indicate that current alignment training causes persona-specific generative breakdown visible only through qualitative analysis, confirming a deep representational gap that prompt engineering cannot resolve.
- Abstract(参考訳): 安全アライメントは明らかに有害な出力を減少させるが、衛生的で神経ノルミティブなコミュニケーションの表現を不注意に符号化する。
両対人書き直しのパラダイムを用いて、この符号化を検証し、10大言語モデル(LLM)に対して、自閉症または神経型ペルソナから自然に発生する自閉症の言説を書き換えるよう促す。
意味的類似性に拘わらず, 自己愛的人格的書き直しは, 神経型書き直しよりも, 語彙形式や情緒的書き直しにおいて著しく多様であることがわかった。
さらに、ほとんどのモデルは対人世代をほぼ同一の出力に分解する。
この生成的破壊の背後にあるメカニズムを明らかにするために,マルチエージェント定性分析フレームワークを導入する。
この結果から, パラメータスケールではなくアライメント戦略によってクラスタリングするタスクに対して, 出力消去, ステレオタイプ幻覚, タスク回避メタコンプレクタは, 広範囲にわたる障害モードであることが明らかとなった。
最後に, 自閉症者のアノテータとの比較により, LLM分類と比較して, コミュニティ・インスパイアの知識が系統的なラベル逆転を生じさせることを示した。
現状のアライメントトレーニングでは,定性的分析によってのみ人格特異的な生成的分解が見られ,工学的に解決できない深い表現的ギャップが確認できた。
関連論文リスト
- Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations [48.69228180369574]
ヘイトスピーチアノテーションはコストが高く、主観的で、アノテータの意見の相違がちである。
大規模言語モデル(LLM)が人間の判断とどのように一致しているかを分析する。
本研究では, ヘイトスピーチコーパスから連続ヘイトスピーチスコアを再構成する。
論文 参考訳(メタデータ) (2026-05-26T13:44:48Z) - Automated Detection and Classification of Delusion-related Content in Naturalistic Audio Diaries Using Multi-Agent Language Models [9.896454972048376]
大規模言語モデル(LLM)は、自動精神疾患現象学の新しい可能性を提供する。
本稿では, 妄想的信念を示唆する言語を, きめ細かな多言語抽出のために, 自動多言語LPMパイプラインを提案する。
この研究は、自然言語における妄想的信念を示唆するコンテンツの自動検出と特徴付けのための検証済みでスケーラブルなパイプラインを提供する。
論文 参考訳(メタデータ) (2026-05-23T22:18:40Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease [72.0406069194794]
音声表現は、しばしば言語に依存した構造を符号化する。
本稿では,ソース言語による自己教師型音声表現とターゲット言語分布とを一致させる表現レベル言語シフトを提案する。
チェコ語,ドイツ語,スペイン語におけるパーキンソン病音声データセットの経口DDK記録に対するアプローチについて検討した。
論文 参考訳(メタデータ) (2026-03-23T17:23:39Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction [52.34513874272676]
既存の手法は、明示的な意味的アイデンティティよりも、絡み合った視覚的埋め込みに強く依存している、と我々は主張する。
我々はfMRI信号を、人間の視覚理解の階層的・構成的性質を反映したリッチで文レベルの意味記述に解析する。
そこで我々は,これらの明示的なセマンティックエンコーディングを視覚的プリエンプションと統合したフレームワークであるSynMindを提案する。
論文 参考訳(メタデータ) (2026-01-25T14:31:23Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - Hallucination Benchmark for Speech Foundation Models [33.92968426403491]
自動音声認識(ASR)システムにおける幻覚とは、基礎となる音響入力(すなわち、音声信号)とは全く無関係な神経性ASRモデルによって生成される流動的でコヒーレントな転写を指す。
この明らかな一貫性は、その後の処理段階を誤解させ、特に医療や法のような重要な領域において重大なリスクをもたらす可能性がある。
本稿では,ASRにおける幻覚現象を,語彙,音声,形態,意味の4つの相補軸に沿って体系的に分類し,定量化する最初のベンチマークフレームワークであるSHALLOWを紹介する。
論文 参考訳(メタデータ) (2025-10-18T16:26:16Z) - RHINO: Guided Reasoning for Mapping Network Logs to Adversarial Tactics and Techniques with Large Language Models [9.065322387043546]
人間の推論を反映した3つの解釈可能なフェーズに大言語モデルを分解するフレームワークであるRHINOを紹介する。
RHINOは、構造的推論による出力信頼性を改善しながら、低レベルの観測と反対方向のセマンティックギャップを橋渡しする。
以上の結果から,RHINOは脅威解析の解釈可能性やスケーラビリティを著しく向上させ,LLMを運用上のセキュリティ設定にデプロイするための青写真を提供することが示された。
論文 参考訳(メタデータ) (2025-10-16T02:25:46Z) - Beyond Keywords: Evaluating Large Language Model Classification of Nuanced Ableism [2.0435202333125977]
大規模言語モデル(LLM)は、r'esumのスクリーニングやコンテンツモデレーションといった意思決定タスクにますます使われています。
自閉症者を対象としたニュアンス能力の同定のための4つのLSMの能力について検討した。
以上の結果から, LLMは自閉症関連言語を識別できるが, 有害あるいは攻撃的な意味を欠くことが多いことが明らかとなった。
論文 参考訳(メタデータ) (2025-05-26T20:01:44Z) - AUTALIC: A Dataset for Anti-AUTistic Ableist Language In Context [1.3334268990558924]
AUTALICは、文脈における反音響的有能言語の検出に特化した最初のベンチマークデータセットである。
データセットはRedditから収集された2,400の自閉症関連文からなり、周囲の文脈を伴い、神経多様性の背景を持つ訓練された専門家によって注釈付けされている。
論文 参考訳(メタデータ) (2024-10-21T21:21:29Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Zero-Resource Hallucination Prevention for Large Language Models [45.4155729393135]
ハロシン化(Hallucination)とは、大規模言語モデル(LLM)が事実的に不正確な情報を生成する事例を指す。
本稿では,SELF-FAMILIARITYと呼ばれる,入力命令に含まれる概念に対するモデルの親しみ度を評価する新しい自己評価手法を提案する。
4つの異なる大言語モデルでSELF-FAMILIARITYを検証し、既存の手法と比較して一貫して優れた性能を示す。
論文 参考訳(メタデータ) (2023-09-06T01:57:36Z) - Auditing Algorithmic Fairness in Machine Learning for Health with
Severity-Based LOGAN [70.76142503046782]
臨床予測タスクにおいて,局所バイアスを自動検出するSLOGANを用いて,機械学習ベースの医療ツールを補足することを提案する。
LOGANは、患者の重症度と過去の医療史における集団バイアス検出を文脈化することにより、既存のツールであるLOcal Group biAs detectioNに適応する。
SLOGANは, クラスタリング品質を維持しながら, 患者群の75%以上において, SLOGANよりも高い公平性を示す。
論文 参考訳(メタデータ) (2022-11-16T08:04:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。