論文の概要: LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings
- arxiv url: http://arxiv.org/abs/2607.24435v1
- Date: Mon, 27 Jul 2026 13:45:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.445426
- Title: LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings
- Title(参考訳): LEX-EC:ブラックボックス設定におけるゼロショットLDMパーソナリティ分類のための語彙的エビデンス・チャンネル監査フレームワーク
- Authors: Brittany Harbison, Ashok K. Goel,
- Abstract要約: LEX-ECは再利用可能なブラックボックス監査フレームワークである。
さまざまなテキストジャンルが、どのように大きく異なるプロファイルを示すかを示す。
LEX-ECは、形質関連が利用可能な語彙的証拠とどのように異なるかを特徴付ける。
- 参考スコア(独自算出の注目度): 2.105564340986074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models may easily assign personality labels from text, but model interpretability remains an open problem. To address this gap, we introduce LEX-EC, a reusable black-box audit framework combining prevalence and agreement diagnostics with controlled lexical ablation to distinguish marginal-distribution effects from trait-associated signal recoverable under restricted evidence. Using this framework, we illustrate how various text genres may exhibit sharply different profiles: free-form essay text contains the broadest, but still weak, signal; in graduate student introductions, an observable Extraversion association weakened after masking; and single Facebook statuses yield little stable evidence even in a trait-balanced sample, indicating a possible lower bound of content or length. Masking topical and demographic content weakened some associations while leaving others detectable from function words, affective terms, and cognitive-style vocabulary. Linguistic prompting shifted model self-explanations but did not eliminate topical content. LEX-EC jointly evaluates classification prevalence, item-level association, chance-corrected agreement, persistence under lexical restriction, and prompt sensitivity in model-generated explanations. Across datasets, models, and prompts, LEX-EC characterizes how trait associations may vary with available lexical evidence, introducing a novel application of lexical methods to black-box interpretability in personality labeling.
- Abstract(参考訳): 大規模言語モデルはテキストからパーソナリティラベルを容易に割り当てることができるが、モデル解釈性は未解決の問題である。
このギャップに対処するために,制限された証拠の下で回復可能な特性関連信号から限界分布効果を識別するために,頻度と一致診断と制御された語彙アブレーションを組み合わせた再利用可能なブラックボックス監査フレームワークであるLEX-ECを導入する。
自由形式のエッセイテキストには最も広く、しかし弱い信号が含まれており、大学院生の紹介では、マスキング後に観測可能な外転協会が弱くなり、単一Facebookステータスは、特性バランスの取れたサンプルであっても、安定した証拠が得られず、内容や長さの限界が低いことを示す。
マスキングの話題や人口統計学的内容はいくつかの関連性を弱め、他は機能的な言葉、感情的な言葉、認知的なスタイルの語彙から検出された。
言語的プロンプトはモデルによる自己説明をシフトさせたが、話題の内容は排除しなかった。
LEX-ECは、分類の有病率、項目レベルの関連、機会修正合意、語彙制限による持続性、モデル生成説明の迅速な感度を共同評価する。
データセット、モデル、プロンプト全体にわたって、LEX-ECは、特性関連が利用可能な語彙的証拠とどのように異なるかを特徴付け、人格ラベル付けにおけるブラックボックスの解釈可能性への語彙的手法の新たな適用を導入している。
関連論文リスト
- Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation [59.40886078302025]
マルチモーダル大規模言語モデル(MLLM)は、視覚入力と自然言語出力の整合性を示す。
しかし、生成したトークンが視覚的モダリティに依存する範囲は、いまだに理解されていない。
MLLMにおける自己回帰トークン生成を説明するための軽量なブラックボックスフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T15:38:42Z) - SmartCLIP: Modular Vision-language Alignment with Identification Guarantees [59.16312652369709]
Contrastive Language-Image Pre-Traiing (CLIP)citepradford2021 Learningは、コンピュータビジョンとマルチモーダル学習において重要なモデルとして登場した。
CLIPは、多くの画像テキストデータセットにおける潜在的な情報ミスアライメントに苦労し、絡み合った表現に悩まされている。
モジュラー方式で、最も関連性の高い視覚的およびテキスト的表現を特定し、調整する新しいアプローチである。
論文 参考訳(メタデータ) (2025-07-29T22:26:20Z) - LiTEx: A Linguistic Taxonomy of Explanations for Understanding Within-Label Variation in Natural Language Inference [34.648042619016394]
自由文の説明を英語で分類するための言語情報を用いた分類法であるLITEXを紹介する。
この分類を用いて、e-SNLIデータセットのサブセットに注釈を付け、分類の信頼性を評価し、NLIラベル、ハイライト、説明とどのように一致しているかを分析する。
論文 参考訳(メタデータ) (2025-05-28T20:32:48Z) - Estimating Commonsense Plausibility through Semantic Shifts [66.06254418551737]
セマンティックシフトを測定することでコモンセンスの妥当性を定量化する新しい識別フレームワークであるComPaSSを提案する。
2種類の細粒度コモンセンス可視性評価タスクの評価は,ComPaSSが一貫してベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-02-19T06:31:06Z) - A Token-level Reference-free Hallucination Detection Benchmark for
Free-form Text Generation [50.55448707570669]
本稿ではトークンレベルの参照なし幻覚検出タスクとHaDesというアノテーション付きデータセットを提案する。
このデータセットを作成するために、まず英語のウィキペディアから抽出された大量のテキストセグメントを摂り込み、それからクラウドソースアノテーションで検証する。
論文 参考訳(メタデータ) (2021-04-18T04:09:48Z) - Challenges in Automated Debiasing for Toxic Language Detection [81.04406231100323]
バイアスド・アソシエーションは、有害な言語を検出するための分類器の開発において課題となっている。
我々は最近,有害な言語検出に適用されたテキスト分類データセットとモデルに対するデバイアス法について検討した。
我々の焦点は語彙(例えば、誓い言葉、スラー、アイデンティティの言及)と方言マーカー(特にアフリカ系アメリカ人の英語)である。
論文 参考訳(メタデータ) (2021-01-29T22:03:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。