論文の概要: Do LLMs Reliably Identify Correct Information Units in Aphasic Discourse?
- arxiv url: http://arxiv.org/abs/2606.15696v1
- Date: Fri, 10 Apr 2026 01:53:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.904234
- Title: Do LLMs Reliably Identify Correct Information Units in Aphasic Discourse?
- Title(参考訳): LLMは失語論における正しい情報単位を確実に特定しているか?
- Abstract要約: 本研究では,アクセシックな談話書き起こしからトークンレベルのCIU分類を確実に行うことができるかを検討した。
LLMに基づくCIUスコアリングは、談話アセスメントシステムの有望な人道的要素である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Correct Information Units (CIUs) are central to discourse assessment in aphasia because they quantify communicative informativeness rather than linguistic form alone. However, CIU scoring is time intensive and requires trained raters. This study examined whether instruction-tuned large language models (LLMs) can reliably perform token-level CIU classification from aphasic discourse transcripts. Sixteen picture-description transcripts elicited with the Cat Rescue stimulus were annotated for CIU status according to Nicholas and Brookshire (1993). The sample spanned four severity strata: control, mild, moderate, and severe aphasia. Four publicly available instruction-tuned LLMs were benchmarked under zero-shot and two few-shot prompting conditions across five stratified random seeds. Performance was evaluated against consensus human labels using accuracy, precision, recall, F1, and Cohen's kappa. Zero-shot prompting was insufficient across models. In contrast, few-shot prompting yielded substantial gains and produced competitive performance for three viable models. Mean few-shot F1 scores ranged from 0.776 to 0.817 across Llama-3.1-8B, Qwen2.5-7B, and Mistral-7B, with no significant differences between fixed global and per-chunk local example selection. Phi-3-mini was unstable and did not yield reliable performance. Viable models showed high recall but lower precision, suggesting systematic over-classification of tokens as CIUs. Performance also varied by discourse severity, with the weakest results in more severe aphasia. Few-shot LLM prompting can support automated CIU identification without gradient-based task training, but agreement with human annotation remains insufficient for fully autonomous use. These findings support LLM-based CIU scoring as a promising human-in-the-loop component of discourse assessment systems.
- Abstract(参考訳): 正しい情報単位 (CIUs) は、言語形式だけでなく、コミュニケーション上の情報性も定量化するため、失語症における言論評価の中心である。
しかし、CIUスコアリングは時間集約的で、トレーニングされたレーダが必要です。
本研究では,アクセシックな談話書き起こしからトークンレベルのCIU分類を確実に行うことができるかを検討した。
ニコラス・アンド・ブルックシャー(1993年)によると、キャットレスキュー刺激によって引き起こされた16枚の写真記述写本がCIUのステータスのために注釈付けされた。
試料は, コントロール, 軽度, 中等度, 重度失語の4つの重度層に分布していた。
一般に公開されている4つのLLMは、ゼロショットと5つの階層化されたランダムシードの2つの数発のプロンプト条件の下でベンチマークされた。
精度,精度,リコール,F1,コーエンのカッパを用いたコンセンサス評価を行った。
ゼロショットプロンプトはモデル間では不十分だった。
対照的に、数発のプロンプトは実質的な利益をもたらし、3つの実行可能なモデルの競争性能を生み出した。
数点のF1スコアは、Llama-3.1-8B、Qwen2.5-7B、Mistral-7Bにまたがる0.776から0.817の範囲で、固定されたグローバルとチャンク毎のローカルのサンプル選択には大きな違いはない。
Phi-3-miniは不安定で信頼性に欠けていた。
生存可能なモデルは高いリコール精度を示したが、精度は低く、トークンをCIUとして体系的に過剰に分類することを示唆した。
言論の重大さによってもパフォーマンスは変化し、最も弱い結果はより重篤な失語症である。
LLMプロンプトは、勾配ベースのタスクトレーニングなしでCIUの自動識別をサポートすることができるが、完全な自律的使用には人間のアノテーションとの一致が不十分である。
これらの結果は,LLMに基づくCIUスコアリングを,談話アセスメントシステムにおいて有望な人間-イン-ザ-ループコンポーネントとしてサポートしている。
関連論文リスト
- Available but Unclaimed: An Empirical Study of Human-AI Synergy [27.380163033481015]
人々は大きな言語モデル(LLM)でますます理にかなっている
研究では、参加者はマトリックス推論、メンタルローテーション、シロジズム、レターストリングの類似、GPT-5.6-ルナ、クロード・オプス4.8、ジェミニ3.6フラッシュ、キミK3の40イットのバッテリーを解いた。
補聴器の精度差は項目レベルのLCM能力に比例して増大した。
論文 参考訳(メタデータ) (2026-09-15T08:01:37Z) - Beyond the Name: Demographic Leakage in De-Identified Résumés and Evaluation Artifacts in LLM Bias Audits [4.736836688901646]
本研究では,9つのオープンウェイトモデルと620レサムモデルにおいて,言語フィールドの除去がリークを解消するか否かを検討する。
5つの民族的条件と3つのクエー・サリエンス層にまたがる非構造的散文を分離した。
目標グループの回復平均は0.757であり、高塩分下では1.000で飽和する。
論文 参考訳(メタデータ) (2026-09-15T01:48:44Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness [0.0]
少数のインプット・アウトプット・デモペアをクエリにプリプロンプトして大きな言語モデルに提示する手法であるFew-shot promptingは、NLPで広く採用されている。
しかし、分類性能において、ショットカウントがモデルスケール、アーキテクチャ、出力フォーマットのコンプライアンスとどのように相互作用するかについて、体系的な研究はほとんど行われていない。
論文 参考訳(メタデータ) (2026-07-25T00:31:40Z) - Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Prompt Sensitivity and Answer Consistency of Small Open-Source Large Language Models on Clinical Question Answering: Implications for Low-Resource Healthcare Deployment [0.0]
小規模のオープンソース言語モデルは、低リソース環境でのヘルスケアアプリケーションに注目を集めている。
臨床質問応答データセットを用いて,5つのオープンソースモデル(Gemma 2 2B, Phi-3 Mini 3.8B, Llama 3.2 3B, Mistral 7B, Meditron-7B)を評価した。
論文 参考訳(メタデータ) (2026-03-01T04:37:48Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Practical Machine Learning for Aphasic Discourse Analysis [0.0]
本研究は、画像記述作業中に、正しい情報単位(CIU)を確実に識別するための5つの機械学習モデルを評価する。
ベースラインモデルのトレーニングは、単語対非単語の書き起こしに対して高い精度を実現し、全てのモデルがほぼ完璧な性能を達成した。
対照的にCIU対非CIUは、k-nearest neighbor(k-NN)モデルが最も正確(0.824)で、AUC(0.787)が2番目に高い。
論文 参考訳(メタデータ) (2025-11-12T11:42:17Z) - SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models [74.40683913645731]
Zero-shot Multi-label Recognition (MLR) with Vision-Language Models (VLMs) は、トレーニングデータ、モデルチューニング、アーキテクチャの変更なしに重要な課題に直面している。
我々の研究は、VLMをブラックボックスとして扱い、トレーニングデータや地上の真実を使わずにスコアを活用する新しいソリューションを提案する。
これらのプロンプトスコアの分析により、VLMバイアスとAND'/OR信号の曖昧さが明らかになり、特に、最高スコアは2番目に高いスコアに比べて驚くほど低い。
論文 参考訳(メタデータ) (2025-02-24T07:15:05Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Prompt Perturbation Consistency Learning for Robust Language Models [47.021022978847036]
大規模言語モデル(LLM)は、多くの自然言語処理タスクにおいて印象的なパフォーマンスを示している。
微調整を十分に行うと,識別モデルに匹敵するIC-SF性能が得られることを示す。
クリーンサンプルと摂動サンプルの損失の分散を規則化して機能する,効率的な緩和手法であるPrompt Perturbation Consistency Learning(PPCL)を提案する。
論文 参考訳(メタデータ) (2024-02-24T15:00:58Z) - CTC-based Non-autoregressive Speech Translation [51.37920141751813]
非自己回帰音声翻訳における接続性時間分類の可能性について検討する。
我々は、CTCによって誘導される2つのエンコーダからなるモデルを構築し、ソースおよびターゲットテキストを予測する。
MuST-Cベンチマークの実験では、我々のNASTモデルは平均BLEUスコアが29.5であり、スピードアップは5.67$times$である。
論文 参考訳(メタデータ) (2023-05-27T03:54:09Z) - Using Natural Language Explanations to Rescale Human Judgments [81.66697572357477]
大規模言語モデル(LLM)を用いて順序付けアノテーションと説明を再スケールする手法を提案する。
我々は、アノテータのLikert評価とそれに対応する説明をLLMに入力し、スコア付けルーリックに固定された数値スコアを生成する。
提案手法は,合意に影響を及ぼさずに生の判断を再スケールし,そのスコアを同一のスコア付けルーリックに接する人間の判断に近づける。
論文 参考訳(メタデータ) (2023-05-24T06:19:14Z) - Navigating Prompt Complexity for Zero-Shot Classification: A Study of Large Language Models in Computational Social Science [27.727207443432278]
本稿では,ChatGPTとOpenAssistantの2つの公開言語モデルのゼロショット性能を評価する。
その結果,異なるプロンプト戦略が分類精度に大きく影響し,F1スコアが10%を超えることが判明した。
論文 参考訳(メタデータ) (2023-05-23T17:48:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。