論文の概要: Assessing Suicide Risk in Arabic Crisis Helpline Calls: A Comparison of Arabic and English Large Language Models
- arxiv url: http://arxiv.org/abs/2609.00191v1
- Date: Mon, 31 Aug 2026 18:11:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.929294
- Title: Assessing Suicide Risk in Arabic Crisis Helpline Calls: A Comparison of Arabic and English Large Language Models
- Title(参考訳): アラビア語危機ヘルプラインコールにおける自殺リスクの評価:アラビア語と英語の大規模言語モデルの比較
- Abstract要約: レバノンの国家的情緒的支援と自殺防止のためのライフラインを分析した。
コールは、レバンティーヌ・アラビア語の音声認識モデルで書き起こされ、アラビア名義認識モデルは、ローカルで識別情報を削除した。
オペレーターはコロンビア自殺重大度評価尺度の5つの自殺観念項目を記録し、それらを2つのバイナリー結果、すなわちリスクとリスクの2つにまとめた。
最高のアラビア語モデルは81.19のマクロF1、ハイリスクのROC-AUCは90.61に達し、最高の英語モデルは85.00と92.59に達し、ハイリスクの88.9%を識別した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Crisis helplines assess suicide risk through structured interviews, a process that is slow and dependent on operator training and workload. Natural language processing could support risk assessment and call prioritization, but almost no work addresses Arabic-language helpline calls or operates within the privacy constraints of real helpline data. We analysed de-identified transcripts from Lebanon's National Lifeline for Emotional Support and Suicide Prevention. Audio never left the helpline: calls were transcribed on site with a speech recognition model for Levantine Arabic, and an Arabic named-entity recognition model removed identifying information locally. Only the de-identified transcripts were shared with the research team. Operators recorded the five suicidal ideation items of the Columbia Suicide Severity Rating Scale, which we combined into two binary outcomes: at-risk and high-risk. We also machine-translated the transcripts into English, giving a paired Arabic/English comparison. On each corpus, we fine-tuned five instruction-tuned large language models alongside six transformer encoder baselines (four Arabic, two English) and evaluated all models on a held-out test set. We included 383 calls: 373 for the at-risk task (52.3% positive) and 297 for the high-risk task (30.0% positive). The best Arabic model reached a macro-F1 of 81.19 and a ROC-AUC of 90.61 on high-risk; the best English model reached 85.00 and 92.59, identifying 88.9% of high-risk calls. In both languages, high-risk calls separated more cleanly than at-risk calls, and translation to English did not reduce the best observed performance. Suicide risk can be classified from de-identified Arabic transcripts without sending audio outside the helpline. The high-risk results support further testing as an operator-facing tool; lower-severity ideation proved the harder case.
- Abstract(参考訳): 危機支援は、作業者のトレーニングや作業負荷に依存するプロセスである構造化インタビューを通じて自殺リスクを評価する。
自然言語処理はリスクアセスメントとコールの優先順位付けをサポートすることができるが、アラビア語のヘルプライン呼び出しや実際のヘルプラインデータのプライバシー制約内での操作は、ほとんどない。
レバノンの国家自殺支援・自殺防止のためのライフラインから、未確認の写本を分析した。
音声はヘルプラインを離れることはなかった:電話はレバンティーヌ・アラビア語の音声認識モデルで書き起こされ、アラビアの匿名認識モデルはローカルに識別情報を削除した。
未確認の写本のみが研究チームと共有された。
オペレーターはコロンビア自殺重大度評価尺度の5つの自殺観念項目を記録し、それらを2つのバイナリー結果、すなわちリスクとリスクの2つにまとめた。
また、機械翻訳を英語に翻訳し、アラビア語と英語を比較した。
各コーパスでは、6つのトランスフォーマーエンコーダベースライン(アラビア語4つ、英語2つ)とともに5つの命令調整された大言語モデルを微調整し、全てのモデルをホールドアウトテストセットで評価した。
リスクの高いタスクは373件(52.3%)、リスクの高いタスクは297件(0.0%)であった。
最高のアラビア語モデルは81.19のマクロF1、高リスクのROC-AUCは90.61に達し、最高の英語モデルは85.00と92.59に達し、ハイリスクの88.9%を占めた。
どちらの言語でも、ハイリスクな呼び出しはリスクの高い呼び出しよりもきれいに分離され、英語への翻訳は最高のパフォーマンスを損なうことはなかった。
自殺リスクは、ヘルプラインの外で音声を送ることなく、未同定のアラビア文字から分類することができる。
リスクの高い結果は、オペレーター向けのツールとしてさらなるテストをサポートする。
関連論文リスト
- Redteaming Leading Arabic LLMs with ASAS [7.552587851046888]
大型言語モデル (LLM) をリピートする最初の完全人為的なアラビア語ベンチマークである、アラビア安全指数 (ASAS) を紹介する。
ASASには8つの安全カテゴリーと8つの攻撃戦略にまたがる801のプロンプトがあり、モダンスタンダードアラビア(MSA)の理想的な応答がある。
我々は、GPT-4o、Claude 3.7 Sonnet、ALaM、FANARなどの地域モデルを含む、アラビアの能力を持つ7つの主要なモデルに対して、リピーピング評価を行う。
人間のアノテータは、構造化された4ポイントの安全尺度を使用してレスポンスを評価し、ほとんどのモデルが安全でないプロンプトの50%に対して防御に失敗していることを明らかにした。
論文 参考訳(メタデータ) (2026-08-22T14:34:08Z) - ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification [1.4665143197624044]
そこで本研究では,6種類のアラビア種を対象とする人為的アラビア安全データセット25,071件について紹介する。
データセットには、方言ラベルと7つのきめ細かい調和カテゴリが注釈付けされている。
教師付きおよび生成モデル7つをベンチマークした結果、微調整されたMARBERTv2が最も高い性能が得られることがわかった。
論文 参考訳(メタデータ) (2026-08-02T15:00:58Z) - Evaluation of Adversarial Robustness in Arabic Language Models [2.1665689529884697]
本研究は、アラビア語に対する攻撃の異なるセットの下で、最先端の5つのアラビア語モデルの堅牢性を評価することを目的としている。
ダイアクリティカルティクスの挿入は、低距離を維持しながら、いくつかのモデルの精度を92%削減することができる。
単語レベルの攻撃では、アラビア語の接続を操作することは、高い意味的類似度スコア、低い距離を保持し、最大58%の精度低下をもたらす。
文レベルの攻撃では、パラフレーズ化は犠牲者モデルの性能を平均で76%削減することで効果を証明している。
論文 参考訳(メタデータ) (2026-07-28T14:58:28Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation [111.94720088481614]
多モーダル生成モデルは方言テキスト入力を効果的に生成できるのか?
6つの共通英語方言にまたがる大規模ベンチマークを構築した。
マルチモーダル生成モデルのための一般的なエンコーダに基づく緩和戦略を設計する。
論文 参考訳(メタデータ) (2025-10-16T17:56:55Z) - Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale [51.41777906371754]
私たちはHalaを紹介します。これはアラビア語中心の命令と翻訳モデルのファミリーで、私たちのトランスレーショナル・トゥン・パイプラインで構築されています。
軽量言語モデル LFM2-1.2B は、このデータに基づいて微調整され、高品質の英語の命令セットをアラビア語に翻訳するために使用される。
我々は、Halaモデルを350M、700M、1.2B、9Bパラメータでトレーニングし、アラビア語の特殊化とベースモデルの強度のバランスをとるためにスラープマージを適用します。
論文 参考訳(メタデータ) (2025-09-17T14:19:28Z) - Language-Agnostic Suicidal Risk Detection Using Large Language Models [9.90722058486037]
本研究では,大規模言語モデル(LLM)を用いた自殺リスク評価のための新しい言語非依存フレームワークを提案する。
ASRモデルを用いて音声から中国語の書き起こしを生成し、その後、これらの書き起こしから自殺リスクに関連する特徴を抽出するために、プロンプトベースのクエリを用いたLLMを用いる。
実験結果から,ASRによる直接微調整や,中国の自殺リスク関連機能のみを訓練したモデルに比較して,本手法の有効性が示唆された。
論文 参考訳(メタデータ) (2025-05-26T15:12:10Z) - Jailbreaking LLMs with Arabic Transliteration and Arabizi [13.252144130838557]
本研究は,大規模言語モデル(LLM)による'jailbreak'攻撃の潜在的な脆弱性を明らかにする。
我々の調査はアラビア語の調査の範囲を広げる。
アラビア語とその様々な形態を使用することで、隠されたままの情報を公開することができ、脱獄のリスクが高まる可能性がある。
論文 参考訳(メタデータ) (2024-06-26T19:48:48Z) - TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning [63.481446315733145]
多言語大言語モデル(LLM)に対する言語間バックドア攻撃は未調査である。
本研究は, 教育指導データが有毒でない言語に対して, 教育指導データの有毒化がアウトプットに与える影響について検討した。
本手法は,mT5 や GPT-4o などのモデルにおいて,高い攻撃成功率を示し,12言語中7言語以上で90%以上を突破した。
論文 参考訳(メタデータ) (2024-04-30T14:43:57Z) - ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic [51.922112625469836]
アラビア語における最初のマルチタスク言語理解ベンチマークである、データセット名を提案する。
我々のデータは、現代標準アラビア語(MSA)における40のタスクと14,575のマルチチョイス質問で構成されており、地域の母語話者と協調して慎重に構築されている。
35モデルについて評価した結果,特にオープンソースモデルにおいて,改善の余地がかなり高いことが判明した。
論文 参考訳(メタデータ) (2024-02-20T09:07:41Z) - No Language Left Behind: Scaling Human-Centered Machine Translation [69.28110770760506]
低レベルの言語と高レベルの言語のパフォーマンスギャップを狭めるためのデータセットとモデルを作成します。
何千ものタスクをトレーニングしながらオーバーフィッティングに対処するために,複数のアーキテクチャとトレーニングの改善を提案する。
本モデルでは,従来の最先端技術と比較して,BLEUの44%の改善を実現している。
論文 参考訳(メタデータ) (2022-07-11T07:33:36Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。