論文の概要: Explainable Suicide Risk Assessment on Social Media with Multi-Task QLoRA
- arxiv url: http://arxiv.org/abs/2610.00610v2
- Date: Fri, 02 Oct 2026 02:17:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.980992
- Title: Explainable Suicide Risk Assessment on Social Media with Multi-Task QLoRA
- Title(参考訳): マルチタスクQLoRAを用いたソーシャルメディア上での自殺リスク評価
- Abstract要約: 本稿は,メディア上での自殺リスク評価に関するIEEE BigData 2026 Cupについて紹介する。
提案手法は,Qwen2.5-Instructモデルに対して,量子化低ランク適応(QLoRA)と応答行列型因果言語モデルを用いて適応する。
リスク分類のための3つのタスクを共同でトレーニングし、証拠抽出のためのタスク1a,1bを共同でトレーニングし、要因識別のためにタスク2を個別に適応する。
- 参考スコア(独自算出の注目度): 8.466496157219282
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Explainable suicide-risk assessment requires models not only to estimate risk severity, but also to identify supporting language and the risk and protective factors expressed in a post. We present our system for the IEEE BigData 2026 Cup on Explainable Suicide Risk Assessment on Social Media, which addresses three tasks: risk-level classification, evidence phrase extraction, and multi-label factor identification. Our approach adapts Qwen2.5-Instruct models using quantized low-rank adaptation (QLoRA) and an answer-masked causal language-model objective. We jointly train across all three tasks for risk classification, jointly train on Tasks 1a and 1b for evidence extraction, and adapt Task 2 separately for factor identification. We also tailor aggregation to each output: we average risk-level probabilities from the 32B and 72B models, combine evidence phrases through cross-fold consensus, and calibrate factor-specific decisions through rate matching based on out-of-fold operating points. On the official leaderboard, the final system achieved a composite score of 0.7738, with 0.8089 on Task 1 and 0.6919 on Task 2. Across the evaluated configurations, three-task training performed best for Task 1a, joint training on Tasks 1a and 1b performed best for Task 1b, and task-specific training performed best for Task 2. Probability averaging further improved Task 1a when component models had complementary errors. These findings highlight the value of tailoring both training objectives and aggregation strategies to the output structure of each task within a unified language-model framework.
- Abstract(参考訳): 説明可能な自殺リスク評価は、リスク重大度を推定するだけでなく、サポート言語と投稿で表されるリスクと保護要因を識別するモデルを必要とする。
我々は,リスクレベル分類,エビデンスフレーズ抽出,マルチラベル因子同定という3つの課題に対処する,ソーシャルメディアにおける説明可能な自殺リスク評価に関するIEEE BigData 2026カップのシステムを提案する。
提案手法は,Qwen2.5-Instructモデルに対して,量子化低ランク適応(QLoRA)と応答行列型因果言語モデルを用いて適応する。
リスク分類のための3つのタスクを共同でトレーニングし、証拠抽出のためのタスク1a,1bを共同でトレーニングし、要因識別のためにタスク2を個別に適応する。
私たちは、32Bモデルと72Bモデルからリスクレベル確率を平均化し、クロスフォールドコンセンサスを通じてエビデンスフレーズを組み合わせて、アウト・オブ・フォールド操作ポイントに基づいたレートマッチングによるファクター固有の決定を調整します。
公式のリーダーボードでは、最終システムは0.7738、タスク1では0.8089、タスク2では0.6919となった。
評価された構成全体では、タスク1a、タスク1a、タスク1bの3タスクトレーニングが、タスク1bの3タスクトレーニングが、タスク2の3タスクトレーニングが最善である。
コンポーネントモデルに相補的なエラーが発生した場合、平均的な確率はタスク1aをさらに改善した。
これらの知見は、統一言語モデルフレームワーク内の各タスクの出力構造にトレーニング目標とアグリゲーション戦略の両方を合わせることの価値を強調した。
関連論文リスト
- Bag of Tricks or Bag of Myths? Reducing Modeling Complexity with Task Knowledge in Explainable Suicide Risk Assessment [7.984072866387194]
ソーシャルメディアのテキストから自殺リスクを評価することは、小さくて高リスクな設定だ。
モデルスケーリング、合成データ、損失再重み付け、アンサンブル、しきい値チューニングなどの一般的なNLP技術は、テストなしで適用されることが多い。
当科では, 臨床医が記載したポスト1,635点について調査し, 7家系の検査31点について検討した。
論文 参考訳(メタデータ) (2026-09-07T17:14:19Z) - Inducing Task Models from Computer-Use Traces [50.6293197430374]
タスクモデルインジェクション(TMI)は、制約のないトレース内の潜在タスクを検出し、同時に動作を停止する。
TMIは、観測された実行ステップの74.9%を再構築している。
TMIのタスクモデルから得られたスキルは、最強のベースラインに対して、ホールドアウトタスクの精度を30.0%向上させる。
論文 参考訳(メタデータ) (2026-08-20T17:57:00Z) - SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows [0.0]
本稿では,言語モデルエージェントによる生産指向タスク配信評価のベンチマークであるSQBenchを紹介する。
SQBench v1.0には、L1アトミック機能、L2コンポジットスキル、L3ビジネスシナリオで構成された220の標準化されたタスクが含まれている。
Completion = 1, 113 (4.8%) の 2,348 結果のうち、検証不能な引用、不適切なリソース使用、フォーマット違反などのリスクのために、Strict Pass の基準が満たされない。
論文 参考訳(メタデータ) (2026-07-25T09:55:31Z) - SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses [0.0]
FailureScopeは、クロスモデルパス/フェイルパターンによる評価プローブをクラスタ化する行動診断手法である。
通常、シングルターン・ベンチマーク、マルチターン・ダイアログ、敵エージェント・アタックの3つのレシスタンスに対して安定かつ解釈可能な障害をもたらすことを示す。
論文 参考訳(メタデータ) (2026-06-03T01:28:00Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - CoT-Saliency: Unified Chain-of-Thought Reasoning for Heterogeneous Saliency Tasks [96.64597365827046]
本稿では,3つの運用上不均一なサリエンシタスクを共同で処理する,最初の統合フレームワークを提案する。
タスクの不均一性を橋渡しする視覚言語モデル(VLM)において、チェーン・オブ・ソート(CoT)推論プロセスを導入する。
我々は,全タスクにまたがる特別なSOTA手法と強力なクローズドソースVLMの整合性を示す。
論文 参考訳(メタデータ) (2025-11-01T04:37:01Z) - ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models [20.274878511727945]
ReasoningShieldは、Large Reasoning Models (LRMs)におけるChain-of-Thoughts (CoTs)をモデレートするためのフレームワークである
ReasoningShieldは最新のパフォーマンスを実現し、LlamaGuard-4のようなタスク固有のツールを35.6%、GPT-4oのような汎用商用モデルを15.8%向上させた。
論文 参考訳(メタデータ) (2025-05-22T19:44:41Z) - Model Predictive Task Sampling for Efficient and Robust Adaptation [57.414812940406996]
本稿では,タスク空間と適応リスク分布をブリッジするフレームワークであるモデル予測タスクサンプリング(MPTS)を紹介する。
MPTSは、エピソード最適化プロセスの特徴付けに生成モデルを使用し、後部推論によりタスク固有の適応リスクを予測する。
MPTSはゼロショット、少数ショット、教師付き微調整設定にシームレスに統合される。
論文 参考訳(メタデータ) (2025-01-19T13:14:53Z) - Robust Learning Through Cross-Task Consistency [92.42534246652062]
クロスタスク整合性を用いた学習向上のための,広く適用可能な完全計算手法を提案する。
クロスタスク一貫性による学習は,より正確な予測と,アウト・オブ・ディストリビューション・インプットの一般化につながることを観察する。
論文 参考訳(メタデータ) (2020-06-07T09:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。