論文の概要: Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking
- arxiv url: http://arxiv.org/abs/2607.05901v1
- Date: Tue, 07 Jul 2026 06:56:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.414313
- Title: Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking
- Title(参考訳): アドバンテージ重み付けによる二項抑うつ検出における潜伏抑うつの重症度
- Abstract要約: 本稿では,時間エンコーダと相互変換器を具備した微細なマルチモーダルフレームワークを提案する。
我々のコアコントリビューションは2つの相補的なメカニズムを通じて潜在空間分布を最適化するバイナリアドバンテージ重み付けランク付け損失である。
D-vlog と LMVD の実験により、我々のモデルはハードペアの優先順位付けにより遅延順序構造を再構成し、最先端の性能を実現することを示した。
- 参考スコア(独自算出の注目度): 20.77940776708036
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic depression detection using audio-visual data faces significant challenges, particularly in disentangling overlapping feature distributions and establishing robust decision boundaries. To address this, we propose a fine-grained multimodal framework featuring a temporal encoder and a mutual transformer to facilitate deep cross-modal fusion. Our core contribution is the Binary Advantage-weighting Ranking Loss, which optimizes the latent space distribution through two complementary mechanisms: Advantage-weighted Separation, which mines hard pairs by computing a pairwise prediction difference matrix and dynamically weighting them based on their difficulty; and Advantage-weighted Compactness, which minimizes intra-class variance to force features to cluster around their respective class centers. Extensive experiments on D-vlog and LMVD demonstrate that our model reconstructs the latent ordinal structure by prioritizing hard pairs, thereby achieving state-of-the-art performance.
- Abstract(参考訳): 音声・視覚データを用いた自動抑うつ検出は、特に重複する特徴分布を解消し、堅牢な決定境界を確立する上で大きな課題に直面している。
そこで本稿では,時間エンコーダと相互変換器を具備した細粒度マルチモーダルフレームワークを提案する。
我々の中核的な貢献は,2つの相補的なメカニズムによって潜伏空間の分布を最適化するバイナリ・アドバンテージ・オーバリング・ランクリング・ロス (Binary Advantage-weighting Ranking Loss) と,それぞれのクラス中心を囲む特徴のクラス内分散を最小限に抑えるアドバンテージ・オーバリング・コンパクトネス (Advantage-weighted Compactness) である。
D-vlog と LMVD に関する大規模な実験により、我々のモデルはハードペアの優先順位付けにより遅延順序構造を再構成し、最先端の性能を達成することを示した。
関連論文リスト
- Beyond the Aggregation Dilemma: Prior-Retaining Decoupled Learning for Multimodal Graphs [69.56407708794845]
MultimodalAttributed Graph Learning (MAGL)はグラフアグリゲーションを通じてノード属性と構造トポロジーを統合する。
事前訓練されたエンコーダがLarge Foundation Models (LFM) へと進化するにつれて、MAGLのランドスケープは根本的に変化していく。
高信頼のLFM先行の下では、強制集約は、識別シグナルを圧倒するトポロジカル固有のノイズを導入する。
本稿では、分離されたデュアルパスパラダイムであるSUPRA(Shared-Unique Prior-Retaining Architecture)を提案する。
SUPRAは、トポロジ・アグノシクスによるモーダリティ特異的な特徴を処理し、軽量共有GNNを介して構造相乗効果を捉え、補助的な深層監視対策の勾配飢餓を発生させる。
論文 参考訳(メタデータ) (2026-05-23T17:42:25Z) - Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - Feature-level Interaction Explanations in Multimodal Transformers [1.7101146971136896]
マルチモーダルトランスフォーマーは、異なるモーダルが共同で意思決定をどのように支援するかを明確にすることなく、予測を生成する。
本稿では,凍結した事前学習エンコーダからトークン/パッチシーケンスを直接操作する構造化Mixture-of-Experts層であるFeature-level I2MoEを提案する。
我々は,帰属とトップK%マスキングを組み合わせ,忠実度を評価する専門的な説明パイプラインを開発する。
論文 参考訳(メタデータ) (2026-03-04T18:24:31Z) - Spend Search Where It Pays: Value-Guided Structured Sampling and Optimization for Generative Recommendation [16.991391135071513]
本稿では,価値誘導型サンプリングおよびツリー構造化アドバンテージ強化フレームワークであるV-STARを提案する。
V-STARは2つの相乗的成分を介して自己進化ループを形成する。まず、決定ノードを識別し、高次接頭辞を選択的に深めるために価値誘導効率復号法(VED)を開発する。
第2に、誘導木トポロジーを利用して兄弟関係の利点を計算し、決定的な分岐決定に学習信号に集中するシブリング-GRPOを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:57:36Z) - Modest-Align: Data-Efficient Alignment for Vision-Language Models [67.48633659305592]
クロスモーダルアライメントモデルは、リソース制約のある環境での運用において、過信と劣化したパフォーマンスに悩まされることが多い。
我々は,ロバスト性と効率性に配慮した軽量アライメントフレームワークであるModest-Alignを提案する。
本手法は,実世界の低リソースシナリオにおけるクロスモーダルアライメントを実現するための,実用的でスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2025-10-24T16:11:10Z) - Dual-granularity Sinkhorn Distillation for Enhanced Learning from Long-tailed Noisy Data [67.25796812343454]
ディープラーニングのための実世界のデータセットは、クラス不均衡とラベルノイズの共起的な課題にしばしば悩まされる。
蒸留と相補的な知見の統合により二重強靭性を高める新しいフレームワークであるD-SINKを提案する。
ベンチマークデータセットの実験では、D-SINKはロバスト性を大幅に向上し、長い尾のノイズデータから学習する際の強い経験的性能を達成することが示された。
論文 参考訳(メタデータ) (2025-10-09T13:05:27Z) - Diverse Text-to-Image Generation via Contrastive Noise Optimization [60.48914865049489]
テキスト・ツー・イメージ(T2I)拡散モデルは高忠実度画像の生成において顕著な性能を示した。
既存のアプローチは通常、推論中に中間の潜伏状態やテキスト条件を最適化する。
本稿では,多様性問題に異なる視点から対処する簡易かつ効果的な手法であるContrastive Noise Optimizationを紹介する。
論文 参考訳(メタデータ) (2025-10-04T13:51:32Z) - SOFARI: High-Dimensional Manifold-Based Inference [8.110522214647489]
我々は、高次元多様体に基づくSOFAR推論(SOFARI)と呼ばれる新しいアプローチを提案する。
推論を可能にするために不可欠である基礎となるスティーフェル多様体構造を利用することで、SOFARIは潜在左因子ベクトルと特異値の両方に対して、容易に使用可能なバイアス補正推定器を提供する。
本稿では,SOFARIの有効性を概説し,シミュレーション例による理論結果の正当化と,経済予測における実データの適用について述べる。
論文 参考訳(メタデータ) (2023-09-26T16:01:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。