論文の概要: MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos
- arxiv url: http://arxiv.org/abs/2607.27895v1
- Date: Thu, 30 Jul 2026 09:12:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.480892
- Title: MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos
- Title(参考訳): MMHBench: 長期ビデオにおけるメンタルヘルス理解のためのマルチパースペクティブベンチマーク
- Abstract要約: マルチパースペクティブなメンタルヘルス理解のための総合的なベンチマークであるMMHBenchを紹介する。
MMHBenchは268の長編ビデオと2,184の精査された質問で構成されている。
多様な社会的役割をシミュレートし,複数の視点から質問を合成するマルチエージェント質問生成(MAQG)フレームワークを提案する。
- 参考スコア(独自算出の注目度): 23.00288692206162
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Mental health understanding in long-form videos requires nuanced reasoning over observable behavior, interpersonal context, and latent psychological states. Existing benchmarks largely reduce this task to coarse-grained classification, providing limited insight into whether models truly understand psychological phenomena or rely on superficial correlations. To address this limitation, we introduce MMHBench, a comprehensive multimodal benchmark for multi-perspective mental health understanding, comprising 268 long-form videos and 2,184 carefully curated questions. MMHBench organizes the evaluation into two complementary settings: (1) third-person assessment, consisting of 605 questions that focus on the interpretation of observable behaviors and multimodal evidence, and (2) first-person perspective-taking, comprising 1,579 questions that require perspective-conditioned reasoning to identify the interpretation of the mental state supported by the available multimodal evidence. We propose a Multi-Agent Question Generation (MAQG) framework that simulates diverse social roles to synthesize questions from multiple perspectives. The generated questions are refined through multi-role feedback and iterative optimization, followed by expert-guided verification to ensure quality and validity. Extensive evaluation of 22 representative multimodal large language models (MLLMs), spanning both open-source and leading closed-source models, demonstrates that long-form video mental health understanding remains highly challenging.
- Abstract(参考訳): ロングフォームビデオにおけるメンタルヘルスの理解には、観察可能な行動、対人的文脈、潜伏した心理的状態に対するニュアンスな推論が必要である。
既存のベンチマークでは、このタスクを大まかに分類し、モデルが本当に心理的現象を理解しているのか、表面的相関に依存しているのかという限られた洞察を与えている。
この制限に対処するため、MMHBenchは、268の長編ビデオと2,184の精査された質問を含む、多視点のメンタルヘルス理解のための総合的マルチモーダル・ベンチマークである。
MMHBenchは,(1)観察可能な行動とマルチモーダルな証拠の解釈に焦点をあてた605の質問からなる第三者評価,(2)多モーダルな証拠によって支えられるメンタルな状態の解釈を特定するために,視点条件の推論を必要とする1,579の質問からなる1,579の視点評価という2つの補完的な設定に分類する。
多様な社会的役割をシミュレートし,複数の視点から質問を合成するマルチエージェント質問生成(MAQG)フレームワークを提案する。
生成した質問は、マルチロールフィードバックと反復最適化によって洗練され、続いて、品質と妥当性を保証するための専門家誘導検証が続く。
オープンソースモデルと主要なクローズドソースモデルの両方にまたがる22の代表的なマルチモーダル大規模言語モデル(MLLM)の広範囲な評価は、ビデオの長期的メンタルヘルス理解が依然として極めて困難であることを証明している。
関連論文リスト
- How Far Are Video Models from True Multimodal Reasoning? [32.10821745418955]
CLVG-Benchは、ビデオモデルのゼロショット推論能力を調査するために設計された評価フレームワークである。
高品質で手動で注釈付けされたメタデータが6つのカテゴリと47のサブカテゴリにまたがっている。
最小限のアノテーションを用いて人間の専門家の認識と一致した適応的ビデオ評価器(AVE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T08:04:02Z) - MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs [61.70050081221131]
MVU-EvalはMLLMのマルチビデオ理解を評価するための最初の包括的なベンチマークである。
私たちのMVU-Evalは、主に8つのコア能力を評価し、4,959本のビデオにまたがる1,824本の厳密にキュレートされた質問応答ペアを評価します。
これらの機能は、自律システムにおけるマルチセンサー合成や、クロスアングルスポーツ分析のような現実世界のアプリケーションと厳格に一致している。
論文 参考訳(メタデータ) (2025-11-10T16:02:33Z) - SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models [89.10286051587151]
SciVideoBenchは、科学的文脈における高度なビデオ推論を評価するために設計された厳密なベンチマークである。
SciVideoBenchは、最先端の科学実験ビデオから得られた、慎重に構築された1000の多重選択質問で構成されている。
我々の評価は、最先端のプロプライエタリおよびオープンソース LMM における大幅な性能低下を浮き彫りにしている。
論文 参考訳(メタデータ) (2025-10-09T17:59:23Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - MOMENTS: A Comprehensive Multimodal Benchmark for Theory of Mind [41.188841829937466]
MoMentS (Multimodal Mental States) は、社会的にインテリジェントなマルチモーダルエージェントを構築するためのベンチマークである。
MoMentSには、7つの異なるToMカテゴリにまたがる2300以上の多重選択質問が含まれている。
いくつかのMLLMを評価し、ビジョンは一般的に性能を改善するが、モデルがそれを効果的に統合するのに苦戦していることを発見した。
論文 参考訳(メタデータ) (2025-07-06T15:06:30Z) - M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding [13.721987547159715]
M3-Medは、医療ビデオ理解におけるマルチ言語、マルチモーダル、マルチホップ推論のための最初のベンチマークである。
M3-Medの重要な革新はマルチホップ推論タスクである。これは、テキスト内の重要なエンティティを特定し、ビデオ内の対応する視覚的証拠を見つけ、最終的に両方のモダリティにまたがって情報を合成して答えを導き出すモデルを必要とする。
論文 参考訳(メタデータ) (2025-07-06T08:14:35Z) - CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering [1.0262304700896199]
我々は,100人のメンタルヘルス専門家による大規模ベンチマークであるCounselBenchを紹介し,大規模言語モデル(LLM)の評価とストレステストを行う。
最初のコンポーネントであるCounselBench-EVALは、公開フォーラムCounselChatの患者に対する質問に対して、GPT-4、LLaMA 3、Gemini、およびヒトセラピストから2000の専門家による回答の評価を含んでいる。
専門家による評価では、LLMはいくつかの次元において高いスコアを得る一方で、非建設的フィードバック、過度な一般化、限定されたパーソナライゼーションや関連性など、繰り返し発生する問題も示している。
論文 参考訳(メタデータ) (2025-06-10T08:53:06Z) - R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation [75.33671166231096]
我々は、Reasoning Bench(R-Bench)と呼ばれる、大学院レベルの多学派、英語の中国語ベンチマークを導入する。
RBenchは108の被験者に1,094の質問を、83の被験者に665の質問を、マルチモーダルなモデルテストに当てはめている。
我々は,OpenAI o1,GPT-4o,DeepSeek-R1など,広く使用されているモデルを評価した。
論文 参考訳(メタデータ) (2025-05-04T07:48:36Z) - VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models [121.03333569013148]
VisuLogicは、6つのカテゴリにまたがる1,000の人間認証された問題のベンチマークです。
これらの質問は、複数の視点からMLLMの視覚的推論能力を評価するために評価することができる。
ほとんどのモデルは精度が30%以下で、25%のランダムベースラインよりわずかに高く、人間によって達成された51.4%よりはるかに低い。
論文 参考訳(メタデータ) (2025-04-21T17:59:53Z) - MADP: Multi-Agent Deductive Planning for Enhanced Cognitive-Behavioral Mental Health Question Answer [7.738135970011351]
マルチエージェント・デダクティブ・プランニング(MADP)というフレームワークを提案する。
MADPは認知行動療法(CBT)の様々な心理的要素間の相互作用に基づいている
我々はMADPフレームワークに基づいた新しいデータセットを構築し、それをLLM(Large Language Models)の微調整に利用する。
論文 参考訳(メタデータ) (2025-01-27T07:18:47Z) - Towards Mitigating Hallucination in Large Language Models via
Self-Reflection [63.2543947174318]
大規模言語モデル(LLM)は、質問応答(QA)タスクを含む生成的および知識集約的なタスクを約束している。
本稿では,広範に採用されているLCMとデータセットを用いた医療再生QAシステムにおける幻覚現象を解析する。
論文 参考訳(メタデータ) (2023-10-10T03:05:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。