論文の概要: The Failure Is in the Readout: Fine-Grained Emotion Recognition Benchmarks Measure Elicitation, Not Perception
- arxiv url: http://arxiv.org/abs/2610.08162v1
- Date: Tue, 06 Oct 2026 11:14:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.959537
- Title: The Failure Is in the Readout: Fine-Grained Emotion Recognition Benchmarks Measure Elicitation, Not Perception
- Title(参考訳): 微粒な感情認識ベンチマークが読み出しの失敗を測る
- Abstract要約: EmoNet-Face-HQは、生成されたポートレートでは、通常の6~8つの基本的な感情よりも、40ドル以上の分類を専門的に評価している、と答えている。
既成の視覚言語モデル(VLM)は,解答が生成されず,ロジットから読み取られる場合に,その微調整モデルと一致するか,あるいは打ち負かされるかを示す。
- 参考スコア(独自算出の注目度): 14.24086939344437
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fine-grained emotion recognition supports therapy tools and social robots, but it needs facial data, which raises privacy and data-protection concerns. EmoNet-Face-HQ answers that with generated portraits, expert-rated over a $40$-category taxonomy far finer than the usual six to eight basic emotions. Under the protocol it ships with, vision-language models (VLMs) score poorly on that taxonomy, and the benchmark concludes that a dedicated fine-tuned model is necessary: Empathic-Insight-Face (EIF; Small/Large). We show that off-the-shelf VLMs match or beat that fine-tuned model when the answer is not generated but read from the logits, as one binary query per category. We keep the benchmark's images, taxonomy and ratings, and change only how the answer is read. Experts agree at $κ_w = 0.468$ on the five categories they measure most reliably. Generatively, no interval among eleven open-weight VLMs lies entirely above that anchor ($κ_w=0.268$-$0.486$). Under verification all eleven clear it, each of them significantly better at $κ_w=0.507$-$0.586$. Three also significantly beat EIF sitting at $κ_w = 0.551$ (Small; $0.534$ Large). The gain comes from the graded probability and not from asking a yes/no question: as a control, thresholding those same probabilities to yes/no costs 142% of the average gains and drops binarization below generative elicitation to $κ_w=0.254$-$0.423$. A replication on real photographs (FACES) is weaker and mixed: of the ten models that pass a validity gate, six gain, three are neutral to positive and one is negative, so the effect is not confined to synthetic data.
- Abstract(参考訳): きめ細かい感情認識はセラピーツールやソーシャルロボットをサポートするが、顔データが必要であるため、プライバシーやデータ保護の懸念が高まる。
EmoNet-Face-HQは、生成されたポートレートでは、通常の6~8つの基本的な感情よりも、40ドル以上の分類を専門的に評価している、と答えている。
プロトコルの下では、視覚言語モデル(VLM)はその分類基準を低く評価し、ベンチマークでは、専用の微調整モデルが必要であると結論付けている。
解答が生成されず,ログから読み取られた場合,各カテゴリ毎のバイナリクエリとして,既成のVLMが,その微調整モデルと一致するか,あるいは打ち負かされるかを示す。
ベンチマークのイメージ、分類、評価を保持し、回答の読み方だけを変更します。
専門家は最も確実に測定する5つのカテゴリについて、κ_w = 0.468$で合意する。
生成的には、11個のオープンウェイト VLM の間隔は、そのアンカー(κ_w=0.268$-$0.486$)の上には存在しない。
11の検証では、それぞれがκ_w=0.507$-0.586$で大幅に改善されている。
また、EIF は κ_w = 0.551$ (Small; $0.534$ Large) でかなり上回った。
コントロールとして、それらの同じ確率をye/noに閾値付けすると、平均利得の142%のコストがかかり、生成的利得以下に二項化を$κ_w=0.254$-0.423$に下げる。
実際の写真(FACES)の複製はより弱く混合され、有効ゲートを通過する10つのモデルのうち、6つのゲイン、3つのモデルが中立であり、負であり、合成データに制限されない。
関連論文リスト
- Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation [51.56484100374058]
そこで我々は,Upworthy Research Archiveを用いて,シミュレート・トゥ・リアルな妥当性について検討する。
実際の聴衆の人口統計に基づく10人のパネルと、一般的な読者がクリックする確率をモデルに尋ねるゼロショットベースラインを比較した。
論文 参考訳(メタデータ) (2026-07-27T17:03:03Z) - InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost [0.0]
私たちは、小さなオープンウェイトモデルで作られた安価な3段階のカスケード -- 検索$rightarrow$rerank$rightarrow$ reason -- を提示します。
このカスケードはコストのために設計されており、フィルターされたトップ10ハーフのトークンを、50点以上のトークンを推論するのに対して、14点以上のトークンを推論する。
その結果、フロンティアサービスコストのごく一部で、デプロイ可能で説明可能なKOLサーチシステムとなった。
論文 参考訳(メタデータ) (2026-07-07T08:04:05Z) - RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering [15.456770184839726]
15,000 r/AskReddit質問に対する汚染のない評価データセットであるRECOMを紹介する。
両方の仕事をうまくこなす指標は存在しない。
すべてのメトリクスが同じ出力をスコアするので、この妥当性判別トレードオフは、モデルではなくメトリクスの特性である。
論文 参考訳(メタデータ) (2026-06-17T15:55:33Z) - What Do EEG Foundation Models Capture from Human Brain Signals? [64.48249643001402]
現代の脳波基礎モデルは、自己教師付き事前訓練を通じて生信号から直接学習する。
我々は3つのサブクエストに分解する: モデルが何を学習するか、モデルを何に使用するのか、そしてどのように説明できるのか。
3つの基礎モデル(CSBrain, CBraMod, LaBraM),5つの臨床タスク(MDD, Stress, ISRUC-Sleep, TUSL, Siena)と6ファミリー63機能レキシコンを含む。
論文 参考訳(メタデータ) (2026-05-12T01:57:53Z) - Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect [0.0]
本研究は,小言語モデルが内的アクティベーションを検出・報告できるかどうかを考察する。
まず,先行研究で使用される二項検出パラダイムが,質問内容に関係なく肯定的応答に偏りを示すため,小さなモデルで構築されていることを示す。
次に、モデル自身の摂動前進パスから構築した文局在化例を教師付き微調整するEmphIntrospection Fine-Tuning(IFT)を導入する。
論文 参考訳(メタデータ) (2026-05-08T05:30:26Z) - ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems [51.56484100374058]
LongMemEval-500では、ZenBrainは長いコンテキストのオラクルのバイナリ・ジャッジの精度を4.5pp以内と一致させる。
ZenBrainは7層の神経科学にインスパイアされたメモリアーキテクチャである。
論文 参考訳(メタデータ) (2026-04-26T20:39:19Z) - EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment [76.9843141359798]
EEmoDBは、これまでで最大のイメージ誘発感情理解データセットである。
EEmo-Logicは命令の微調整とタスクカストマイズされたグループ相対的優先度最適化によって開発されたオールインワンのマルチモーダル言語モデル(MLLM)である。
論文 参考訳(メタデータ) (2026-02-01T11:49:26Z) - Almost Tight L0-norm Certified Robustness of Top-k Predictions against
Adversarial Perturbations [78.23408201652984]
トップk予測は、マシンラーニング・アズ・ア・サービス、レコメンダ・システム、Web検索など、多くの現実世界のアプリケーションで使用されている。
我々の研究はランダム化平滑化に基づいており、入力をランダム化することで、証明可能なロバストな分類器を構築する。
例えば、攻撃者がテスト画像の5ピクセルを任意に摂動できる場合に、ImageNet上で69.2%の認定トップ3精度を達成する分類器を構築することができる。
論文 参考訳(メタデータ) (2020-11-15T21:34:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。