論文の概要: DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
- arxiv url: http://arxiv.org/abs/2604.10425v1
- Date: Sun, 12 Apr 2026 02:45:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.008246
- Title: DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
- Title(参考訳): DiningBench: 食事領域における知覚と推論のための階層的マルチビューベンチマーク
- Authors: Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan,
- Abstract要約: 視覚言語モデル(VLM)を3段階の認知複雑性で評価するために設計された階層的マルチビューベンチマークであるDiningBenchを紹介した。
以前のデータセットとは異なり、ダイニングベンチは3,021の異なる料理で構成されており、1エントリあたりの平均5.27イメージである。
我々の実験では、現在のVLMは一般的な推論において優れているが、細粒度の視覚的識別と栄養学的推論にかなり苦労していることが明らかとなった。
- 参考スコア(独自算出の注目度): 27.942500262773383
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent advancements in Vision-Language Models (VLMs) have revolutionized general visual understanding. However, their application in the food domain remains constrained by benchmarks that rely on coarse-grained categories, single-view imagery, and inaccurate metadata. To bridge this gap, we introduce DiningBench, a hierarchical, multi-view benchmark designed to evaluate VLMs across three levels of cognitive complexity: Fine-Grained Classification, Nutrition Estimation, and Visual Question Answering. Unlike previous datasets, DiningBench comprises 3,021 distinct dishes with an average of 5.27 images per entry, incorporating fine-grained "hard" negatives from identical menus and rigorous, verification-based nutritional data. We conduct an extensive evaluation of 29 state-of-the-art open-source and proprietary models. Our experiments reveal that while current VLMs excel at general reasoning, they struggle significantly with fine-grained visual discrimination and precise nutritional reasoning. Furthermore, we systematically investigate the impact of multi-view inputs and Chain-of-Thought reasoning, identifying five primary failure modes. DiningBench serves as a challenging testbed to drive the next generation of food-centric VLM research. All codes are released in https://github.com/meituan/DiningBench.
- Abstract(参考訳): VLM(Vision-Language Models)の最近の進歩は、一般的な視覚的理解に革命をもたらした。
しかし、食品分野における彼らの応用は、粗いカテゴリ、単一ビューイメージ、不正確なメタデータに依存するベンチマークによって制限されている。
このギャップを埋めるために、私たちはDningBenchという階層的なマルチビューベンチマークを導入しました。これは、認知複雑性の3つのレベル(ファイングラインド分類、栄養推定、視覚質問応答)でVLMを評価するために設計されたものです。
以前のデータセットとは異なり、ダイニングベンチは3,021個の異なる料理からなり、1エントリあたり平均5.27枚の画像があり、同じメニューと厳密な検証ベースの栄養データからきめ細かい「硬い」陰性が組み込まれている。
我々は、29の最先端オープンソースおよびプロプライエタリモデルの広範な評価を行う。
我々の実験では、現在のVLMは一般的な推論において優れているが、細粒度の視覚的識別と正確な栄養学的推論にかなり苦労していることが明らかとなった。
さらに,マルチビュー入力とChain-of-Thought推論の影響を系統的に検討し,5つの障害モードを同定した。
DiningBenchは、次世代の食品中心のVLM研究を推進するための挑戦的なテストベッドとして機能する。
すべてのコードはhttps://github.com/meituan/DiningBench.comで公開されている。
関連論文リスト
- TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models [52.21298691935726]
時系列で推論する能力は、ジェネラリストモデルが現実的な問題を解決するための基本的なスキルである。
このギャップを埋めるために、時系列推論機能の全スペクトルをストレステストするために設計された総合的なベンチマークであるTSRBenchを紹介する。
論文 参考訳(メタデータ) (2026-01-26T18:04:54Z) - LLMs-based Augmentation for Domain Adaptation in Long-tailed Food Datasets [54.527878056610156]
食品認識におけるこれらの課題に対処するために,大規模言語モデル(LLM)を用いた枠組みを提案する。
まず LLM を利用して食品イメージを解析し,食品のタイトルや材料を生成する。
そして、生成したテキストと食品の画像を異なるドメインから共有埋め込み空間に投影し、ペアの類似性を最大化する。
論文 参考訳(メタデータ) (2025-11-20T04:38:56Z) - Evaluating Gemini LLM in Food Image-Based Recipe and Nutrition Description with EfficientNet-B4 Visual Backbone [0.0]
視覚的バックボーンと強力な生成的大言語モデルを統合するシステムの評価を行った。
中心となる目的は、視覚的分類精度、モデル効率、生成出力の品質のトレードオフを評価することである。
クラスごとの詳細な分析を行い、セマンティックな類似性を最も重要な障害モードと同定する。
論文 参考訳(メタデータ) (2025-11-11T13:17:43Z) - MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval [86.35779264575154]
マルチモーダル検索は、現代のAIアプリケーションにおいて重要なコンポーネントになりつつあるが、その評価は、より現実的で困難なシナリオの要求に遅れている。
マルチモーダル検索のための推論集約型ベンチマークであるMR$2$-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-30T15:09:14Z) - Comprehensive Evaluation of Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata [16.03960240895014]
栄養分析のための食事画像にはLMM(Large Multimodal Models)が適用されてきている。
本研究は、文脈メタデータの解釈が、重要な栄養価を推定する際のLMM性能をいかに向上させるかを検討する。
実験結果から, 即時的プロンプト戦略によりメタデータをインテリジェントに統合すると, 栄養価の予測値において, 平均絶対誤差 (MAE) と平均絶対誤差 (MAPE) が著しく減少することが示された。
論文 参考訳(メタデータ) (2025-07-09T17:10:33Z) - Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing [84.16442052968615]
RISEBenchはReasoning-Informed ViSual Editing (RISE)の最初のベンチマークである。
RISEBenchは、時間、因果、空間、論理的推論の4つの主要な推論カテゴリに焦点を当てている。
オープンソースモデルとプロプライエタリモデルの両方を含む,9つの目立った視覚編集モデルを評価する実験を行った。
論文 参考訳(メタデータ) (2025-04-03T17:59:56Z) - MetaFood3D: 3D Food Dataset with Nutrition Values [52.16894900096017]
このデータセットは、131のカテゴリにまたがって、743の精細にスキャンされ、ラベル付けされた3D食品オブジェクトで構成されている。
我々のMetaFood3Dデータセットはクラス内の多様性を重視しており、テクスチャメッシュファイル、RGB-Dビデオ、セグメンテーションマスクなどのリッチなモダリティを含んでいる。
論文 参考訳(メタデータ) (2024-09-03T15:02:52Z) - Food-500 Cap: A Fine-Grained Food Caption Benchmark for Evaluating
Vision-Language Models [37.01210143642867]
視覚言語モデル(VLM)は、かなり下流のマルチモーダルタスクにおいて顕著な性能を示している。
しかし、下流タスクの微調整性能を比較するだけで、VLMの解釈性は低下する。
本稿では,食品分野における一般的なVLMの能力について包括的に検討する。
論文 参考訳(メタデータ) (2023-08-06T15:56:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。