論文の概要: OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice
- arxiv url: http://arxiv.org/abs/2607.08423v1
- Date: Thu, 09 Jul 2026 12:46:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.532229
- Title: OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice
- Title(参考訳): OmniFood-Bench:栄養的推論とパーソナライズされた健康アドバイスのためのVLMの評価
- Abstract要約: MM-Food-100Kデータセットから構築した総合ベンチマークであるOmniFood-Benchを紹介する。
我々は6つの最先端大視野モデル(VLM)を評価する。
モデルは皿の命名においてほぼ人間に近い精度を達成するが、大量推定において破滅的な失敗を示し、高リスク糖尿病のプロファイルに対する良心的アドバイスを頻繁に幻覚させる。
- 参考スコア(独自算出の注目度): 4.592259709047762
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid integration of Large Vision-Language Models (VLMs) into critical infrastructure promises to revolutionize personalized healthcare and dietary management. However, in the domain of food systems, autonomous agents face a unique and persistent challenge: the "Systemic Information Asymmetry" between visual appearance and intrinsic nutritional composition. Existing benchmarks primarily focus on coarse-grained classification tasks, such as food category recognition, which fail to evaluate the intricate reasoning chain required for real-world dietary management -- specifically, the ability to traverse from identifying hidden ingredients to estimating physical mass, and finally synthesizing safety-critical medical advice. In this paper, we introduce OmniFood-Bench, a comprehensive benchmark constructed from the MM-Food-100K dataset. Unlike previous works, OmniFood-Bench evaluates VLMs across three progressive capabilities: Basic Perception (Ingredients & Cooking Methods), Quantitative Reasoning (Portion Size & Nutritional Profiling), and Safety-Critical Advisory (Disease-Specific Recommendations). We evaluate six state-of-the-art VLMs, including gpt-5.1, gemini-3-flash, and qwen3-vl-8B. Our extensive experiments reveal a startling "Semantic-Physical Gap": while models achieve near-human accuracy in naming dishes, they exhibit catastrophic failure in mass estimation and frequently hallucinate benign advice for high-risk diabetic profiles. This work establishes a rigorous standard for trustworthiness in autonomous agents deployed for public health. The code and datasets are available in: https://anonymous.4open.science/r/OmniFood-Bench-7D0B
- Abstract(参考訳): VLM(Large Vision-Language Models)の急速な統合は、パーソナライズされたヘルスケアと食事管理に革命をもたらすことを約束する。
しかし、食品システムの分野では、自律的なエージェントは、視覚的外観と固有の栄養組成の間の「システム情報非対称性」という、独特で永続的な課題に直面している。
既存のベンチマークでは、実際の食事管理に必要な複雑な推論チェーンの評価に失敗する食品カテゴリー認識など、粗い分類タスクに重点を置いている。
本稿では,MM-Food-100Kデータセットから構築した総合ベンチマークであるOmniFood-Benchを紹介する。
従来の作品とは異なり、OmniFood-Benchは、基本的な知覚(イングレディエンスと調理法)、量的推論(ポーションサイズと栄養プロファイリング)、安全批判的助言(Disease-Specific Recommendations)の3つのプログレッシブな能力でVLMを評価している。
gpt-5.1, gemini-3-flash, qwen3-vl-8B を含む6種類の最先端 VLM の評価を行った。
モデルでは、命名の精度がほぼ人間に近いものの、大量推定では破滅的な失敗を示し、高リスク糖尿病に対する良心的アドバイスを頻繁に幻覚させる。
この研究は、公衆衛生のために展開された自律エージェントの信頼性に関する厳格な基準を確立する。
コードとデータセットは以下の通りである。 https://anonymous.4open.science/r/OmniFood-Bench-7D0B
関連論文リスト
- MetaPlate: Counterfactual-Guided RAG-LLM Tool for Personalized Food Recommendation and Hyperglycemia Prevention [1.962656580942496]
先天性高血糖は代謝異常の重要な危険因子である。
既存の食事指導は静的で、実用的でなく、パーソナライズが不十分であることが多い。
パーソナライズされた食事レコメンデーションを生成するコンテキスト認識フレームワークであるMetaPlateを提案する。
論文 参考訳(メタデータ) (2026-06-08T19:52:08Z) - OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion [32.43875223470578]
既存の食品データセットのほとんどは、主に西洋料理に焦点を当てており、中国の料理を十分に網羅していない。
我々は8,036個の食品サンプルからなる総合マルチモーダルデータセットであるOmniFood8Kを紹介する。
本稿では,1枚のRGB画像から栄養予測を行うためのエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-14T06:45:32Z) - GLEN-Bench: A Graph-Language based Benchmark for Nutritional Health [48.94971812317643]
GLEN-Benchは,栄養学的健康評価のためのグラフ言語に基づく最初の総合ベンチマークである。
GLEN-Benchは3つの関連タスクを含む: リスク検出は、食生活や社会経済的パターンからリスクのある個人を識別する; 推奨は、リソース制約の中で臨床ニーズを満たすパーソナライズされた食品を提案する。
我々の分析では、健康リスクに関連する明確な食事パターンを特定し、実践的な介入を導くための洞察を提供する。
論文 参考訳(メタデータ) (2026-01-26T03:32:46Z) - Exploring approaches to computational representation and classification of user-generated meal logs [6.888077368936294]
本研究は、患者が生成した健康データに機械学習とドメイン特化度を応用し、栄養目標に応じて食事の分類を行った。
モバイルアプリを用いて,米国大都市における多様で低所得なコミュニティから114人の個人が収集した3000以上の食事記録のデータセットを使用した。
論文 参考訳(メタデータ) (2025-09-08T04:23:48Z) - Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion [69.84988999191343]
我々はファストフード(FastFood)について紹介する。ファストフード(FastFood)は、908のファストフードカテゴリーに84,446のイメージを持つデータセットで、成分や栄養のアノテーションが特徴である。
栄養推定の精度を高めるために,新しいモデル非依存型ビジュアル・イングレディエント・フィーチャー・フュージョン (VIF$2$) 法を提案する。
論文 参考訳(メタデータ) (2025-05-13T17:01:21Z) - MOPI-HFRS: A Multi-objective Personalized Health-aware Food Recommendation System with LLM-enhanced Interpretation [50.309987904297415]
Yelpのような主要な食品レコメンデーションプラットフォームは、ユーザの選択した健康性よりも、ユーザの食事の好みを優先している。
我々はMOPI-HFRS(Multi-Objective Personalized Interpretable Health-Aware Food Recommendation System)を開発した。
ユーザの好み、パーソナライズされた健康、栄養の多様性の3つの目標と、大きな言語モデル(LLM)強化推論モジュールを共同で最適化することで、食品レコメンデーションを提供する。
論文 参考訳(メタデータ) (2024-12-12T01:02:09Z) - NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions [6.223619389512576]
NutriBenchは、初めて公開された自然言語による食事記述栄養ベンチマークである。
世界の食事摂取データから生成された11,857件の食事記述から成っている。
データは人間によって検証され、炭水化物、タンパク質、脂肪、カロリーを含むマクロ栄養ラベルで注釈付けされている。
論文 参考訳(メタデータ) (2024-07-04T15:10:51Z) - NutritionVerse-Direct: Exploring Deep Neural Networks for Multitask Nutrition Prediction from Food Images [63.314702537010355]
自己申告法はしばしば不正確であり、重大な偏見に悩まされる。
近年、食品画像から栄養情報を予測するためにコンピュータビジョン予測システムを用いた研究が進められている。
本稿では,様々なニューラルネットワークアーキテクチャを活用することにより,食事摂取量推定の有効性を高めることを目的とする。
論文 参考訳(メタデータ) (2024-05-13T14:56:55Z) - NutritionVerse: Empirical Study of Various Dietary Intake Estimation Approaches [59.38343165508926]
食事の正確な摂取推定は、健康的な食事を支援するための政策やプログラムを伝える上で重要である。
最近の研究は、コンピュータービジョンと機械学習を使用して、食物画像から食事摂取を自動的に推定することに焦点を当てている。
我々は,84,984個の合成2D食品画像と関連する食事情報を用いた最初の大規模データセットであるNutritionVerse-Synthを紹介した。
また、リアルなイメージデータセットであるNutritionVerse-Realを収集し、リアル性を評価するために、251の料理の889のイメージを含む。
論文 参考訳(メタデータ) (2023-09-14T13:29:41Z) - Vision-Based Food Analysis for Automatic Dietary Assessment [49.32348549508578]
本総説では, 食品画像分析, 容積推定, 栄養素抽出の3段階からなる, 統合型ビジョンベース食事評価(VBDA)の枠組みを概説する。
深層学習により、VBDAは徐々にエンドツーエンドの実装へと移行し、単一のネットワークに食品画像を適用して栄養を直接見積もる。
論文 参考訳(メタデータ) (2021-08-06T05:46:01Z) - MyFood: A Food Segmentation and Classification System to Aid Nutritional
Monitoring [1.5469452301122173]
食料モニタリングの欠如は、人口の体重増加に大きく寄与している。
食品画像を認識するためにコンピュータビジョンでいくつかのソリューションが提案されているが、栄養モニタリングに特化しているものはほとんどない。
本研究は, ユーザの食事と栄養摂取の自動モニタリングを支援するために, 画像に提示された食品を分類・分別するインテリジェントシステムの開発について述べる。
論文 参考訳(メタデータ) (2020-12-05T17:40:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。