論文の概要: FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis
- arxiv url: http://arxiv.org/abs/2605.05499v1
- Date: Wed, 06 May 2026 22:46:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.43887
- Title: FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis
- Title(参考訳): FoodCHA:微細粒食品分析用多モードLDM剤
- Abstract要約: 実世界の食品画像は、クラス内類似度が高いため、課題を呈している。
ディープラーニングモデルは粗い粒度の分類において強い性能を達成する。
現代の視覚言語モデルにおけるオープンエンドジェネレーションは、非標準ラベルを生成することができる。
本稿では,食品認識を階層的な意思決定プロセスとして再構築するマルチモーダル・エージェント・フレームワークであるFoodCHAを提案する。
- 参考スコア(独自算出の注目度): 15.616960241461934
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The widespread adoption of camera-equipped mobile devices and wearables has enabled convenient capture of meal images, making food recognition a key component for real time dietary monitoring. However, real-world food images present challenges due to high intra-class similarity and the frequent presence of multiple food items within a single image. While deep learning models achieve strong performance in coarse grained classification, they often struggle to capture fine-grained attributes such as cooking style. Moreover, open-ended generation in modern vision-language models can produce non-canonical labels, limiting their practical deployment. We propose FoodCHA, a multimodal agentic framework that reformulates food recognition as a hierarchical decision-making process. By progressively anchoring predictions, FoodCHA guides subcategory identification using high-level categories and guides cooking style recognition using subcategories, improving semantic consistency and attribute-level discrimination. To ensure practical deployability, FoodCHA utilizes the compact Moondream-2B vision language model, which provides strong reasoning capability while maintaining lower computational and memory overhead. Experiments on FoodNExTDB show that FoodCHA outperforms Food-Llama-3.2-11B by 13.8% and 38.2% in category and subcategory recognition precision, respectively, and achieves a striking 153.2% improvement in cooking style classification precision.
- Abstract(参考訳): カメラを搭載したモバイルデバイスやウェアラブルの普及により、食事画像の便利なキャプチャが可能となり、食品認識がリアルタイムの食事監視の重要な要素となった。
しかし、実世界の食品画像は、クラス内類似度が高く、単一の画像内に複数の食品が存在することが頻発しているため、課題を呈している。
深層学習モデルは粗粒度分類において高い性能を達成するが、料理スタイルのような細粒度属性を捉えるのに苦労することが多い。
さらに、現代の視覚言語モデルにおけるオープンエンドジェネレーションは、非標準ラベルを生成でき、実際のデプロイメントを制限できる。
本稿では,食品認識を階層的な意思決定プロセスとして再構築するマルチモーダル・エージェント・フレームワークであるFoodCHAを提案する。
予測を段階的に固定することにより、FoodCHAはハイレベルなカテゴリを用いたサブカテゴリ識別をガイドし、サブカテゴリを用いた料理スタイル認識をガイドし、セマンティックな一貫性と属性レベルの識別を改善する。
実用的なデプロイ性を確保するため、FoodCHAでは、より少ない計算とメモリオーバーヘッドを維持しながら強力な推論能力を提供する、コンパクトなMoondream-2B視覚言語モデルを使用している。
FoodNExTDBの実験によると、FoodCHAは料理スタイルの分類精度を13.8%、サブカテゴリ認識精度38.2%で上回り、料理スタイルの分類精度は153.2%向上している。
関連論文リスト
- LLMs-based Augmentation for Domain Adaptation in Long-tailed Food Datasets [54.527878056610156]
食品認識におけるこれらの課題に対処するために,大規模言語モデル(LLM)を用いた枠組みを提案する。
まず LLM を利用して食品イメージを解析し,食品のタイトルや材料を生成する。
そして、生成したテキストと食品の画像を異なるドメインから共有埋め込み空間に投影し、ペアの類似性を最大化する。
論文 参考訳(メタデータ) (2025-11-20T04:38:56Z) - MultiFoodhat: A potential new paradigm for intelligent food quality inspection [7.966483944010341]
MultiFoodChatは、ゼロショット食品認識のための対話駆動型マルチエージェント推論フレームワークである。
Object Perception Token (OPT) はきめ細かい視覚特性を捉え、Interactive Reasoning Agent (IRA) は文脈的手がかりを動的に解釈して予測を洗練させる。
複数の公開食品データセットの実験により、MultiFoodChatは、既存の教師なしおよび少数ショットの手法と比較して、認識精度と解釈性に優れることを示した。
論文 参考訳(メタデータ) (2025-10-14T03:39:03Z) - From Canteen Food to Daily Meals: Generalizing Food Recognition to More
Practical Scenarios [92.58097090916166]
DailyFood-172とDailyFood-16という2つの新しいベンチマークを、毎日の食事から食のイメージをキュレートする。
これらの2つのデータセットは、よく計算された食品画像領域から日常的な食品画像領域へのアプローチの伝達性を評価するために使用される。
論文 参考訳(メタデータ) (2024-03-12T08:32:23Z) - FoodLMM: A Versatile Food Assistant using Large Multi-modal Model [96.76271649854542]
大規模マルチモーダルモデル(LMM)は多くの視覚言語タスクにおいて顕著な進歩を遂げている。
本稿では,多機能なLMMに基づく多目的食品アシスタントであるFoodLMMを提案する。
本稿では,食品の栄養価と複数のセグメンテーションマスクを予測するために,一連の新しいタスク固有のトークンとヘッドを導入する。
論文 参考訳(メタデータ) (2023-12-22T11:56:22Z) - Food Image Classification and Segmentation with Attention-based Multiple
Instance Learning [51.279800092581844]
本稿では,食品画像分類とセマンティックセグメンテーションモデルを訓練するための弱教師付き方法論を提案する。
提案手法は、注意に基づくメカニズムと組み合わせて、複数のインスタンス学習アプローチに基づいている。
提案手法の有効性を検証するため,FoodSeg103データセット内の2つのメタクラスについて実験を行った。
論文 参考訳(メタデータ) (2023-08-22T13:59:47Z) - Single-Stage Heavy-Tailed Food Classification [7.800379384628357]
そこで本研究では,新しい一段階のヘビーテール食品分類フレームワークを提案する。
本手法は,フード101-LTとVFN-LTの2つの重み付き食品ベンチマークデータセットを用いて評価した。
論文 参考訳(メタデータ) (2023-07-01T00:45:35Z) - Transferring Knowledge for Food Image Segmentation using Transformers
and Convolutions [65.50975507723827]
食品画像のセグメンテーションは、食品の皿の栄養価を推定するなど、ユビキタスな用途を持つ重要なタスクである。
1つの課題は、食品が重なり合ったり混ざったりし、区別が難しいことだ。
2つのモデルが訓練され、比較される。1つは畳み込みニューラルネットワークに基づくもので、もう1つは画像変換器(BEiT)のための双方向表現に関するものである。
BEiTモデルは、FoodSeg103上の49.4の結合の平均的交点を達成することで、従来の最先端モデルよりも優れている。
論文 参考訳(メタデータ) (2023-06-15T15:38:10Z) - A Mobile Food Recognition System for Dietary Assessment [6.982738885923204]
我々は,生活支援のための食品認識アプリケーションの開発に焦点をあてる。
このタスクにMobilenet-v2アーキテクチャを使うことは、正確性とメモリ使用量の両方において有益である。
開発されたモバイルアプリケーションは、画像を介して自動食品認識において視覚障害者に役立てる可能性がある。
論文 参考訳(メタデータ) (2022-04-20T12:49:36Z) - Large Scale Visual Food Recognition [43.43598316339732]
これは2000のカテゴリと100万以上のイメージを持つ、最大規模の食品認識データセットです。
food2kはそれらをカテゴリとイメージの両方で1桁ずつバイパスする。
食品認識のためのディーププログレッシブ領域強化ネットワークを提案します。
論文 参考訳(メタデータ) (2021-03-30T06:41:42Z) - Cross-Modal Food Retrieval: Learning a Joint Embedding of Food Images
and Recipes with Semantic Consistency and Attention Mechanism [70.85894675131624]
画像とレシピを共通の特徴空間に埋め込み、対応する画像とレシピの埋め込みが互いに近接するように学習する。
本稿では,2つのモダリティの埋め込みを正規化するためのセマンティック・一貫性とアテンション・ベース・ネットワーク(SCAN)を提案する。
食品画像や調理レシピの最先端のクロスモーダル検索戦略を,かなりの差で達成できることが示される。
論文 参考訳(メタデータ) (2020-03-09T07:41:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。