論文の概要: OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet
- arxiv url: http://arxiv.org/abs/2608.03428v1
- Date: Tue, 04 Aug 2026 10:18:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.125505
- Title: OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet
- Title(参考訳): OliveGemma:地中海と欧州の議会を認識するための30億のビジュアル言語モデル
- Authors: Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis,
- Abstract要約: 本研究は,地中海料理とヨーロッパ料理の認識と推論のための視覚言語モデルであるOliveGemmaを提示する。
オープンウェイトなPaliGemma-2-3Bアーキテクチャ上に構築され、17,340枚の画像の統一コーパス上にLoRAで微調整されている。
3倍のクロスバリデーションスキームの下で、OliveGemmaは92.96% +/- 0.91%というトップ1の精度を達成し、最強のCNNベースライン(DenseNet-121)を7.31%上回っている。
- 参考スコア(独自算出の注目度): 0.4917983568376076
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image based dietary assessment offers a scalable alternative to self reported food diaries, yet fine-grained food recognition remains challenging due to high intra-class variability and visually similar dishes. This study presents OliveGemma, a vision language model for recognising and reasoning about Mediterranean and European cuisine. Built on the open-weight PaliGemma-2-3B architecture, OliveGemma is fine-tuned with LoRA on a unified corpus of 17,340 images from three European research project datasets (MedGR, ODIN, and VIPPSTAR), reconciled into a vocabulary of 216 composed dish categories and paired with 102,642 instruction style question-answer items covering dish recognition, likely and visible ingredients, class boundary discrimination, visual evidence and overall visual food understanding. Under a 3-fold cross-validation scheme, OliveGemma achieves a top-1 accuracy of 92.96% +/- 0.91%, exceeding the strongest CNN baseline (DenseNet-121) by 7.31% and outperforming zero-shot frontier models with exact instructions and bounded classes including Gemini Flash 3 and 3.5, GPT-5.4 Mini, and Claude Haiku 4.6 by 8%, 46%, and 64% respectively. Furthermore, OliveGemma demonstrates competitive performance on Top-3 and Top-5 accuracy, being second best across CNNs and frontier models, surpassed only by DenseNet-121. In addition, OliveGemma achieves 90.79% +/- 1.3% Exact-Set on the likely ingredients of the food categories. These results demonstrate that PEFT adaptation of a small VLM can surpass substantially larger proprietary models on specialised food recognition. The model is publicly available at https://huggingface.co/JamesZar/OliveGemma-3B and the experiments and results can be found at https://github.com/tsiokris/OliveGemma.
- Abstract(参考訳): 画像に基づく食事評価は、自己報告の食品日記に代わるスケーラブルな代替手段を提供するが、クラス内変動と視覚的に類似した料理のために、粒度の細かい食品認識は難しいままである。
本研究は,地中海料理とヨーロッパ料理の認識と推論のための視覚言語モデルであるOliveGemmaを提示する。
オープンウェイトなPaliGemma-2-3Bアーキテクチャ上に構築されたOliveGemmaは、ヨーロッパの3つの研究プロジェクトデータセット(MedGR、ODIN、VIPPSTAR)から17,340枚の画像の統一コーパス上でLoRAと微調整され、216個の料理カテゴリーからなる語彙に分解され、料理の認識、おそらくは目に見える材料、クラス境界の識別、視覚的証拠、全体的な視覚的食品理解を含む102,642種類の質問回答項目と組み合わせられる。
3倍のクロスバリデーションスキームの下で、OliveGemmaは92.96% +/-0.91%というトップ1の精度を達成し、最強のCNNベースライン(DenseNet-121)を7.31%上回った。
さらに、OliveGemmaはTop-3とTop-5の精度で競争力を発揮しており、CNNとフロンティアモデルで2番目に優れており、DenseNet-121にしか勝っていない。
加えて、オリーブ・ジェマは食品カテゴリーの可能性のある成分について90.79%+/-1.3%のエクサクト・セットを達成している。
これらの結果から,小型VLMのPEFT適応は,食品認識において,はるかに大きなプロプライエタリモデルを上回ることが示唆された。
モデルはhttps://huggingface.co/JamesZar/OliveGemma-3Bで公開されており、実験と結果はhttps://github.com/tsiokris/OliveGemmaで見ることができる。
関連論文リスト
- Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty? [59.923111838399144]
本稿では,視覚的審美性ベンチマーク (VAB) を提案する。
VABには400のタスクと1,195のイメージが芸術、写真、イラストに含まれており、ラベルはタスクごとに10人の独立した専門家審査員のコンセンサスから導かれる。
最強のシステムは、人間の専門家が達成した68.9%よりもはるかに低い26.5%のタスクで、候補順の3つのランダムな順で、最良の画像と最悪の画像の両方を正しく識別する。
論文 参考訳(メタデータ) (2026-05-12T19:33:28Z) - Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition [14.56988768403406]
VLM(Vision-Language Models)は、視覚的およびテキスト的推論を統合することで、新たな可能性を提供する。
本研究では,6種類の最先端VLMを評価し,その食品認識能力について異なるレベルで分析した。
実験フレームワークとして,9,263個の専門家ラベル付き画像を含むユニークな食品画像データベースであるFoodNExTDBを紹介する。
論文 参考訳(メタデータ) (2025-04-09T14:33:59Z) - Identifying and Decomposing Compound Ingredients in Meal Plans Using Large Language Models [6.477074442920329]
本研究では, 食事計画における大規模言語モデルの有効性について検討し, 複合成分の識別・分解能力に着目した。
GPT-4o, Llama-3 (70b), Mixtral (8x7b) の3種類のモデルを用いて, 複合成分の認識・分解能力の評価を行った。
予備的な結果は、Llama-3 (70b) と GPT-4o が正確な分解に優れているのに対して、全てのモデルは調味料や油などの必須成分を同定することが困難であることを示している。
論文 参考訳(メタデータ) (2024-11-08T12:38:10Z) - Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models [0.06555599394344236]
本研究では,大言語モデル (LLMs) と視覚言語モデル (VLMs) の胃腸科学における医学的推論性能を評価する。
我々は,300の胃腸科検査式多票質問紙を使用し,そのうち138は画像を含んでいた。
論文 参考訳(メタデータ) (2024-08-25T14:50:47Z) - NutritionVerse-Direct: Exploring Deep Neural Networks for Multitask Nutrition Prediction from Food Images [63.314702537010355]
自己申告法はしばしば不正確であり、重大な偏見に悩まされる。
近年、食品画像から栄養情報を予測するためにコンピュータビジョン予測システムを用いた研究が進められている。
本稿では,様々なニューラルネットワークアーキテクチャを活用することにより,食事摂取量推定の有効性を高めることを目的とする。
論文 参考訳(メタデータ) (2024-05-13T14:56:55Z) - The Food Recognition Benchmark: Using DeepLearning to Recognize Food on
Images [0.18472148461613155]
モバイルMyFoodRepoアプリを通じて公開されている食品画像を用いて,このようなベンチマークのセットアップについて報告する。
4回のラウンドを通じて、ベンチマークは24,119の画像からなるMyFoodRepo-273データセットをリリースし、合計39,325個の分割ポリゴンを273のクラスに分類した。
273食品カテゴリーのトップパフォーマンスモデルの平均精度は0.568(ラウンド4)、平均リコール率は0.885(ラウンド3)に達した。
論文 参考訳(メタデータ) (2021-06-28T20:51:26Z) - A Large-Scale Benchmark for Food Image Segmentation [62.28029856051079]
我々は9,490枚の画像を含む新しい食品画像データセットFoodSeg103(およびその拡張FoodSeg154)を構築します。
これらの画像に154種類の成分を付加し,各画像は平均6つの成分ラベルと画素単位のマスクを有する。
ReLeMと呼ばれるマルチモダリティプリトレーニングアプローチを提案し、豊富なセマンティックな食品知識を持つセグメンテーションモデルを明確に装備します。
論文 参考訳(メタデータ) (2021-05-12T03:00:07Z) - ISIA Food-500: A Dataset for Large-Scale Food Recognition via Stacked
Global-Local Attention Network [50.7720194859196]
ウィキペディアのリストから500のカテゴリと399,726の画像を含むデータセットISIA Food-500を紹介する。
このデータセットは、既存の一般的なベンチマークデータセットをカテゴリカバレッジとデータボリュームで上回る。
食品認識のための2つのサブネットワークからなるグローバルローカルアテンションネットワークを提案する。
論文 参考訳(メタデータ) (2020-08-13T02:48:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。