論文の概要: In-Context-Learning-Assisted Quality Assessment Vision-Language Models for Metal Additive Manufacturing
- arxiv url: http://arxiv.org/abs/2511.05551v1
- Date: Sun, 02 Nov 2025 18:31:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-11 21:18:44.427341
- Title: In-Context-Learning-Assisted Quality Assessment Vision-Language Models for Metal Additive Manufacturing
- Title(参考訳): 金属添加物製造のためのインコンテキスト学習支援品質評価ビジョンランゲージモデル
- Authors: Qiaojie Zheng, Jiucai Zhang, Xiaoli Zhang,
- Abstract要約: 本稿では,視覚言語モデル(VLM)の推論機能を活用し,印刷部品の品質を評価する。
アプリケーション固有の知識と実演サンプルをVLMに提供するために,テキスト内学習(ICL)を導入する。
- 参考スコア(独自算出の注目度): 5.469882623106681
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-based quality assessment in additive manufacturing often requires dedicated machine learning models and application-specific datasets. However, data collection and model training can be expensive and time-consuming. In this paper, we leverage vision-language models' (VLMs') reasoning capabilities to assess the quality of printed parts and introduce in-context learning (ICL) to provide VLMs with necessary application-specific knowledge and demonstration samples. This method eliminates the requirement for large application-specific datasets for training models. We explored different sampling strategies for ICL to search for the optimal configuration that makes use of limited samples. We evaluated these strategies on two VLMs, Gemini-2.5-flash and Gemma3:27b, with quality assessment tasks in wire-laser direct energy deposition processes. The results show that ICL-assisted VLMs can reach quality classification accuracies similar to those of traditional machine learning models while requiring only a minimal number of samples. In addition, unlike traditional classification models that lack transparency, VLMs can generate human-interpretable rationales to enhance trust. Since there are no metrics to evaluate their interpretability in manufacturing applications, we propose two metrics, knowledge relevance and rationale validity, to evaluate the quality of VLMs' supporting rationales. Our results show that ICL-assisted VLMs can address application-specific tasks with limited data, achieving relatively high accuracy while also providing valid supporting rationales for improved decision transparency.
- Abstract(参考訳): 付加的な製造における視覚ベースの品質評価は、しばしば専用の機械学習モデルとアプリケーション固有のデータセットを必要とする。
しかし、データ収集とモデルトレーニングは高価で時間を要する可能性がある。
本稿では,視覚言語モデル(VLM)の推論機能を活用し,印刷部品の品質を評価するとともに,テキスト内学習(ICL)を導入し,アプリケーション固有の知識と実演サンプルを提供する。
この方法では、トレーニングモデルのための大規模なアプリケーション固有のデータセットの必要がなくなる。
限られたサンプルを利用する最適構成を探索するために,ICLの異なるサンプリング戦略を検討した。
我々はこれらの戦略を2つのVLM(Gemini-2.5-flashとGemma3:27b)上で評価した。
その結果、ICL支援VLMは、最小限のサンプルしか必要とせず、従来の機械学習モデルと同様の品質分類精度に達することができた。
さらに、透明性に欠ける従来の分類モデルとは異なり、VLMは信頼を高めるために人間解釈可能な理性を生成することができる。
製造アプリケーションにおける解釈可能性を評価する指標は存在しないため,VLMの支持する論理性の品質を評価するために,知識関連性と合理性妥当性の2つの指標を提案する。
ICL支援型VLMは限られたデータでアプリケーション固有のタスクに対処でき、比較的高い精度を達成できるとともに、意思決定透明性を向上させるための有効な根拠を提供する。
関連論文リスト
- TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs [81.78017865436816]
我々は,映像の時間的接地能力の強いMLLMを体系的に構築するTimeLensを提案する。
まず,既存のVTGベンチマークにおける重要な品質問題を明らかにし,TimeLens-Benchを導入する。
また、自動再アノテーションパイプラインを通じてノイズの多いトレーニングデータに対処し、大規模で高品質なトレーニングデータセットであるTimeLens-100Kを出力します。
論文 参考訳(メタデータ) (2025-12-16T18:59:58Z) - Cross-Modal Attention Guided Unlearning in Vision-Language Models [16.460281156521646]
VLM(Vision-Language Models)は、マルチモーダル理解および推論タスクにおいて、膨大な能力を示す。
VLMは、クエリの視覚的コンテキストがテキストに加えてセンシティブな情報も含んでいる可能性があるため、このプロセスに複雑さの層を追加します。
我々は、軽量で効率的なVLMアンラーニングフレームワークであるCross-Modal Attentioned Unlearning(CAGUL)を定式化する。
論文 参考訳(メタデータ) (2025-10-08T21:21:59Z) - Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models [19.361686225381447]
視覚言語モデル(VLM)は、文脈内学習(ICL)を示すと広く想定されている
提案するMM-ICLにはReasoningパイプラインが組み込まれている。
論文 参考訳(メタデータ) (2025-06-09T16:55:32Z) - Empowering Large Language Models in Wireless Communication: A Novel Dataset and Fine-Tuning Framework [81.29965270493238]
我々は,無線通信アプリケーションのための大規模言語モデル(LLM)の評価と微調整を目的とした,特殊なデータセットを開発した。
データセットには、真/偽と複数選択型を含む、さまざまなマルチホップ質問が含まれている。
本稿では,PVI(Pointwise V-Information)に基づく微調整手法を提案する。
論文 参考訳(メタデータ) (2025-01-16T16:19:53Z) - A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs [74.35290684163718]
大規模言語モデル(LLM)開発における最大の課題は、その面倒な事前トレーニングコストである。
本稿では,小言語モデル(SLM)を活用して,LLMの事前学習効率と品質を改善するための有望なパラダイムについて検討する。
論文 参考訳(メタデータ) (2024-10-24T14:31:52Z) - Investigating Automatic Scoring and Feedback using Large Language Models [46.1232919707345]
本稿では,PEFTに基づく量子化モデルの有効性について検討する。
その結果, 微調整LDMによる評価は精度が高く, 平均的に3%未満の誤差が得られた。
論文 参考訳(メタデータ) (2024-05-01T16:13:54Z) - Dependable Distributed Training of Compressed Machine Learning Models [16.403297089086042]
信頼性のある学習オーケストレーションのためのフレームワークであるDepLを提案する。
i) 学習に活用するデータ、(ii) 使用するモデルと、それらに切り替えるタイミング、(iii) ノードのクラスタとそのリソースについて、高品質で効率的な決定を行う。
DepLの競合比と複雑性は一定であり、最先端技術よりも27%以上向上していることを示す。
論文 参考訳(メタデータ) (2024-02-22T07:24:26Z) - Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models [73.40350756742231]
視覚条件付き言語モデル(VLM)は、視覚対話、シーン理解、ロボットタスク計画などのアプリケーションに採用されている。
新しいリリースの量は多いが、イメージ前処理、アーキテクチャ、最適化に関する重要な設計決定は未調査である。
論文 参考訳(メタデータ) (2024-02-12T18:21:14Z) - Active Prompt Learning in Vision Language Models [21.276006224504748]
我々は,PCBと表記される事前学習型視覚言語モデルのための新しいアクティブラーニングフレームワークを考案した。
そこで本研究では,7つの実世界のデータセットを用いて実験を行い,PCBが従来の能動的学習法やランダムサンプリング法を超えることを示した。
論文 参考訳(メタデータ) (2023-11-18T22:42:16Z) - Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models [61.28463542324576]
視覚言語モデル(VLM)は近年,人間のような出力を生成できる視覚アシスタントとして,強力な有効性を示している。
我々は、既存の最先端のVLMを評価し、最高の性能モデルでさえ、強力な視覚的推論能力と一貫性を示すことができないことを発見した。
本稿では,VLMの推論性能と一貫性の向上を目的とした2段階トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-08T17:49:44Z) - From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning [52.257422715393574]
本稿では,Large Language Models (LLMs) の自己誘導手法を導入し,オープンソースデータセットからサクラサンプルを自動識別し,選択する。
我々の重要な革新である命令追従困難度(IFD)メトリックは、モデルが期待する応答と本質的な生成能力の相違を識別するための重要な指標として現れます。
論文 参考訳(メタデータ) (2023-08-23T09:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。