論文の概要: SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments
- arxiv url: http://arxiv.org/abs/2607.05264v1
- Date: Mon, 06 Jul 2026 16:11:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.23527
- Title: SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments
- Title(参考訳): SteelBench: 実世界の産業環境におけるビジョンランゲージモデルの評価
- Abstract要約: SteelBenchは産業監視のための診断ベンチマークである。
作業者ごとの活動認識、安全ルール推論、アノテーション証明を共同で評価する。
1,345本の密接な注釈付きクリップがあり、149時間のプラントの映像からキュレーションされている。
- 参考スコア(独自算出の注目度): 0.48904891615709184
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Existing video benchmarks evaluate action recognition on consumer videos, egocentric recordings, or simulated industrial environments. They do not test vision-language models under the visual and procedural conditions of real industrial CCTV, where workers appear as distant figures amid dust, steam, low light, glare, occlusion, and overlapping activities. We introduce STEELBENCH, a diagnostic benchmark for industrial surveillance that jointly evaluates per-worker activity recognition, safety-rule reasoning, and annotation provenance. SteelBench contains 1,345 densely annotated clips, curated from 149 hours of operational plant footage and 10,024 candidate clips using temporal deduplication, class balancing, and visibility-aware stratified sampling. Each clip includes dense per-worker action labels, PPE attributes, spatial context, and safety-rule annotations. Because model-assisted annotation can shape the labels later used for model evaluation, SteelBench includes a provenance-aware audit protocol. The protocol measures label influence, evaluates sensitivity to ground-truth provenance, and reports a human reference from expert-reviewed labels. Applying this audit, we find that unaudited VLM-sourced ground truth can inflate same-family model accuracy by up to 17 percentage points. Across nine VLMs from four architectural families, the best model reaches only 42.6% action accuracy, compared with an 84.6% human benchmark. Performance also fragments across recognition, robustness, calibration, and safety reasoning. Even when models predict the correct action, 37-58% of cases still yield incorrect safety judgments, and no model passes more than 2 of 5 diagnostic checks. The dataset is publicly available on Hugging Face.
- Abstract(参考訳): 既存のビデオベンチマークは、コンシューマービデオ、エゴセントリックな録画、あるいはシミュレートされた産業環境におけるアクション認識を評価する。
彼らは実際の産業CCTVの視覚的および手続き的な条件下で視覚言語モデルをテストせず、労働者はほこり、蒸気、低光、グレア、オクルージョン、重なり合う活動の中で遠くの人物として現れる。
STEELBENCHは、作業者ごとのアクティビティ認識、安全ルール推論、アノテーション証明を共同で評価する産業監視のための診断ベンチマークである。
SteelBenchには、1,345本の密接な注釈付きクリップが含まれており、149時間のプラント映像と10,024本の候補クリップで構成されている。
各クリップには、作業者ごとのアクションラベル、PE属性、空間コンテキスト、安全ルールアノテーションが含まれる。
モデルアシストアノテーションは、後にモデル評価に使用されるラベルを形作ることができるため、SteelBenchには、証明可能な監査プロトコルが含まれている。
このプロトコルは、ラベルの影響を計測し、地道的証明に対する感受性を評価し、専門家がレビューしたラベルから人間の参照を報告する。
この監査を適用すると、未確認のVLMソースの基底真理が、同族モデルの精度を最大17ポイント向上できることがわかった。
4つのファミリの9つのVLMのうち、最良のモデルは、84.6%の人間ベンチマークと比較して、42.6%のアクション精度にしか達していない。
パフォーマンスはまた、認識、堅牢性、キャリブレーション、安全性推論にまたがる断片も備えている。
モデルが正しい行動を予測したとしても、37~58%の患者はいまだに誤った安全判断を下しており、5つ以上の診断チェックをパスするモデルはない。
データセットはHugging Faceで公開されている。
関連論文リスト
- EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models [3.659020283346239]
VLM安全性のためのエビデンス基盤フレームワークであるEviSafeを紹介する。
自然なユーザ向け行動、テキストおよび視覚的証拠の明確な根拠、および反事実的変化に対する行動感受性を共同で評価する。
EviSafeBenchは、フレームワークを1,181金の画像テキストシナリオで制御されたベンチマークとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-08-24T14:32:25Z) - The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report [0.17398560678845076]
合成音声検出ベンチマークでは、いくつかのドメイン内の評価で1%未満のエラー率が報告されているが、未確認の攻撃、チャネルミスマッチ、分散シフトによるパフォーマンス低下が報告されている。
我々は、検出器の構築および展開中に遭遇した障壁を報告した。
これらの観察は、あるプロジェクトから得られ、他の設定でテストされるべきである。
論文 参考訳(メタデータ) (2026-08-18T09:50:02Z) - InfoOps Bench: A live information operations safety benchmark [1.6286063564156006]
我々は、州が支援する情報操作に対するフロンティア言語モデルの整合性を測定する、アクティブで常に更新されたAIベンチマークを示す。
われわれは、ロシア、中国、イランが支援する情報資産を追跡するライブ監視パイプラインから、2100件以上の情報操作を引き合いに出している。
情報操作に対する統合性は、少なくとも部分的には、良心的なクレームであってもコンテンツの作成を拒否することに関連している。
論文 参考訳(メタデータ) (2026-07-30T16:46:13Z) - DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning [54.70033525672316]
ビデオ対応の大型言語モデル(MLLM)は、このウィンドウ内で警告を発する常時オンの安全モニタとして機能する。
今回紹介するPaSBench-Videoは、481のリスクと4つのドメインにわたる259のリスクビデオを備えた740のビデオベンチマークだ。
最も厳密な基準ではモデルが20.0%を超えることはなく、リコールは偽陽性率と強く結びついている。
論文 参考訳(メタデータ) (2026-06-01T16:14:01Z) - Latent Performance Profiling of Large Language Models [47.009623327601226]
隠れたアクティベーションと出力分布からタスクに依存しない診断を導出するフレームワークであるLatent Performance Profiling(LPP)を紹介する。
静的精度スコアとは異なり、LPPは同様のサイズのモデル間で安定でアーキテクチャに敏感なシグネチャを提供する。
類似のベンチマークスコアを持つモデルは、エントロピーや適応性の違いなど、対照的なプロファイルを示すことができることを示す。
論文 参考訳(メタデータ) (2026-05-28T14:41:26Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Learning More from Less: Unlocking Internal Representations for Benchmark Compression [37.69575776639016]
異種隠蔽状態を統一潜在空間に整列させて代表コアセットを構成するREPCOREを導入する。
5つのベンチマークと200以上のモデルの実験は、ランキングの相関と推定精度において、出力ベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-01-31T13:11:39Z) - iSafetyBench: A video-language benchmark for safety in industrial environment [6.697702130929693]
iSafetyBenchは、産業環境でのモデルパフォーマンスを評価するために設計された新しいビデオ言語ベンチマークである。
iSafetyBenchは、現実世界の産業環境から得られた1100本のビデオクリップで構成されている。
ゼロショット条件下で8つの最先端ビデオ言語モデルを評価する。
論文 参考訳(メタデータ) (2025-08-01T07:55:53Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Perception Test: A Diagnostic Benchmark for Multimodal Video Models [78.64546291816117]
本稿では,事前学習したマルチモーダルモデルの知覚と推論能力を評価するために,新しいマルチモーダルビデオベンチマークを提案する。
知覚テストは、スキル(記憶、抽象化、物理学、セマンティックス)と、ビデオ、オーディオ、テキストモダリティ間の推論(記述的、説明的、予測的、反ファクト的)のタイプに焦点を当てている。
このベンチマークは、ゼロショット/少数ショットまたは限定的な微調整方式で、転送機能の事前訓練されたモデルを探索する。
論文 参考訳(メタデータ) (2023-05-23T07:54:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。