論文の概要: Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
- arxiv url: http://arxiv.org/abs/2607.20476v1
- Date: Mon, 25 May 2026 05:43:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.190169
- Title: Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
- Title(参考訳): マルチセンサ物理ハザード評価における大規模言語モデルのベンチマーク
- Abstract要約: マルチセンサー物理ハザードデータを評価するために,5つの大きな言語モデルが試験された。
テストされたすべてのモデルは、テストされたシナリオ間で予防的な警告信号を一貫して生成しなかった。
これらの知見は,身体の安全監視システムにテストモデルをデプロイする実践者に直接的な意味を持つ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present an empirical benchmark evaluating how five large language models assess multisensor physical hazard data. Testing 60 scenarios across three categories - multi-sensor joint assessment, response proportionality, and pattern disambiguation - with 1,800 API calls at temperature 0.0, we find that all tested models consistently produced no precautionary warning signal across the tested scenarios where multiple sensors are simultaneously elevated below their individual safety limits, while achieving near-perfect accuracy on single-sensor threshold violations. All five models (ChatGPT-4o, Gemini 2.5 Flash, DeepSeek, Kimi, Llama 3.1 8B) score near zero on Category A multi-sensor scenarios (Q2: 0.000-0.208; Q3: 0.000-0.592) compared to strong performance on single-sensor scenarios (Category B Q1: 0.975-1.000). Structured tabular formatting shows no consistent advantage over plain prose; ChatGPT-4o performs significantly better under prose (p = 0.001). These findings have direct implications for practitioners deploying the tested models in physical safety monitoring systems.
- Abstract(参考訳): 本稿では,5つの大言語モデルによるマルチセンサ物理ハザードデータの評価方法を評価する。
マルチセンサー共同評価、応答比例、パターンの曖昧さ - 温度0.0で1,800のAPIコールで60のシナリオをテストすると、テストされたすべてのモデルが、個別の安全限界以下で同時に複数のセンサが上昇するテストシナリオに対して、常に予防的な警告信号を生成せず、シングルセンサーのしきい値違反に対してほぼ完全な精度を実現していることがわかった。
すべての5つのモデル(ChatGPT-4o, Gemini 2.5 Flash, DeepSeek, Kimi, Llama 3.1 8B)はカテゴリでゼロに近いスコア マルチセンサーシナリオ(Q2: 0.000-0.208; Q3: 0.000-0.592)はシングルセンサーシナリオでの強いパフォーマンス(Category B Q1: 0.975-1.000)と比較される。
ChatGPT-4o は、散文(p = 0.001)の下では大幅に向上する。
これらの知見は,身体の安全監視システムにテストモデルをデプロイする実践者に直接的な意味を持つ。
関連論文リスト
- SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models [73.04773649437375]
マルチモーダル・セーフティ・モデレーションは、視覚的コンテンツ、ユーザ意図、およびアシスタント行動から生じるリスクを区別する必要がある。
SafeAtlas-VLは、1.5Mのトレーニングインスタンスのデータセットで、画像、要求レベル、応答レベルを5段階の順序で判定する。
SafeAtlas-Benchは5段階の予測と継続的なリスクスコアを評価するための5000のインスタンスである。
論文 参考訳(メタデータ) (2026-08-29T07:08:01Z) - TestifAI: Tomography-Based Testing for Deep Learning Systems [42.86570387250456]
TestifAIは、摂動の組み合わせに対する堅牢性を効率的かつ正確に推定するためのフレームワークである。
少数の摂動のみを適用したテストから多摂動空間におけるモデル挙動を再構成する。
低次 (1 と 2 の摂動) 観測から高次 (3 と 4 の摂動) テスト結果を予測することができ、集合的強靭性推定誤差は 7% 未満である。
論文 参考訳(メタデータ) (2026-08-19T13:25:50Z) - Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability [3.112410411428948]
本研究は,汎用視覚言語モデル(VLM)の特殊化,伝達,堅牢性,信頼性の体系的評価である。
Qwen2.5-VL-7B-インストラクトモデルは、ゼロショットプロンプト、インコンテキストラーニング(ICL)、および量子化低ランク適応(QLoRA)を用いたパラメータ効率の微調整を用いて評価される。
最高の微調整MPE値は、95%信頼区間(CI)が1.43-3.90%、圧力ゲージデータセットが2.61%、CIが1.66-3.80%、および4.4の合成データセットで2.39%である。
論文 参考訳(メタデータ) (2026-08-18T12:47:14Z) - Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - REDACT: A Systematically Controlled Multilingual Benchmark for Personal Information Detection [0.2529563359433233]
13,427のレコード、324,078のエンティティアノテーション、51のエンティティタイプ、4,127のサーフェスフォームパターン、9つのスクリプトに25の言語があるPIIベンチマークであるREDACTを提示する。
強度2被覆アレイサンプリング器は、ドメイン、フォーマット、難易度、長さ、密度、コードスイッチング、言語、隣接性、共起の9つの世代軸を制御する。
全ベンチマークから、1000レコードのロックされた言語階層化サンプル上で、5つの検出器(Presidio, GLiNER, OpenAI Privacy Filter, GPT-4.1, Claude Sonnet 4.6)を評価する。
論文 参考訳(メタデータ) (2026-06-18T07:38:15Z) - Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction [1.7865154997539017]
スパースオートエンコーダ(SAE)は、大きな言語モデルやタンパク質言語モデルに適用されているが、電子健康記録(EHR)基礎モデルには体系的に適用されていない。
InSPECT(外来)とMIMIC-IV(ICU)の残留ストリーム抽出点10点すべてにおいて、14.5万パラメータ自己回帰性臨床シーケンスモデルであるFlatASCEND上でTopK SAEを訓練する。
SAE分解は、トランスフォーマーの深さをまたいだプログレッシブな抽象化を明らかにする:層0の特徴は、ほぼ完全なトークン検出器(45.7%シングルトン)であり、層6の特徴は、複数の臨床カテゴリ(0.5%シングルトン)にまたがる約30のトークンタイプにまたがっている。
論文 参考訳(メタデータ) (2026-04-13T12:08:32Z) - Brittlebench: Quantifying LLM robustness via prompt sensitivity [44.950999933205985]
モデル感度を定量化する理論的枠組みを導入する。
我々は、フロンティアモデルの感度を均等に評価するために、新しい評価パイプラインであるBrttlebenchを設計する。
セマンティクスを保存する入力摂動は、与えられたモデルの性能変動の最大半分を占めることができる。
論文 参考訳(メタデータ) (2026-02-27T21:12:13Z) - When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models [54.08784776767683]
本稿では,物理条件を乱す最初のホワイトボックス世界モデルアタックであるPhysCond-WMA(PhysCond-WMA)を提案する。
PhysCond-WMAは知覚の忠実さを維持しながら意味、論理、決定レベルの歪みを引き起こす。
論文 参考訳(メタデータ) (2026-02-21T07:22:37Z) - How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study [5.740397289924559]
普遍的な勝者は存在せず、検出器のランキングはかなり不安定である。
我々の発見は、全能検出器のパラダイムに挑戦した。
論文 参考訳(メタデータ) (2026-02-08T04:36:13Z) - A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5 [101.4233736714284]
大規模言語モデル(LLM)とマルチモーダル大規模言語モデル(MLLM)は、言語とビジョンをまたいだ推論、認識、生成において大きな進歩をもたらした。
GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, Seedream 4.5-assesing each across language, vision- language and image generation。
論文 参考訳(メタデータ) (2026-01-15T15:52:52Z) - Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection [1.2802720336459552]
我々は,C,C++,Python,JavaScriptの4つの主要言語を対象としたマルチ脆弱性検出のベンチマークを紹介する。
長文コードサンプルに制御された脆弱性数を注入することにより,4万ファイルのデータセットを構築した。
その結果, 脆弱性密度の増加に伴い, 性能が著しく低下することが明らかとなった。
論文 参考訳(メタデータ) (2025-12-26T05:43:35Z) - CAFuser: Condition-Aware Multimodal Fusion for Robust Semantic Perception of Driving Scenes [56.52618054240197]
本研究では,運転シーンのロバストな意味認識のための条件対応型マルチモーダル融合手法を提案する。
CAFuserは、RGBカメラ入力を用いて環境条件を分類し、コンディショントークンを生成する。
我々のモデルは、特に悪条件シナリオにおいて、ロバスト性と精度を著しく向上させる。
論文 参考訳(メタデータ) (2024-10-14T17:56:20Z) - ASSERT: Automated Safety Scenario Red Teaming for Evaluating the
Robustness of Large Language Models [65.79770974145983]
ASSERT、Automated Safety Scenario Red Teamingは、セマンティックなアグリゲーション、ターゲットブートストラップ、敵の知識注入という3つの方法で構成されている。
このプロンプトを4つの安全領域に分割し、ドメインがモデルの性能にどのように影響するかを詳細に分析する。
統計的に有意な性能差は, 意味的関連シナリオにおける絶対分類精度が最大11%, ゼロショット逆数設定では最大19%の絶対誤差率であることがわかった。
論文 参考訳(メタデータ) (2023-10-14T17:10:28Z) - Neural Network Virtual Sensors for Fuel Injection Quantities with
Provable Performance Specifications [71.1911136637719]
証明可能な保証が、他の現実世界の設定にどのように自然に適用できるかを示す。
本研究では, 燃料噴射量を一定範囲で最大化するために, 特定の間隔の燃料噴射量を目標にする方法を示す。
論文 参考訳(メタデータ) (2020-06-30T23:33:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。