論文の概要: DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules
- arxiv url: http://arxiv.org/abs/2605.08614v1
- Date: Sat, 09 May 2026 02:17:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.772551
- Title: DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules
- Title(参考訳): シンボリックルールに基づくLCMに基づく産業保守行動勧告のベンチマーク
- Abstract要約: 複雑な工業資産の監視は、センサーの条件に基づいて引き起こされるエンジニアによる象徴的な規則に依存している。
ルールをメンテナンスステップに変換するには、長年の実践を通じて得られた資産固有の知識が必要です。
このルール・ツー・アクション・ステップの意思決定支援としてLLMが有効か検討し,6,690名の専門家による複数選択質問をベンチマークした。
- 参考スコア(独自算出の注目度): 4.124344125532972
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Monitoring complex industrial assets relies on engineer-authored symbolic rules that trigger based on sensor conditions and prompt technicians to perform corrective actions. The bottleneck is not detection but response: translating rules into maintenance steps requires asset-specific knowledge gained through years of practice. We investigate whether LLMs can serve as decision support for this rule-to-action step and introduce \ours{}, a benchmark of 6{,}690 expert-validated multiple-choice questions from 118 rule-action pairs across 16 asset types. We contribute (i) a symbolic-to-MCQA pipeline normalizing rules to Disjunctive Normal Form with embedding-based distractor sampling, (ii) five variants probing distinct failure modes (Pro, Pert, Verbose, Aug, Rationale), and (iii) a benchmark of 29 LLMs and 4 embedding baselines. A human evaluation (9 practitioners, mean 45.0\%) confirms \ours{} requires specialist knowledge beyond operational experience. Three findings stand out. The frontier has closed: the top three LLMs lie within one Macro point, with Bradley-Terry Elo placing claude-opus-4-6 30 points above the next model. Yet \ours{}\,Pro exposes brittleness, with every model losing 13--60\% relative accuracy under distractor expansion. \ours{}\,Aug exposes pattern-matching: under condition inversion, frontier models still select the original answer 49--63\% of the time. The deployment bottleneck is not capability but calibration: frontier models handle template-style fault detection but break under structural perturbation.
- Abstract(参考訳): 複雑な工業資産の監視は、エンジニアが認可した象徴的な規則に依存しており、センサーの条件に基づいて、技術者に修正措置を実行するよう促す。
ルールをメンテナンス手順に変換するには、長年の実践を通じて得られたアセット固有の知識が必要です。
このルール・ツー・アクション・ステップの意思決定支援としてLLMが有効であるかどうかを検証し,16種類のルール・アクション・ペアから6{,}690名の専門家による複数選択質問のベンチマークである \ours{} を導入する。
コントリビューション
(i)埋め込み型インタプリタサンプリングによるDisjunctive Normal Formの規則を標準化するシンボリック・ツー・MCQAパイプライン
二 異なる故障モード(Pro、Pert、Verbose、Aug、Rationale)を示す五つの変種
(iii)29個のLDMと4個の埋め込みベースラインのベンチマーク。
人間の評価 (9人の実践者、つまり45.0\%) は、 \ours{} が運用経験以上の専門知識を必要とすることを確認している。
3つの発見がある。
最上位3台はマクロ点内にあり、ブラッドリー・テリー・エロはクロード・オプス-4-6 30点を次のモデルより上に置く。
しかし、 \ours{}\,Pro は脆さを露呈し、全てのモデルがイントラクタ拡張の下で相対精度を 13--60 % 失う。
\ours{}\,Augはパターンマッチングを公開している: 条件インバージョンの下では、フロンティアモデルは依然として元の解 49--63\% を選択する。
フロンティアモデルはテンプレートスタイルの障害検出を処理しますが、構造的摂動では壊れます。
関連論文リスト
- Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation [0.0]
フェデレーションクラスをフロンティアの大規模言語モデルで文書化する。
故障は最初の観測で再現されるが、経験的表面は不安定である。
規制されたフロンティアモデルの正確性は、注意を払わずにシフトする移動したコンプライアンス境界である。
論文 参考訳(メタデータ) (2026-07-25T22:40:02Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents [5.689042186242701]
企業の専門家が暗黙的に適用する決定ルールは、反復的エラー分析によって体系的に回復し、改善することができる。
基本機構は textbfEISR である textbfTrace2Policy について述べる。
各ラウンドは検証セット上でルールを実行し、ルート原因によるエラーをMISSING、WRONG、CONFLICTタイプにクラスタし、ターゲットパッチを適用し、レグレッションゲートを通過するもののみをコミットする。
論文 参考訳(メタデータ) (2026-06-09T06:05:29Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs [86.49905745865038]
Soohakは64人の数学者によって新たに書かれた439プロブレムのベンチマークである。
データセットは2026年後半に公開され、中間で要求に応じてモデル評価が利用可能になる。
論文 参考訳(メタデータ) (2026-05-09T17:14:22Z) - ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning [5.523132953818281]
本稿では,LLM推論のためのシステムであるReFlectについて述べる。
6つの推論領域にまたがる制御された実験により、100個の監査された反射ブロックのうち90個の問題にフラグを付けない、プロンプトレベルの自己批判が公式テンプレートを生成することが示された。
我々のReFlectハーネスは, GPT-4o-miniで41%, Claude Sonnet 4.5で56%のタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-05-07T06:29:34Z) - Democratizing AI with Small Language Models: Structured Benchmarking and Parameter-Efficient Fine-Tuning for Local Deployment [0.0]
135M と 3B パラメータ間の9つのオープンウェイト言語モデルを,局所的な配置を構造化したベンチマークで評価した。
共有パラメータ効率の微調整パイプラインは、4ビットのNF4量子化とDoRA/LoRAスタイルのアダプタを用いたモデルのサブセットをNVIDIA L4クラス予算で適応する。
ベース評価では、Qwen Coder 3Bが75.67%、Qwen2.5 1.5Bが67.10%、Qwen3.5 2Bが64.98%、Granite 3.3 2Bが64.61%である。
論文 参考訳(メタデータ) (2026-05-05T02:36:09Z) - Synthesizing the Kill Chain: A Zero-Shot Framework for Target Verification and Tactical Reasoning on the Edge [12.201060368447251]
本稿では,コンパクトな視覚言語モデル(VLM)を用いた軽量物体検出を実現する階層型ゼロショットフレームワークを提案する。
我々は,このパイプラインを,偽陽性フィルタリング(100%精度),損傷評価(97.5%),きめ細かい車両分類(55-90%)の3つのタスクで,バトルフィールド6の55個の高忠実合成ビデオ上で評価した。
論文 参考訳(メタデータ) (2026-02-10T23:00:19Z) - ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces [3.151184728006369]
本稿では,聴覚条件下でのマルチモデルオーケストレーションのための測定フレームワークACARを提案する。
ACARは、N=3プローブサンプルから計算した自己整合分散(sigma)を使用して、単一モデル、2モデル、3モデル実行モードでタスクをルーティングする。
我々は4つのベンチマークにまたがる1,510のタスクに対してACARを評価し、7,550以上の監査可能な実行を生成した。
論文 参考訳(メタデータ) (2026-02-06T23:27:17Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models [48.361839372110246]
本研究では,制約拡張,競合検出,命令書き換えを行う自動命令生成パイプラインを開発する。
我々は、19の大規模言語モデルを評価し、制約形式間の性能のかなりの変動を明らかにする。
詳細な分析では、これらの利得は主にモデルのアテンションモジュールパラメータの変更に起因していることを示している。
論文 参考訳(メタデータ) (2025-05-12T14:16:55Z) - ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates [51.633266497799745]
思考テンプレートのスケーリングによる階層的LLM推論は、推論検索空間を効果的に最適化することができる。
i)類似または関連する推論問題に一般化可能な500ほどの高レベルな思考テンプレートを含む構造化・汎用的な思考テンプレートライブラリ,(ii)長いCoTではなく一連の思考テンプレート上で階層的な強化学習を行う,(iii)全く新しい推論スケーリングシステム,の3つの革新を紹介した。
論文 参考訳(メタデータ) (2025-02-10T18:51:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。