論文の概要: LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection
- arxiv url: http://arxiv.org/abs/2604.05371v1
- Date: Tue, 07 Apr 2026 03:16:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.597875
- Title: LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection
- Title(参考訳): UAV検査における電力線分断のセマンティック判断のためのLCM-as-Judge
- Abstract要約: 本研究では,大型言語モデル(LLM)を意味判断として使用し,ドローン搭載モデルによる電力線分割結果の信頼性を評価することの実現可能性について検討する。
LLMは、視覚的信頼性が低下するにつれて、信頼性の適切な低下を示しながら、同一条件下で非常に一貫した分類学的判断を生成する。
- 参考スコア(独自算出の注目度): 8.949920712232585
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The deployment of lightweight segmentation models on drones for autonomous power line inspection presents a critical challenge: maintaining reliable performance under real-world conditions that differ from training data. Although compact architectures such as U-Net enable real-time onboard inference, their segmentation outputs can degrade unpredictably in adverse environments, raising safety concerns. In this work, we study the feasibility of using a large language model (LLM) as a semantic judge to assess the reliability of power line segmentation results produced by drone-mounted models. Rather than introducing a new inspection system, we formalize a watchdog scenario in which an offboard LLM evaluates segmentation overlays and examine whether such a judge can be trusted to behave consistently and perceptually coherently. To this end, we design two evaluation protocols that analyze the judge's repeatability and sensitivity. First, we assess repeatability by repeatedly querying the LLM with identical inputs and fixed prompts, measuring the stability of its quality scores and confidence estimates. Second, we evaluate perceptual sensitivity by introducing controlled visual corruptions (fog, rain, snow, shadow, and sunflare) and analyzing how the judge's outputs respond to progressive degradation in segmentation quality. Our results show that the LLM produces highly consistent categorical judgments under identical conditions while exhibiting appropriate declines in confidence as visual reliability deteriorates. Moreover, the judge remains responsive to perceptual cues such as missing or misidentified power lines, even under challenging conditions. These findings suggest that, when carefully constrained, an LLM can serve as a reliable semantic judge for monitoring segmentation quality in safety-critical aerial inspection tasks.
- Abstract(参考訳): 自律的電力線検査のためのドローンへの軽量セグメンテーションモデルの展開は、トレーニングデータとは異なる実環境下での信頼性の高いパフォーマンスを維持するという重要な課題を呈している。
U-Netのようなコンパクトなアーキテクチャは、リアルタイムのオンボード推論を可能にするが、セグメンテーション出力は予測不能な環境下で劣化し、安全性の懸念が高まる。
本研究では,大型言語モデル(LLM)を意味判断として使用し,ドローン搭載モデルによる電力線分割結果の信頼性を評価することの実現可能性について検討する。
新たな検査システムを導入するのではなく,外部のLLMがセグメンテーションオーバーレイを評価し,そのような裁判官が一貫してかつ知覚的に一貫性を持って振る舞うことができるかどうかを検証する監視犬のシナリオを定式化する。
この目的のために,審査員の反復性および感度を解析する2つの評価プロトコルを設計する。
まず,LLMを同じ入力と固定プロンプトで繰り返しクエリし,その品質スコアの安定性と信頼度を計測して再現性を評価する。
第2に、制御された視覚的腐敗(霧、雨、雪、影、太陽フレア)を導入し、裁判官の出力がセグメンテーション品質の段階的劣化にどう反応するかを分析することにより、知覚感度を評価する。
以上の結果から,LLMは視覚的信頼性が低下するにつれて,信頼性の低下を適切に示しながら,同一条件下での極めて一貫したカテゴリー判断を導出することが示された。
さらに、裁判官は、困難な条件下であっても、欠落や誤確認された電力線などの知覚的手がかりに反応し続けている。
これらの結果から,LLMは安全クリティカルな航空検査作業におけるセグメンテーション品質を監視するための信頼性の高いセマンティック・ジャッジとして機能することが示唆された。
関連論文リスト
- PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies [29.471598488144277]
ロングホライゾンのロボット操作は、物理的に実現不可能な遷移、接触による障害、実行中の効果的な自己補正の欠如に非常に敏感である。
本稿では,PhysReflect-VLAを提案する。PhysReflect-VLAは,クローズドループ制御パイプラインにおいて,VLAポリシーを物理的実現可能性評価と構造化自己回帰により拡張する,プラグアンドプレイ実行時信頼性フレームワークである。
論文 参考訳(メタデータ) (2026-06-25T15:18:10Z) - Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges [0.519554837386174]
本研究では, 意思決定後の操作性について検討し, 審査員との会話を通じて評価結果が変更できる程度について検討した。
LLM審査員は、反復的かつ中立的な再評価の下で非常に安定しているが、目標決定後の課題下では、かなり可逆的になる。
これらの逆転は、人間の嗜好との合意を低下させ、ベンチマークのランクをシフトさせ、自己報告の信頼性が高いにもかかわらず有害な評価変更を発生させるという、実践的な結果をもたらす。
論文 参考訳(メタデータ) (2026-06-03T19:37:23Z) - Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling [35.945096782147864]
MLLMの裁判官は、視覚的証拠がテキストの手がかりと矛盾する場合、知覚的に正しい答えに対して、もっともらしい物語に報いる傾向がある。
本稿では,最小限に編集された反事実応答を構成するPerceptually Perturbed Judgmentデータセットを提案する。
我々は、構造化GRPOベースの報酬とバッチレベルの目標を組み合わせた統一的なトレーニングフレームワークを開発し、明示的なペアワイドラベルを使わずにコヒーレントなグローバルオーダを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:59:46Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models [8.630726904040781]
EVPV(Explicit Visual Premise Verification)は,ステップが依存する視覚的前提の信頼性を段階的に評価する,軽量な検証インターフェースである。
EVPVはステップレベルの検証を改善し、強いベースラインよりも常にBest-of-Nの精度を向上する。
論文 参考訳(メタデータ) (2026-03-17T08:40:26Z) - Judge Reliability Harness: Stress Testing the Reliability of LLM Judges [1.1699027359021665]
Judge Reliability Harnessは、LCM判事の信頼性をテストする検証スイートを構築するためのオープンソースライブラリである。
安全性,説得性,誤用,エージェント行動の4つのベンチマークで,最先端の4つの審査員を評価した。
論文 参考訳(メタデータ) (2026-03-05T17:27:07Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Semantic Misalignment in Vision-Language Models under Perceptual Degradation [2.9140696506330723]
視覚知覚の制御下において視覚言語モデル(VLM)における意味的ミスアライメントについて検討する。
ダウンストリームVLMの動作に深刻な障害がみられ, 幻覚的対象の言及, 安全クリティカルな実体の欠落, 不整合性判定などが観察された。
以上の結果から,画素レベルのロバスト性とマルチモーダルなセマンティックな信頼性との明確な不一致が明らかとなり,現在のVLMシステムにとって重要な限界が浮き彫りになった。
論文 参考訳(メタデータ) (2026-01-13T09:13:05Z) - Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency [78.91846841708586]
完全な自己整合性で答えられた事実でさえ、軽微な文脈干渉の下で急速に崩壊することを示します。
本研究では,概念的近傍における応答コヒーレンスを評価する信念の構造尺度であるNighbor-Consistency Belief(NCB)を提案する。
また、文脈不変の信念構造を最適化し、長い知識の脆さを約30%低減する構造意識訓練(SAT)を提案する。
論文 参考訳(メタデータ) (2026-01-09T16:23:21Z) - Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness [4.129847064263056]
ルーブリックをベースとした短問合せ学習における大規模言語モデルの性能を体系的に評価する。
二つのタスクに対してアライメントは強いが、粗い粒度が増すにつれて劣化する。
実験により、モデルが注射に抵抗性がある一方で、同義置換に敏感であることが判明した。
論文 参考訳(メタデータ) (2025-12-21T05:22:04Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Aurora: Are Android Malware Classifiers Reliable and Stable under Distribution Shift? [51.12297424766236]
AURORAは、その信頼性と運用上のレジリエンスに基づいて、マルウェア分類器を評価するためのフレームワークである。
AURORAは、ポイント・イン・タイムのパフォーマンスを超えるように設計されたメトリクスのセットによって補完される。
さまざまなドリフトのデータセットにわたるSOTAフレームワークの脆弱性は、ホワイトボードへの復帰の必要性を示唆している。
論文 参考訳(メタデータ) (2025-05-28T20:22:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。