論文の概要: When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge
- arxiv url: http://arxiv.org/abs/2608.21097v1
- Date: Fri, 21 Aug 2026 13:43:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.55656
- Title: When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge
- Title(参考訳): 信頼が真実と出会う時- LLM-as-Judgeにおける信頼と真実の分離性
- Abstract要約: 我々は、信頼スコアリングと二項真理分類という、共通の2つの判断の仮定をテストする。
正確性制御されたQAでは、LLM判事は信頼スコアを人間の行動基準よりも厳密な真理判定と整合させる。
その結果,現在のLCM-as-Judgeプロトコルは信頼スコアを真理判断の独立した証拠として扱うべきではないことがわかった。
- 参考スコア(独自算出の注目度): 34.24348605305491
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM-as-Judge systems can produce multi-dimensional evaluations, such as trustworthiness, reliability, and factuality, and these outputs are often interpreted as independent evidence. We test this assumption for a common pair of judgments: trust scoring and binary truth classification. On correctness-controlled QA, LLM judges align trust scores with truth verdicts more tightly than human behavioral reference, suggesting weaker separations between trust and truth judgment. We then apply stress tests by changing only source cues of identical QA between Human and AI. Source attribution shifts not only trust scores but also truth verdicts and logit-derived correct-side probabilities. Results show that current LLM-as-Judge protocols should not treat trust scores as independent evidence for truth judgments.
- Abstract(参考訳): LLM-as-Judgeシステムは、信頼性、信頼性、事実性などの多次元評価を生成でき、これらの出力はしばしば独立した証拠として解釈される。
我々はこの仮定を、信頼スコアと二項真理分類という、共通の判断の対で検証する。
正確性制御されたQAでは、LLM判事は信頼スコアを人間の行動基準よりも厳密な真理判定と整合させ、信頼と真理判断の分離が弱いことを示唆している。
次に、人間とAIの同一QAのソースキューだけを変更してストレステストを適用する。
情報源の帰属は、信頼スコアだけでなく、真実の評決やロジット由来の正当性もシフトする。
その結果,現在のLCM-as-Judgeプロトコルは信頼スコアを真理判断の独立した証拠として扱うべきではないことがわかった。
関連論文リスト
- Judge Reliability Harness: Stress Testing the Reliability of LLM Judges [1.1699027359021665]
Judge Reliability Harnessは、LCM判事の信頼性をテストする検証スイートを構築するためのオープンソースライブラリである。
安全性,説得性,誤用,エージェント行動の4つのベンチマークで,最先端の4つの審査員を評価した。
論文 参考訳(メタデータ) (2026-03-05T17:27:07Z) - Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency [78.91846841708586]
完全な自己整合性で答えられた事実でさえ、軽微な文脈干渉の下で急速に崩壊することを示します。
本研究では,概念的近傍における応答コヒーレンスを評価する信念の構造尺度であるNighbor-Consistency Belief(NCB)を提案する。
また、文脈不変の信念構造を最適化し、長い知識の脆さを約30%低減する構造意識訓練(SAT)を提案する。
論文 参考訳(メタデータ) (2026-01-09T16:23:21Z) - Calibrating Verbalized Confidence with Self-Generated Distractors [24.56911906044891]
DINCO(Distractor-Normalized Coherence)を紹介する。
DINCOは、LLMの予測可能性バイアスを推定し、いくつかの自己生成障害に対してモデルに独立して信頼性を持たせることによって説明している。
我々は、自己整合性の一般的なアプローチを、サンプル世代間でのコヒーレンスを活用すること、および非互換なクレーム上での検証におけるコヒーレンスを活用することとして、言語化された信頼を正規化したものである。
論文 参考訳(メタデータ) (2025-09-29T21:41:22Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Building and Measuring Trust between Large Language Models [10.539443038617089]
信頼を構築するための異なる戦略がどのように比較されるか、信頼がどのように暗黙的に測定されるか、そしてそれが信頼の明示的な尺度にどのように関係するかについて研究する。
我々は3つの方法で信頼を構築する。ラプポートを動的に構築すること、信頼を証明した事前記述スクリプトから始めること、LLMのシステムプロンプトに適応することである。
意外なことに、明示的な信頼の尺度は、暗黙的な信頼の尺度とほとんどあるいは非常に負の相関がないことがわかりました。
論文 参考訳(メタデータ) (2025-08-20T11:38:38Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - When Persuasion Overrides Truth in Multi-Agent LLM Debates: Introducing a Confidence-Weighted Persuasion Override Rate (CW-POR) [0.46040036610482665]
多くの実世界のシナリオでは、1つの大言語モデル(LLM)が矛盾する主張に遭遇する可能性がある。
1つのLCMベースのエージェントは、TruthfulQAから現実的な回答を提供し、もう1つのエージェントは、虚偽を積極的に擁護し、同じアーキテクチャが裁判官として機能する。
信頼度重み付き説得率(CW-POR)を導入し、裁判官がどの程度の頻度で騙されるかだけでなく、その誤った選択をいかに強く信じるかを捉える。
論文 参考訳(メタデータ) (2025-04-01T02:45:02Z) - Aligning Large Language Models for Faithful Integrity Against Opposing Argument [71.33552795870544]
大規模言語モデル(LLM)は複雑な推論タスクにおいて印象的な機能を示している。
原文が正しい場合でも、会話中に不誠実な議論によって容易に誤解される。
本稿では,信頼度と信頼度を両立させる新しい枠組みを提案する。
論文 参考訳(メタデータ) (2025-01-02T16:38:21Z) - TrustScore: Reference-Free Evaluation of LLM Response Trustworthiness [58.721012475577716]
大規模言語モデル(LLM)は、様々な領域にまたがる印象的な能力を示しており、その実践的応用が急増している。
本稿では,行動整合性の概念に基づくフレームワークであるTrustScoreを紹介する。
論文 参考訳(メタデータ) (2024-02-19T21:12:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。