論文の概要: Position: Every Ground Truth is a Human Construction, not an Objective Truth
- arxiv url: http://arxiv.org/abs/2607.09668v1
- Date: Thu, 28 May 2026 20:10:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.991182
- Title: Position: Every Ground Truth is a Human Construction, not an Objective Truth
- Title(参考訳): 位置: 全ての地上の真理は、目的の真理ではなく、人間の構成である
- Abstract要約: 基底真理データセットは、機械学習モデルのトレーニングと評価において、基準値として基本的な役割を果たす。
地上の真実は、自然に与えられる中立的な客観的な測定ではなく、人間や技術の配列によって構築されていると論じる。
- 参考スコア(独自算出の注目度): 1.20053409042067
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ground truth datasets play a fundamental role as reference values in the training and evaluation of machine learning models. This position paper argues that ground truths are not neutral objective measurements that are naturally given, but instead that they are constructed by arrangements of humans and technologies. We argue that the ML community will benefit from articulating and discussing these often invisible or unreported choices and acknowledging that reference data sets are contingent, not universal. Focusing on the situated and context-dependent nature of ground truths can improve reliability by enabling a better informed perspective on where, when, and how the datasets, and the models they have shaped, can best be used. We argue for increasing `situated reliability' which includes articulating the limits and strengths of models and their truth claims. Finally, paying more attention to the construction of ground truths can support transparency, accountability, and interdisciplinary work.
- Abstract(参考訳): 基底真理データセットは、機械学習モデルのトレーニングと評価において、基準値として基本的な役割を果たす。
このポジションペーパーでは、基底の真理は自然に与えられる中立的な客観的な測定ではなく、人間や技術の配列によって構築されていると論じている。
MLコミュニティは、しばしば目に見えない、あるいは報告されていない選択を明確化し、議論することの恩恵を享受し、参照データセットが一致していることを認め、普遍的ではない、と我々は主張する。
地上の真実の位置と文脈に依存した性質に焦点を合わせることで、どこで、いつ、どのようにデータセット、そして彼らが形成したモデルが最適に使えるかについてのより深い視点を提供することで、信頼性を向上させることができる。
モデルの限界と強みとその真理的主張を明示する「定性的信頼性」の増大を論じる。
最後に、基礎的な真実の構築により多くの注意を払うことは、透明性、説明責任、学際的な仕事を支援することができる。
関連論文リスト
- Information Discernment in Large Language Models [4.277461007196155]
Learn2Discernは、解釈可能なメトリクスを持つ3つの規範的公理に基礎を置いている実験的なフレームワークであり、ベンチマークである。
モデルはソースと真実の識別にほぼ近い確率で実行し、ソースの信頼性の2倍のソースの人気を頼りにし、クレームが地上の真実に対してその位置を改善または悪化させるかどうかをほぼ等しく更新する。
論文 参考訳(メタデータ) (2026-05-22T12:13:16Z) - Exploring the Generalizability of Factual Hallucination Mitigation via Enhancing Precise Knowledge Utilization [49.95746521480879]
PKUE(Precise Knowledge utilization Enhancement, 精密知識利用促進)を導入し, 正確かつ単純な事実質問に対する自己生成応答のモデルを微調整する。
大規模な実験により、PKUEはLLM全体の性能を著しく改善することが示された。
論文 参考訳(メタデータ) (2025-02-26T13:34:52Z) - Look Ma, No Ground Truth! Ground-Truth-Free Tuning of Structure from Motion and Visual SLAM [64.57742015099531]
評価は、モーション(SfM)と視覚SLAM(VSLAM)システムから構造を開発・調整する上で重要である。
この土台真実への依存は、様々な環境におけるSfMおよびSLAMアプリケーションを制限する。
幾何学的基底真理の必要をなくすため,GTF評価手法を提案する。
論文 参考訳(メタデータ) (2024-12-02T04:40:03Z) - FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows" [74.7488607599921]
FaithEvalは、コンテキストシナリオにおける大規模言語モデル(LLM)の忠実度を評価するためのベンチマークである。
FaithEvalは4.9Kの高品質な問題で構成され、厳格な4段階のコンテキスト構築と検証フレームワークを通じて検証されている。
我々の研究は、最先端のモデルでさえ、与えられた文脈に忠実であり続けるのに苦労することが多く、大きなモデルが必ずしも改善された忠実を示すとは限らないことを明らかにしている。
論文 参考訳(メタデータ) (2024-09-30T06:27:53Z) - AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents [27.10147264744531]
本研究では,Large Language Models (LLM) をベースとしたエージェントが,マルチターン対話環境でシナリオをナビゲートする方法について検討する。
エージェントの反応を評価するために,心理文献にヒントを得た真正性検知装置を開発した。
我々の実験は、すべてのモデルが50%未満の真理であることを示したが、真理性と目標達成率(実用性)はモデルによって異なる。
論文 参考訳(メタデータ) (2024-09-13T17:41:12Z) - LLMs' Reading Comprehension Is Affected by Parametric Knowledge and Struggles with Hypothetical Statements [59.71218039095155]
言語モデルの自然言語理解(NLU)能力を評価するための主要な手段として、読解理解(RC)があげられる。
文脈がモデルの内部知識と一致している場合、モデルの回答がコンテキスト理解に由来するのか、あるいは内部情報から生じるのかを識別することは困難である。
この問題に対処するために、架空の事実や実体に基づいて、想像上のデータにRCを使うことを提案する。
論文 参考訳(メタデータ) (2024-04-09T13:08:56Z) - Alignment for Honesty [105.72465407518325]
最近の研究は、大きな言語モデル(LLM)を有用性と無害性と整合させることに大きく貢献している。
本稿は,LLMが知識の欠如に積極的に回答を拒むことを確実にする,エンフォネストリーにおけるアライメントの重要性を論じる。
これらの課題に対処するために、まずは正確な問題定義を確立し、儒教の分析に触発された「誠実さ」を定義します。
論文 参考訳(メタデータ) (2023-12-12T06:10:42Z) - A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia [57.31074448586854]
大規模言語モデル(LLM)は、そのコンテキストで提供される新しい情報を引き出すという印象的な能力を持つ。
しかし、この文脈的基盤のメカニズムはいまだに不明である。
本稿では,Fakepedia を用いたグラウンドディング能力の研究手法を提案する。
論文 参考訳(メタデータ) (2023-12-04T17:35:42Z) - Personas as a Way to Model Truthfulness in Language Models [23.86655844340011]
大規模な言語モデル(LLM)は、インターネットから大量のテキストで訓練されている。
本稿では,真理ラベルのトレーニングを受けていないLMが真理を知っているように見える理由を説明する。
論文 参考訳(メタデータ) (2023-10-27T14:27:43Z) - Truth Machines: Synthesizing Veracity in AI Language Models [0.0]
我々は、AIシステムにおける真理の闘争と、現在までの一般的な対応について議論する。
その後、大規模な言語モデルであるInstructGPTにおける真理の生成について調査する。
これらの論理と矛盾はChatGPTで発生し、真理を非自明な問題として繰り返し主張する。
論文 参考訳(メタデータ) (2023-01-28T02:47:50Z) - The Inconvenient Truths of Ground Truth for Binary Analysis [3.198144010381572]
すべての真実が平等に創造されるわけではない。
本稿では,二項分析のコミュニティに対して,基礎的真理の概念を深く検討するよう呼びかける。
論文 参考訳(メタデータ) (2022-10-26T23:27:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。