Fugu-MT 論文翻訳(概要): Core: Robust Factual Precision with Informative Sub-Claim Identification

論文の概要: Core: Robust Factual Precision with Informative Sub-Claim Identification

arxiv url: http://arxiv.org/abs/2407.03572v2
Date: Tue, 15 Oct 2024 21:49:55 GMT
ステータス: 翻訳完了
システム内更新日: 2024-11-28 17:07:34.402956
Title: Core: Robust Factual Precision with Informative Sub-Claim Identification
Title（参考訳）: Informative Sub-Claim Identification を用いたロバストFactual Precision
Authors: Zhengping Jiang, Jingyu Zhang, Nathaniel Weir, Seth Ebner, Miriam Wanner, Kate Sanders, Daniel Khashabi, Anqi Liu, Benjamin Van Durme,
Abstract要約: スコアを人工的にインフレーションするために、明らかまたは反復的なサブステートメントを追加することで、人気のあるメトリクスを操作できることを観察する。この観察は、Coreと呼ばれる新しいカスタマイズ可能なプラグインとプレイのサブステート選択コンポーネントを動機付けます。 Coreによって強化された多くの一般的な事実精度指標が、幅広い知識領域においてかなり堅牢であることを示す。
参考スコア（独自算出の注目度）: 44.36892500212747
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Hallucinations pose a challenge to the application of large language models (LLMs) thereby motivating the development of metrics to evaluate factual precision. We observe that popular metrics using the Decompose-Then-Verify framework, such as \FActScore, can be manipulated by adding obvious or repetitive subclaims to artificially inflate scores. This observation motivates our new customizable plug-and-play subclaim selection component called Core, which filters down individual subclaims according to their uniqueness and informativeness. We show that many popular factual precision metrics augmented by Core are substantially more robust on a wide range of knowledge domains. We release an evaluation framework supporting easy and modular use of Core and various decomposition strategies, which we recommend adoption by the community. We also release an expansion of the FActScore biography dataset to facilitate further studies of decomposition-based factual precision evaluation.
Abstract（参考訳）: 幻覚は、大規模言語モデル(LLM)の適用に挑戦し、実際の精度を評価するためのメトリクスの開発を動機付けている。 FActScoreのようなDecompose-Then-Verifyフレームワークを用いた一般的なメトリクスは、スコアを人工的にインフレーションするために、明白または反復的なサブステートメントを追加することで操作可能であることを観察する。この観察は、Coreと呼ばれる新しいカスタマイズ可能なプラグイン・アンド・プレイサブステート選択コンポーネントを動機付けます。 Coreによって強化された多くの一般的な事実精度指標が、幅広い知識領域においてかなり堅牢であることを示す。私たちは、Coreの簡単でモジュール化された利用とさまざまな分解戦略をサポートする評価フレームワークをリリースし、コミュニティによる採用を推奨します。また、FActScoreバイオグラフィーデータセットを拡張し、分解に基づく事実精度評価のさらなる研究を容易にする。

関連論文リスト

Learning More from Less: Unlocking Internal Representations for Benchmark Compression [37.69575776639016]
異種隠蔽状態を統一潜在空間に整列させて代表コアセットを構成するREPCOREを導入する。 5つのベンチマークと200以上のモデルの実験は、ランキングの相関と推定精度において、出力ベースラインよりも一貫した利得を示している。
論文参考訳（メタデータ） (2026-01-31T13:11:39Z)
OpinioRAG: Towards Generating User-Centric Opinion Highlights from Large-scale Online Reviews [12.338320566839483]
本稿では,大量のユーザレビューから得られた意見ハイライトの問題点について考察する。既存のメソッドはスケールアップに失敗するか、パーソナライズされたニーズを見落としている汎用的で一大の要約を生成するかのいずれかです。本稿では,RAGに基づくエビデンス検索とLCMを組み合わせた拡張性のあるトレーニングフリーフレームワークであるOpinioRAGを紹介する。
論文参考訳（メタデータ） (2025-08-30T00:00:34Z)
Generating Query-Relevant Document Summaries via Reinforcement Learning [5.651096645934245]
ReLSumは、検索関連性に最適化された製品記述のクエリ関連要約を生成するために設計された強化学習フレームワークである。このフレームワークは、トレーニング可能な大言語モデル(LLM)を使用して要約を生成し、その後、クロスエンコーダランキングモデルの入力として使用される。実験の結果、オンラインユーザエンゲージメント指標と同様に、リコールやNDCGを含むオフラインメトリクスの大幅な改善が示されている。
論文参考訳（メタデータ） (2025-08-11T18:52:28Z)
CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文参考訳（メタデータ） (2025-08-05T17:55:24Z)
When Claims Evolve: Evaluating and Enhancing the Robustness of Embedding Models Against Misinformation Edits [5.443263983810103]
ユーザーはオンラインでクレームと対話するので、しばしば編集を導入し、現在の埋め込みモデルがそのような編集に堅牢かどうかは不明だ。本研究では, 文埋め込みモデルの頑健性を評価するために, 有効かつ自然なクレーム変動を生成する摂動フレームワークを提案する。評価の結果,標準埋込モデルでは編集されたクレームに顕著な性能低下がみられ,LCM蒸留埋込モデルでは高い計算コストでロバスト性の向上が期待できることがわかった。
論文参考訳（メタデータ） (2025-03-05T11:47:32Z)
UniArk: Improving Generalisation and Consistency for Factual Knowledge Extraction through Debiasing [19.2764682793582]
本研究は,言語モデルにおける事前学習目標と下流学習目標との相違点を示す。汎用的で一貫した事実知識抽出のためのアダプタベースのフレームワークUniArkを提案する。
論文参考訳（メタデータ） (2024-04-01T17:22:07Z)
Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。 FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文参考訳（メタデータ） (2023-07-13T17:14:38Z)
Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文参考訳（メタデータ） (2023-05-28T06:30:29Z)
Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction [50.62245481416744]
実世界におけるオープン情報抽出モデルの評価をシミュレートする最初のベンチマークを示す。我々は、それぞれの例が知識不変のcliqueである大規模なテストベッドを設計し、注釈付けする。さらにロバスト性計量を解明することにより、その性能が全体の傾きに対して一貫して正確であるならば、モデルはロバストであると判断される。
論文参考訳（メタデータ） (2023-05-23T12:05:09Z)
Adaptive Local-Component-aware Graph Convolutional Network for One-shot Skeleton-based Action Recognition [54.23513799338309]
骨格に基づく行動認識のための適応的局所成分認識グラフ畳み込みネットワークを提案する。我々の手法はグローバルな埋め込みよりも強力な表現を提供し、我々のモデルが最先端に到達するのに役立ちます。
論文参考訳（メタデータ） (2022-09-21T02:33:07Z)
TRUE: Re-evaluating Factual Consistency Evaluation [29.888885917330327]
TRUE: 多様なタスクから既存のテキストの標準化されたコレクション上での、事実整合性メトリクスの総合的な研究である。我々の標準化により、前述した相関よりも動作可能で解釈可能なサンプルレベルのメタ評価プロトコルが実現される。さまざまな最先端のメトリクスと11のデータセットから、大規模NLIと質問生成と回答に基づくアプローチが、強力で相補的な結果をもたらすことが分かりました。
論文参考訳（メタデータ） (2022-04-11T10:14:35Z)
Bayesian Attention Modules [65.52970388117923]
実装や最適化が容易な,スケーラブルな注目バージョンを提案する。本実験は,提案手法が対応するベースラインに対して一貫した改善をもたらすことを示す。
論文参考訳（メタデータ） (2020-10-20T20:30:55Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。