論文の概要: Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes
- arxiv url: http://arxiv.org/abs/2608.23640v1
- Date: Sun, 23 Aug 2026 20:10:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.435574
- Title: Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes
- Title(参考訳): 合成回想録の聴取 : LLMによる生命記録に対する自己バイオグラフィーにおけるシーン・レベル・コンパベーションの測定
- Abstract要約: 本研究では,大規模言語モデルの自叙伝を,主観的基礎構造コーパスに対して初めて定量的に評価した。
366日間の「ページ・アズ・デイ」で1対1の物語を収録した本が、会話型LLMで起草された。
毎日、独立した検証コーパスに対して逸話の場面で監査された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a large language model (LLM) is asked to write a person's life, how much of what it writes actually happened? We present a scene-level case-study audit - the first quantified audit of LLM-generated autobiography against a subject-specific ground-truth corpus that we are aware of, based on an unsystematic literature search. The subject and the author of this paper are the same person: a 366-day "page-a-day" book of first-person anecdotal entries was drafted with a conversational LLM whose documented inputs were a template, two exemplar days, and each day's quote - not her corpus - and every day was subsequently audited at the anecdote-scene level against an independent verification corpus using a four-level rubric fixed before analysis. We define the verification-failure rate as the share of days not rated VERIFIED (scene positively corroborated): 354 of 366 days fail, 96.7% (Wilson 95% CI 94.4-98.1%). Only 12 days contain a corroborated scene; 19 days (5.2%) assert claims actively contradicted by the record; the dominant failure mode is grounded drift - real people, employers, and settings inside invented scenes - though its measured share varies across raters. Independent re-rating replicates the headline (no evidence the original rate was inflated) while showing that the four-way taxonomy has only fair-to-moderate reliability. Regenerating the same days with current named models reproduces 100% verification failure under the same inputs; grounding generation in the subject's corpus significantly improves the verification rate while leaving substantial residual failure (83.3%). We contribute the measurement, a reusable audit instrument whose WEAK/UNVERIFIED boundary we show to be unreliable, and a grounding remedy with quantified effect.
- Abstract(参考訳): 大きな言語モデル(LLM)が人の人生を書くように求められたとき、実際に書かれたことのどれ程が実際に起こったのか?
現場レベルのケーススタディ・オーディ - 未体系の文献検索に基づいて, LLM 生成した自叙伝を, 被写体固有の接地トラスコーパスに対して初めて定量化した監査を行う。
本論文の主題と著者は同じ人物である: 366日間の「1日1ページ」の1対1の引用文を、文書化された入力がテンプレートと2つの例題日、そして毎日の引用(彼女の体格ではなく)である会話用LLMで起草し、分析の前に固定された4レベルルーブリックを用いて、逸話の場面で監査した。
366日のうち354日が失敗、96.7%(ウィルソン95%CI94.4-98.1%)である。
19日 (5.2%) は記録に積極的に矛盾していると主張しており、支配的な失敗モードは現実の人々、雇用主、発明されたシーン内の設定を根拠にしている。
独立的な再分類は、見出しを再現する(元の比率が膨らんだ証拠はない)一方で、4方向の分類は公正な信頼性しか持たないことを示している。
同じ日を現在のモデルで再現すると、同じ入力の下で100%の検証失敗を再現し、被検体のコーパスにおけるグラウンド生成は、かなりの残留故障(83.3%)を残しながら、検証率を大幅に改善する。
我々は,WAAK/UNVERIFIED境界が信頼できないことを示す再利用可能な監査装置と,定量化効果のある接地療法に貢献する。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Benchmark Contamination: A Taxonomy Organized by Defeated Mitigation [0.0]
ベンチマークスコアは、モデルのジョイント特性、評価ハーネス、エレケーション予算、サンプル集団、汚染状態である。
我々は,各タイプの敗北の緩和によって組織された分類を紹介した。
2つの変数は、予め登録された有病率-ロバスト閾値を下回る。
論文 参考訳(メタデータ) (2026-08-29T23:04:09Z) - Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research [7.426963307811556]
本稿では,保守型ポイントインタイム知識ライブラリをレポート作成から分離する2層エージェントシステムを提案する。
ポータブルなマルチエージェント"ライター"ランタイムは、任意の知識遮断Tにおいて矛盾のないエビデンス基底レポートを構成する。
我々は,555,926枚のエビデンスカードを出力する6,130個のソースの自己収集・公開コーパスを評価した。
論文 参考訳(メタデータ) (2026-08-13T09:09:28Z) - The Half-Lives of Generative-AI Evidence: A 40-Record Audit, a Claim-Currency Framework, and a Reflexive Case of Frontier-Model-Assisted Research [0.0]
生成AI評価は出版前に歴史的になりうるが、カレンダー年代は全ての結論に等しく影響しない。
本稿は,2025年7月18日から2026年7月17日までに出現した40件の実証記録の最大変量解析コーパスを検証した。
監査コード化されたパブリッシュルート、実行タイミング、モデルアイデンティティ、最新の名前付きジェネレーションまたは不変スナップショットの年齢、同ファミリーのスーパーセッション、リフレッシュ動作。
論文 参考訳(メタデータ) (2026-07-27T05:59:49Z) - Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks [0.0]
オープンなPlato/Denarioアーキテクチャの拡張であるPlato-Bioを開発した。
Plato-Bioは明示的なワークフローステートを、プロファイランスレコード、引用チェック、クレーム・ツー・エビデンスリンク、スコープドファイル書き込み、パブリッシュゲートと結合する。
現在のクリーンリビジョンでは、完全なPythonスイートが931パス、6スキップ、エラーやエラーは発生しない。
論文 参考訳(メタデータ) (2026-07-27T03:55:39Z) - Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings [0.0]
シードライフスクリプトサンプリング器は、テキストが存在する前に、有効間隔のボラティリティクラスとソースチャネルの事実を出力する。
検証者は、すべての植えられた事実を確認し、質問はスクリプトから機械的にインスタンス化される。
人工的でフィクション化されたコーパスは、私たちが調査したベンチマークから欠落している特徴を埋め込んでいる。
論文 参考訳(メタデータ) (2026-07-24T04:19:45Z) - The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol [0.0]
LLM-as-judgeシステムにおけるバイアスの研究は、通常、LLMに実数と対になる幻覚的な答えを生成させ、その両方を裁判官に提示することで合成コーパスを構築する。
我々は、この世代が静かに失敗する事例を報告し、失敗モードは偶発的ではなく構造的であると主張するために使用します。
最小の摂動に基づくコーパスに注入された類似の断層は、ゼロコストでゼロヒューマンの金-負の弦比較によって100%精度で捕捉される。
論文 参考訳(メタデータ) (2026-07-15T11:12:54Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - Investigating Factuality in Long-Form Text Generation: The Roles of Self-Known and Self-Unknown [68.33486915047014]
様々な大言語モデル(LLM)における長文テキスト生成の事実性について検討する。
分析の結果, 文末文の事実性は低下傾向にあり, 支持請求件数が増加傾向にあることが明らかとなった。
論文 参考訳(メタデータ) (2024-11-24T22:06:26Z) - LLMs Can Patch Up Missing Relevance Judgments in Evaluation [56.51461892988846]
我々は、大きな言語モデル(LLM)を使って、不確定な文書を自動的にラベル付けします。
TREC DLトラックの関連性判定から関連文書をランダムにドロップすることで,穴の度合いの異なるシナリオをシミュレートする。
Vicuna-7B と GPT-3.5 Turbo の平均値に対して,Kendall tau の0.87 と 0.92 の相関式が得られた。
論文 参考訳(メタデータ) (2024-05-08T00:32:19Z) - FABLES: Evaluating faithfulness and content selection in book-length summarization [55.50680057160788]
本稿では,本書の忠実度と内容選択の大規模評価を行う。
LLMが生成した26冊のサマリーで作成した3,158冊の注釈のデータセットであるFABLESを5.2KUSDで収集する。
注釈の分析によると、ほとんどの不誠実な主張は出来事や登場人物の状態に関係しており、物語を無効にするために間接的推論を必要とする。
論文 参考訳(メタデータ) (2024-04-01T17:33:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。