論文の概要: FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact
- arxiv url: http://arxiv.org/abs/2608.03372v1
- Date: Tue, 04 Aug 2026 09:20:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.111013
- Title: FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact
- Title(参考訳): FACTWASH:AIの書き直し
- Abstract要約: AIシステムは情報を常に書き直す:会話が記憶される記憶となり、ドキュメントが答えになる。
私たちはファクト・ウォッシングと呼んでいる。これはオープンソースのライトタイム・ゲートで、判断的にそれをキャッチし、裁判官ではなく、名前のついた旗や証拠を持っています。
コストの安いチェックはいつ,モデルが必要なのか?
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI systems rewrite information constantly: conversations become stored memories, documents become answers. The rewrite can keep a claim while washing away what made it checkable, who said it, how sure they were, when it held. We call that failure factwashing, and release factwash, an open-source write-time gate that catches it deterministically, with named flags and evidence rather than an LLM judge. Building it answers a practical question: when does a cheap check suffice, and when do you need a model? What decides is whether the property has a bounded surface-cue inventory. Explicit negation cues are close to enumerable, so a word list finishes and transfers, reaching 0.91 F1 on untuned text. Hedging and attribution have open-ended realizations, so vocabulary plateaus near half recall, and a one-question LLM witness recovers +17 and +15 points of cue-detection recall at equal precision. Deployed, that witness may only lower a verdict, so it buys precision rather than coverage. We measure cue detection on 105,596 independently annotated sentences. A blind-labelled corpus of memory writes then locates the failure: 55% of bad writes in conversational hearsay, 7% in business email (p < 0.001), so the first deployment question is not which detector to use but whether the failure occurs at all. On unmodified mem0 2.0.7, the gate flags 5 of 8 hedged-hearsay writes.
- Abstract(参考訳): AIシステムは情報を常に書き直す:会話が記憶される記憶となり、ドキュメントが答えになる。
書き直しはクレームを洗い流しながら、誰がそれを言ったか、それが保持された時点でどれだけの確証があったかを確認しながら、クレームを保持することができる。
私たちは、失敗をファクトウォッシングと呼び、オープンソースのライトタイムゲートであるファクトウォッシュをリリースし、LCMの裁判官ではなく、名前付きフラグとエビデンスで決定的にそれをキャッチします。
コストの安いチェックはいつ,モデルが必要なのか?
決定は、この性質が表面積が有界であるかどうかである。
明示的な否定キューはエヌマブルに近いので、ワードリストが終了して転送され、未修正のテキストで0.91 F1に達する。
ヘッジとアトリビューションはオープンエンドな実現であり、ボキャブラリプラトーはハーフリコールに近いため、LLMの目撃者は同じ精度で +17 と +15 のキュー検出リコールを回復する。
配信されると、その証人は評決を下すだけなので、報道よりも正確さを買うことができる。
注記文105,596節のcue検出を独立に行う。
55%の悪い書き込みが会話の聞き取りで、7%がビジネスメール(p < 0.001)である。
修正されていないmem0 2.0.7では、8つのヘッジドハーセイの5つのゲートフラグが書かれています。
関連論文リスト
- From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection [12.159476982130286]
音声のディープフェイクは、聞き手や自動化されたシステムを騙すのに十分な説得力のある話者の声を模倣することができる。
ほとんどの検出器は発話ごとに1点のスコアで終わるが、なぜ境界線アイテムが信頼されるべきなのか、延期されたのか、あるいはレビューされるべきなのかは、ほとんど語っていない。
この疑問に答えるには、4つの整列した手がかりを後期校正ステップに伝達する監査可能な決定記録がある。
論文 参考訳(メタデータ) (2026-09-08T15:38:57Z) - What the Window Does Not Contain: Auditing Provenance in a Document-Grounded Instability Benchmark [0.0]
私たちは60のタスクと470のアイテムのベンチマークを作成しました。
私たちは自身のコーパスを監査し、Exerptで構築されたベンチマークが持てる欠陥を見つけました。
コーパスと112,800の生のレスポンスをすべてリリースし、あらゆるドキュメントベンチマークの実行可能なチェックとして監査を行います。
論文 参考訳(メタデータ) (2026-09-05T15:43:05Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes and What Recovers It [0.0]
Ambient AIは、ドラフト臨床ノートを書き、公開監査では、主なエラーは欠落である。
私たちのベンチマークには、監査済みのファクトシートから500個のルリックエラーノートペアがあります。
シングルノートでは、完璧なノートよりも確実にデザインフラグが省略されることはない。
論文 参考訳(メタデータ) (2026-08-31T15:59:54Z) - Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail [0.0]
障害レコードの修正的なゲインを、失敗するアクションを再発光するログ確率の変化として定義すると、そのゲインは、命令チューニングされたモデル毎に負であることが分かります。
問題は、モデルのエラーメッセージの把握ではなく、ハーネスにある。
論文 参考訳(メタデータ) (2026-08-24T10:19:17Z) - Quipu: A Governed Bitemporal Knowledge Graph Store [0.0]
Quipuは4つのデフォルトを逆転する組み込み可能なナレッジストアだ。
議事録が保留中のポストステートを評価するゲートを経由する以外は、事実は入らない。
支配的な作家からの痕跡は、その修復によって監査名のライブ執行のギャップを表面化する。
論文 参考訳(メタデータ) (2026-08-17T17:04:29Z) - Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages [44.340269814027174]
マルチエージェント推論システムは、合意、信頼、あるいは自動スコアを使用して、どのメッセージが最終回答になるかを決定する。
しかし、間違った答えは、有用な分解、制約、または科学的原理を含むことができる。
この区別は、5つの独立に生成されたメッセージをキャッシュする制御された測定プロトコルであるDHD(Diverse hypothesis Deliberation)で検証する。
論文 参考訳(メタデータ) (2026-08-14T15:16:57Z) - Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets [13.85834524293015]
私たちは、ロールが想定する能力を測定し、通常、ロールが配置されるプロトコルの下でそれを欠いていることを見つけます。
モデルは、その候補がセット自体の作者よりもはるかに優れているかどうかを判断する。
論文 参考訳(メタデータ) (2026-08-02T05:00:44Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts [0.0]
LLMエージェントは会話を格納された「成果物」に書き直す。
一度も真実であり、訂正されなかった役割は、平らな事実として記憶され、故意の注入のように振る舞う。
1つの負荷を持つメモリがハザードであり、1つの冗長なソースが正しい決定を復元する。
論文 参考訳(メタデータ) (2026-06-28T08:56:48Z) - Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One [0.0]
言語モデルのメモリは、メモリを全く持たないよりも悪い場合がある。
間違った結論を維持しながら、その背後にある作業を捨てるメモリは、確実な答えとして古い値を出力する。
論文 参考訳(メタデータ) (2026-06-24T06:24:53Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations [15.537674351419234]
デプロイされたエージェントに対するコンテキスト操作攻撃は、このギャップを積極的に活用する。
明示的な依存性グラフを保持するランタイム検証器でそれをクローズします。
継続がサポートされるかどうかを確認することは、グラフウォークに還元され、リトラクションは同じグラフを通して、サポートを失う結論を正確に宣言する。
論文 参考訳(メタデータ) (2026-05-13T22:54:16Z) - Probing for Knowledge Attribution in Large Language Models [45.47366023067617]
大規模言語モデル(LLM)は、しばしば流動的だが根拠のないクレームや幻覚を生成する。
適切な緩和は、モデルの答えがプロンプトまたは内部の重みに基づいているかどうかを知ることに依存する。
モデル隠れ表現に基づいて訓練された単純な線形分類器であるプローブは、帰納的帰属を確実に予測できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:21:12Z) - Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding [40.78154629252038]
曖昧なクレームにバイナリラベルを強制すると、評価の信頼性が低下する。
請求項のニュアンス評価を提供する方法として,LCM生成した要約の編集を紹介する。
我々は,ARMが主張の忠実性に関するアノテータ合意において,絶対的な21%の改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-04-01T19:08:24Z) - Improving Bot Response Contradiction Detection via Utterance Rewriting [45.55560596440624]
本研究の目的は,すべてのボット発話を書き換えて,先行詞やエリプシを復元することで,矛盾検出を改善することである。
我々はこのモデルがボット発話をより完璧にするために十分な書き直しを生成できることを実証的に実証した。
書き直された発話を使用することで、AUPRとジョイント精度スコア(証拠とともに矛盾を検出する)がそれぞれ6.5%と4.5%向上するなど、矛盾検出性能が大幅に向上する。
論文 参考訳(メタデータ) (2022-07-25T00:54:30Z) - Claim Check-Worthiness Detection as Positive Unlabelled Learning [53.24606510691877]
クレームチェックの信頼性検出はファクトチェックシステムにおいて重要な要素である。
これらの課題の根底にあるクレームチェックの信頼性検出における中心的な課題を照明する。
我々の最良の手法は、正の非競合学習の変種を用いて、これを自動的に修正する統一的なアプローチである。
論文 参考訳(メタデータ) (2020-03-05T16:06:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。