論文の概要: Multi-Channel Mitigation of Source-Trust Shortcuts in Fact-Checking RL Agents
- arxiv url: http://arxiv.org/abs/2609.36611v1
- Date: Tue, 29 Sep 2026 03:26:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.151206
- Title: Multi-Channel Mitigation of Source-Trust Shortcuts in Fact-Checking RL Agents
- Title(参考訳): 接触型RL剤におけるソーストラストショートカットのマルチチャネル除去
- Abstract要約: TrustSwapは、ソースラベルをスワップ、ダウン、削除する反ファクトテストである。
3つの出力チャネル(判断、信頼、検索決定)を別々に計測する。
- 参考スコア(独自算出の注目度): 3.5200959974288373
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented fact-checkers often receive a reliability label, such as HIGH or LOW trust, for each evidence source. These labels should adjust the model's confidence and its decision to search for more evidence, while the verdict should follow the evidence content. We introduce TrustSwap, a counterfactual test that swaps, lowers, or removes source labels while keeping every evidence text fixed, and measures its three output channels (the verdict, the confidence, and the search decision) separately. Across untrained and RL-trained models at two scales, three datasets, and two prompts, confidence and search respond to the labels as intended in 49 of 50 comparisons, yet a label change alone alters 4-23% of confident verdicts for Qwen3 models and up to 50% for an existing RL-trained fact-checker. Standard GRPO fine-tuning amplifies this shortcut at 8B in all six settings. To reduce it, we propose trust-swap augmentation (TSA), which trains GRPO on each claim with both its original and its label-swapped evidence under the same gold verdict. At 4B, TSA lowers the verdict flip rate by 7-35% (relative) in four of six settings, keeps accuracy and the intended confidence and search responses, outperforms reward-based alternatives in the main setting, and carries over to an unseen label-removal perturbation. An added consistency reward helps on the trained-on swap but not on unseen perturbations. At 8B, TSA's effect is not detectable, which makes scale the main open question.
- Abstract(参考訳): 検索可能なファクトチェッカーは、証拠ソースごとに高信頼や低信頼などの信頼性ラベルを受け取ることが多い。
これらのラベルはモデルの信頼性を調整し、より多くの証拠を探すという決定を下し、評決は証拠の内容に従うべきである。
TrustSwapは、すべての証拠テキストを固定しながら、ソースラベルを交換、引き下げ、削除する反ファクトテストであり、その3つの出力チャネル(判断、信頼、検索決定)を別々に測定する。
トレーニングされていないモデルとトレーニングされていないモデル、2つのスケール、3つのデータセット、2つのプロンプト、信頼性と検索が50の比較の49で意図されているようにラベルに応答するが、ラベルの変更だけで、Qwen3モデルの信頼性判断の4~23%が変更され、既存のRLトレーニングされたファクトチェッカーでは最大50%が変更される。
標準GRPOファインチューニングは、このショートカットを6つの設定すべてで8Bで増幅する。
そこで我々は,TSA (Trust-swap augmentation) を提案し,各クレームのGRPOを,そのオリジナルおよびラベルスワップされた証拠の両方で同一の金判定の下で訓練する。
4Bでは、TSAは6つの設定のうち4つの設定のうち7~35%(相対)の判定フリップ率を下げ、正確さと意図された信頼と検索応答を維持し、報酬ベースの代替品をメイン設定で上回り、見当たらないラベル除去の摂動へと引き継ぐ。
トレーニングオンのスワップには一貫性の報酬が加えられるが、目に見えない摂動には役に立たない。
8Bでは、TSAの効果は検出できないため、スケールが主要な問題となる。
関連論文リスト
- SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task [15.259880314614117]
11のフロンティアとオープンなマルチモーダルモデルを1つの正直なサンプル・プロトコルでベンチマークする。
SciTrueは4つのエビデンスカテゴリ/サブタスクの組み合わせのうち3つに明確なマージンを付けている。
論文 参考訳(メタデータ) (2026-09-01T03:30:45Z) - TTPO: Test-Time Policy Optimization [53.81524570216593]
テストタイムポリシー最適化(TTPO)は、OPSDを介してロールアウトに同意し、Grouped RLと不一致なロールアウトを罰する非対称な目的である。
TTPOは5つの競合レベルのベンチマークでラベル管理されたOPSDと一致し、Qwen3-1.7Bは38.0%から45.2%まで上昇し、思考せずに+25.2%から+36.4%に上昇し、クロスタスクの一般化を示す。
論文 参考訳(メタデータ) (2026-08-27T17:58:10Z) - Tracing Provenance and Detecting Tampering with Complementary LLM Watermarks [68.64050157343334]
既存の透かしは編集の際は残されているが、このような堅牢性は、敵が帰属を維持しながら重要な内容を変更することを可能にする。
実証と改ざんの証拠を共同で提供する革新的な透かしを導入する。
信号は同じメカニズムを共有するが、独立キーと正規化テキスト上の異なるシードウィンドウを使用するため、一方は編集に耐性があり、もう一方は読み取り可能な変更に敏感である。
論文 参考訳(メタデータ) (2026-08-13T01:55:16Z) - RECAP: Relation Evidence Calibration for Detecting Spatial Relation Hallucinations in Vision-Language Models [18.4543393295727]
視覚言語モデルは、画像が不整合関係をサポートする場合でも、空間関係の疑問に自信を持って答えることができる。
我々は,その視覚的支援を監査することで,すでに生成したイエス/ノー回答を受け入れ,拒否する関係的選択予測を定式化する。
ReCAPは、クレームのイメージ条件付き可能性、セマンティックな矛盾、オプションの片側サポートを比較し、これらの証人を回答条件付き拒絶リスクに変換する。
論文 参考訳(メタデータ) (2026-08-04T14:03:52Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - TRACE-CTI: Auditable Post-Extraction Governance of TTP Claims with Knowledge Graphs [4.960649631468518]
TRACE-CTIは、抽出後のクレーム管理フレームワークである。
実行レベルの予測を構成レベルのGraphAssertionに集約する。
これはConsensusAssertionsとしてセットアップdedlicated corroborationを具体化する。
論文 参考訳(メタデータ) (2026-07-27T15:33:18Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。