論文の概要: Scaling Trends for Lie Detector Oversight in Preference Learning
- arxiv url: http://arxiv.org/abs/2607.01567v1
- Date: Thu, 02 Jul 2026 00:53:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.624624
- Title: Scaling Trends for Lie Detector Oversight in Preference Learning
- Title(参考訳): 優先度学習におけるリー検出器監視のスケーリング動向
- Abstract要約: 本稿では,SOLiDを大規模モデルに拡張し,より多彩でリアルな嗜好学習環境で評価する。
検出不能な偽造は1B-パラメータモデルでは34%から405B-パラメータモデルでは14%に減少し、検出正の99%となった。
しかし、SOLiDは検出器トレーニングと嗜好訓練データの間の分布シフトに敏感であり、検出器の偽陽性率を非現実的なレベルに導くことができる。
- 参考スコア(独自算出の注目度): 10.250952047645457
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deceptive behavior in LLMs is costly to monitor and prevent, motivating approaches such as Scalable Oversight via Lie Detectors (SOLiD) (Cundy & Gleave, 2025), which uses lie detectors to identify responses for review by high-cost labelers. In this paper, we scale SOLiD to larger models and evaluate it in more diverse and realistic preference-learning settings. We find favorable scaling: undetected deception drops from 34% for 1B-parameter models to 14% for 405B-parameter models at a detector true positive rate of 99%, and expensive human labelers can be removed entirely from the fine-tuning phase without a statistically significant increase in deception. However, SOLiD is sensitive to distribution shift between detector training and preference-training data, which can drive detector false positive rates to impractical levels.
- Abstract(参考訳): LLMの認知行動は、Lie Detectors (SOLiD) (Cundy & Gleave, 2025) によるスケーラビリティ監視 (Scalable Oversight) のような、高価なラベル作成者によるレビューの応答を特定するために嘘検出装置を使用する手法を監視・防止するために費用がかかる。
本稿では,SOLiDを大規模モデルに拡張し,より多彩でリアルな嗜好学習環境で評価する。
その結果,1Bパラメータモデルが34%から14%に減少し,405Bパラメータモデルが14%に低下した。
しかし、SOLiDは検出器トレーニングと嗜好訓練データの間の分布シフトに敏感であり、検出器の偽陽性率を非現実的なレベルに導くことができる。
関連論文リスト
- "Did you lie?" Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms [2.3883252067956118]
既存の訓練されたモデル生物は、しばしばテストベッドに失敗する。
隠された信念が思考の連鎖で検証される13の推論モデル生物でこの問題に対処する。
2Bから1Tパラメータにまたがる31のオープンウェイトモデルに対して、すべての4つの検出器はモデル能力で正のスケーリングを示す。
論文 参考訳(メタデータ) (2026-06-10T19:21:12Z) - Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models [53.15468578562038]
マルチモーダル大言語モデル(MLLM)のための不確実性を考慮した探索的直接参照最適化(UE-DPO)手法を提案する。
まず、与えられた画像にトークン予測を根拠にしなかったモデルの不確かさを定量化する。
次に、好ましいサンプルにおいて、視覚的に不足したトークンに対する学習のプレッシャーを高め、非推奨サンプルにおける有益な知識の過度な報酬化を緩和する。
論文 参考訳(メタデータ) (2026-05-06T13:08:12Z) - Preference Learning with Lie Detectors can Induce Honesty or Evasion [6.488157280516656]
嘘検出器は誤認行動を正確に分類できるが、訓練パイプラインでは一般的には使用されない。
学習方針が真に正直なのか、それとも偽りの検知器を騙すことを学ぶのかを検証する。
オフ・ポリシー・アルゴリズム(DPO)は、現実的なTPRに対して25%未満の偽造率をもたらす。
論文 参考訳(メタデータ) (2025-05-20T00:31:53Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - Does DetectGPT Fully Utilize Perturbation? Bridging Selective Perturbation to Fine-tuned Contrastive Learning Detector would be Better [21.901523394933076]
選択的摂動の対照的な学習により,新しい微調整検出器Pecolaを提案する。
実験の結果、ペコラは4つの公開データセットで平均1.20%の精度で最先端のSOTA(State-of-the-art)を上回っている。
論文 参考訳(メタデータ) (2024-02-01T01:23:07Z) - Small Effect Sizes in Malware Detection? Make Harder Train/Test Splits! [51.668411293817464]
業界関係者は、モデルが数億台のマシンにデプロイされているため、マルウェア検出精度の小さな改善に気を配っている。
学術研究はしばしば1万のサンプルの順序で公開データセットに制限される。
利用可能なサンプルのプールから難易度ベンチマークを生成するためのアプローチを考案する。
論文 参考訳(メタデータ) (2023-12-25T21:25:55Z) - Test-Time Adaptation Induces Stronger Accuracy and Agreement-on-the-Line [65.14099135546594]
最近のテスト時間適応 (TTA) 法は, モデルに非常に弱い相関関係を示すシフトであっても, ACL と AGL の傾向を大幅に強化する。
この結果から,TTAとAGLに基づく推定手法を組み合わせることで,より広い分布シフトの集合に対する高精度なモデルOOD性能を推定できることが示唆された。
論文 参考訳(メタデータ) (2023-10-07T23:21:25Z) - Towards Reducing Labeling Cost in Deep Object Detection [61.010693873330446]
本稿では,検知器の不確実性と頑健性の両方を考慮した,アクティブラーニングのための統一的なフレームワークを提案する。
提案手法は, 確率分布のドリフトを抑えながら, 極めて確実な予測を擬似ラベル化することができる。
論文 参考訳(メタデータ) (2021-06-22T16:53:09Z) - Robust and Accurate Object Detection via Adversarial Learning [111.36192453882195]
この研究は、逆の例を探索することで、物体検出器の微調整段階を補強する。
提案手法は,オブジェクト検出ベンチマークにおいて,最先端のEfficientDetsの性能を+1.1mAP向上させる。
論文 参考訳(メタデータ) (2021-03-23T19:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。