論文の概要: Social Pressure Breaks Majority Voting in LLM Safety Panels
- arxiv url: http://arxiv.org/abs/2608.04415v1
- Date: Wed, 05 Aug 2026 03:51:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.704579
- Title: Social Pressure Breaks Majority Voting in LLM Safety Panels
- Title(参考訳): LLMの安全パネルで社会圧力が多数派を破る
- Authors: Yibo Hu, Jiaming Qu,
- Abstract要約: 一般的なアプローチは、個々のミスを修正するためにモデルのパネルから判断を組み合わせることである。
我々はこのリスクを制御された2ラウンドの実験で研究する。
誤りラベルのピアメッセージは、平均的なレビューアラームレートを上昇させる。
- 参考スコア(独自算出の注目度): 1.6734502292933282
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to detect unsafe content. A common approach is to combine judgments from a panel of models to correct individual mistakes, but this benefit may disappear when every model sees the same misleading context before voting. We study this risk in a controlled two-round experiment. Each model first judges an item alone, then judges it again after six simulated peers either assert the wrong label or abstain. We combine the final judgments by majority vote. Across six open-weight LLMs and six datasets, we find that the wrong-label peer message raises the average reviewer false-alarm rate from 56.5% under silent peers to 87.5%, and majority voting raises the panel false-alarm rate to 100%. Without an asserted label, the same panel outperforms its average member. The effect is strongly asymmetric: reviewers follow pushes toward "unsafe" far more than pushes toward "safe" (about 75% versus 17%), so the panel's false-alarm rate rises sharply while its harmful-miss rate changes little. The proprietary-model probe shows substantial variation across models. These results identify susceptibility to shared social cues as a failure mode of safety panels and provide a simple pre-deployment diagnostic.
- Abstract(参考訳): 大規模言語モデル(LLM)は、安全でないコンテンツを検出するためにますます使われる。
一般的なアプローチは、個々のミスを修正するためにモデルのパネルから判断を組み合わせることだが、すべてのモデルが投票前に同じ誤解を招く状況を見ると、この利点は消える可能性がある。
我々はこのリスクを制御された2ラウンドの実験で研究する。
それぞれのモデルはまずアイテムのみを判断し、6人のシミュレーションされたピアが間違ったラベルを主張した後に再度判断する。
最終判断を多数決でまとめる。
6つのオープンウェイトLDMと6つのデータセットで、間違ったラベルのピアメッセージは平均的なレビューアラームレートを56.5%から87.5%に引き上げ、多数決はパネルの偽アラームレートを100%に上げる。
アサートされたラベルがなければ、同じパネルが平均的なメンバーを上回っます。
この効果は強い非対称であり、審査員は「安全」よりもはるかに「安全」を追求している(約75%対17%)。
プロプライエタリなモデルプローブは、モデル間でかなりのばらつきを示す。
これらの結果から,共有型ソーシャルキューへの感受性は,安全パネルの障害モードとして認識され,簡単な事前デプロイ診断が提供される。
関連論文リスト
- QuantiBias: Benchmarking Quantization-Induced Bias in LLMs [8.970269049715933]
幅広い聴衆にリーチするほとんどの大きな言語モデルは定量化されています。
提案するベンチマークでは,複数言語ステレオタイププローブと,オープンエンド生成を分離する拒絶制御と多重選択制御を組み合わせている。
量子化されたビルドは、既にパスしているショートフォームのセーフガードだけでなく、オープンエンドのバイアスのために再評価されなければならない。
論文 参考訳(メタデータ) (2026-07-23T08:56:11Z) - How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring [7.789295015218435]
LLMジェイルブレイクとプロンプトインジェクションに関するほぼすべての論文は、アタック・サクセス・レート(ASR)を報告している。
我々は2人の裁判官の家族と人間の多数決を比較して攻撃する。
審査員の精度とリコールを報告し、審査員の精度を補正したASRを報告し、審査員の逆チェックを含めることを推奨する。
論文 参考訳(メタデータ) (2026-06-24T07:14:17Z) - AgentFairBench: Do LLM Agents Discriminate When They Act? [2.3004655342211078]
AgentFairBenchは、LLMエージェントの動作における人口格差に対する、安価で再現可能なマルチドメインベンチマークである。
これは、雇用、貸与、医療トリアージという、規制対象の3つの領域にまたがっている。
NumPyのみのハーネスは、反ファクト的なフリップ率、平均絶対スコア差(MASD)、アクションレートの相違、ツール起動の相違を計算する。
論文 参考訳(メタデータ) (2026-06-15T13:50:26Z) - Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models [60.9932576020062]
テスト時の計算戦略は、大規模言語モデルにおける推論を強化するための軽量なアプローチとして現れている。
本稿では,予測エントロピーに基づいて最も確実な予測を選択するエントロピーに基づくTTCを提案する。
ETTCは、軽度の仮定で多数決よりも優れており、投票と最高の個人モデルの両方を一貫して上回っていることを実証的に実証している。
論文 参考訳(メタデータ) (2026-05-29T01:06:38Z) - Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels [0.0]
LLM-as-a-judgeパネルは複数のモデルからの投票を集計する。
私たちは、その信頼性が独立投票の理想にどの程度劣るかを定量化します。
論文 参考訳(メタデータ) (2026-05-28T11:48:17Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning [48.14470449860784]
テスト時強化学習(TTRL)は、推論時に合成信号のみを使用してモデルを適応するためのラベルなしパラダイムを提供する。
簡単な直感に基づくフレームワークであるSelf-Harmonyを紹介します。
論文 参考訳(メタデータ) (2025-11-03T03:34:34Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。