論文の概要: InfoOps Bench: A live information operations safety benchmark
- arxiv url: http://arxiv.org/abs/2607.28503v2
- Date: Mon, 03 Aug 2026 16:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.219263
- Title: InfoOps Bench: A live information operations safety benchmark
- Title(参考訳): InfoOps Bench: ライブ情報操作の安全性ベンチマーク
- Authors: Dorian Quelle, Lisa-Maria Neudert, Jonathan Bright, John Gallacher,
- Abstract要約: 我々は、州が支援する情報操作に対するフロンティア言語モデルの整合性を測定する、アクティブで常に更新されたAIベンチマークを示す。
われわれは、ロシア、中国、イランが支援する情報資産を追跡するライブ監視パイプラインから、2100件以上の情報操作を引き合いに出している。
情報操作に対する統合性は、少なくとも部分的には、良心的なクレームであってもコンテンツの作成を拒否することに関連している。
- 参考スコア(独自算出の注目度): 1.6286063564156006
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper we present an active, constantly updated AI benchmark which measures the integrity of frontier language models against being co-opted for state-backed information operations. We draw on over 2,100 information operations from a live monitoring pipeline which tracks Russian, Chinese and Iranian state-backed information assets. Alongside this paper, we release a companion website that tracks the most prominent claims spread by state-backed media outlets, updated weekly. The dynamic nature of the benchmark makes it resistant to saturation. In the benchmark, we test 17 models from 8 providers across four prompt framings. We find that most models can be co-opted for information operations. Integrity scores, defined as the percentage of refused requests, range from 8.8% to 94.5%, an 85.7-percentage-point spread not explained by model size. Model choice also changes the character of the resulting operation. Some models fabricate details and produce output more harmful than the source material, others defuse claims even while complying, and fact-checking rates vary from 2.9% to 72.9%. Integrity against information operations is at least partly related to refusal to produce content even for benign claims, illustrating the challenge of balancing model usability with safety. With one exception (Z ai's GLM 5.2), the Chinese-developed models sharply cut compliance on factually grounded but China-critical claims, dropping 48-70 percentage points relative to matched benign claims.
- Abstract(参考訳): 本稿では,フロンティア言語モデルの整合性を測定し,国家支援情報操作の協調運用を防止するための,能動的かつ常に更新されたAIベンチマークを提案する。
われわれは、ロシア、中国、イランが支援する情報資産を追跡するライブ監視パイプラインから、2100件以上の情報操作を引き合いに出している。
本稿では,国が支援するメディアが展開する最も顕著な主張を追跡し,毎週更新するWebサイトをリリースする。
ベンチマークの動的な性質は飽和に抵抗する。
ベンチマークでは、4つのプロンプトフレームにまたがる8つのプロバイダから17のモデルをテストした。
たいていのモデルは、情報操作のために組み合わせることができる。
拒否された要求の比率として定義される積分スコアは8.8%から94.5%であり、モデルサイズによって説明されない85.7ポイントのスプレッドである。
モデル選択は、結果の操作の性格も変更する。
細部を製造し、原材料よりも有害な出力を生産するモデルもあるが、それに従っても主張を否定するモデルもあり、事実確認率は2.9%から72.9%まで様々である。
情報操作に対する統合性は、少なくとも部分的には、良心的クレームであってもコンテンツ作成を拒むことと関係しており、モデルのユーザビリティと安全性のバランスをとるという課題を浮き彫りにしている。
例外の1つ(ZaiのGLM 5.2)で、中国が開発したモデルは、事実的根拠に基づくコンプライアンスを著しく削減したが、中国の批判的な主張は、一致した良心的主張に対して48-70ポイント下げた。
関連論文リスト
- SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments [0.48904891615709184]
SteelBenchは産業監視のための診断ベンチマークである。
作業者ごとの活動認識、安全ルール推論、アノテーション証明を共同で評価する。
1,345本の密接な注釈付きクリップがあり、149時間のプラントの映像からキュレーションされている。
論文 参考訳(メタデータ) (2026-07-06T16:11:45Z) - When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models [1.0671844383558033]
オープンソースモデルは、単純な否定の下で、時間の77%のアクションを推奨した。
金融シナリオは医療シナリオの2倍脆弱である。
現在のアライメント技術が達成するものと、安全なデプロイメントに必要なものとの間には、ギャップがある。
論文 参考訳(メタデータ) (2026-01-29T09:09:23Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions [6.19084217044276]
大規模言語モデル(LLM)における明示的バイアスと暗黙的バイアスの緩和は、自然言語処理の分野において重要な焦点となっている。
我々は,2700のユニークな文を含む450の攻撃的進行を含む,攻撃的進行に関する感性テストデータセットを紹介した。
以上の結果から,最も優れたモデルでさえバイアスを不整合に検出し,成功率は19.3%から69.8%であった。
論文 参考訳(メタデータ) (2024-09-20T18:34:38Z) - How to Train Your Fact Verifier: Knowledge Transfer with Multimodal Open Models [95.44559524735308]
大規模言語またはマルチモーダルモデルに基づく検証は、偽コンテンツや有害コンテンツの拡散を緩和するためのオンラインポリシングメカニズムをスケールアップするために提案されている。
我々は,知識伝達の初期研究を通じて,継続的な更新を行うことなく基礎モデルの性能向上の限界をテストする。
最近の2つのマルチモーダルなファクトチェックベンチマークであるMochegとFakedditの結果は、知識伝達戦略がファクドディットのパフォーマンスを最先端よりも1.7%向上し、Mochegのパフォーマンスを2.9%向上させることができることを示唆している。
論文 参考訳(メタデータ) (2024-06-29T08:39:07Z) - How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts [54.07541591018305]
提案するMAD-Benchは,既存のオブジェクト,オブジェクト数,空間関係などの5つのカテゴリに分割した1000の試験サンプルを含むベンチマークである。
我々は,GPT-4v,Reka,Gemini-Proから,LLaVA-NeXTやMiniCPM-Llama3といったオープンソースモデルに至るまで,一般的なMLLMを包括的に分析する。
GPT-4oはMAD-Bench上で82.82%の精度を達成するが、実験中の他のモデルの精度は9%から50%である。
論文 参考訳(メタデータ) (2024-02-20T18:31:27Z) - Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in
Self-Refined Open-Source Models [53.859446823312126]
SoTAは7Bから65Bまでのさまざまなサイズのオープンソースモデルを平均して、ベースラインのパフォーマンスから8.2%改善している。
厳密に言えば、Vicuna-7Bのような非常に小さなメモリフットプリントを持つモデルでさえ、全体的な11.74%の改善と、高い創造性、オープンエンドタスクの25.39%の改善を示している。
論文 参考訳(メタデータ) (2023-10-11T15:56:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。