論文の概要: Can Factual Opinions Be Edited (Manipulated) in Large Language Models?
- arxiv url: http://arxiv.org/abs/2606.03096v1
- Date: Tue, 02 Jun 2026 03:35:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:04.732082
- Title: Can Factual Opinions Be Edited (Manipulated) in Large Language Models?
- Title(参考訳): 大規模言語モデルで仮想オピニオンを編集(操作)することは可能か?
- Abstract要約: 大規模言語モデル(LLM)は、様々なドメインに統合され、知識編集技術が重要かつ潜在的に危険である可能性がある。
現在の編集方法は主として原子的な事実をターゲットとしており、社会問題に関する公的な人物のスタンスを文書化するなど、事実的意見を操作することに関連する重大なリスクを見落としている。
本稿では,261の公開数字,19の課題カテゴリ,2,178の完全な意見記録を含むFactual Opinion Editing with Evidenceベンチマークを紹介する。
本評価は,現在行われている編集技術が現実的な意見と大きく対立していることを示し,しばしば表面的変化のみを達成する一方で,編集された意見とモデルが生み出す支持的証拠との整合性を維持することに失敗することを示した。
- 参考スコア(独自算出の注目度): 49.225790715935204
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly integrated into various domains, making knowledge editing techniques crucial yet potentially hazardous. Current editing methods primarily target atomic facts, overlooking the significant risks associated with manipulating factual opinions, e.g., documented stances of public figures on societal issues. Such manipulation could reshape public images, influence elections, and alter societal views. To systematically assess this threat, we introduce the Factual Opinion Editing with Evidence (FOE) benchmark, which encompasses 261 public figures, 19 issue categories, and 2,178 complete opinion records. Our evaluations demonstrate that current editing techniques struggle significantly with factual opinions, often achieving only superficial changes while failing to preserve consistency between the edited opinion and the supporting evidence generated by the model. To address this limitation, we further propose a simple yet effective Self-Generated Evidence-Aligned method that achieves opinion-evidence alignment without relying on explicit instructions. Together, our benchmark and method provide a foundation for understanding the emerging security implications of factual opinion editing in LLMs.
- Abstract(参考訳): 大規模言語モデル(LLM)は、様々なドメインに統合され、知識編集技術が重要かつ潜在的に危険である可能性がある。
現在の編集方法は、主に原子的な事実をターゲットとしており、事実的意見を操作することに関連する重大なリスクを見落としている。
このような操作は、公的なイメージを再形成し、選挙に影響を及ぼし、社会的見解を変える可能性がある。
この脅威を体系的に評価するために、261の公開数字、19のイシューカテゴリ、2,178の完全な世論記録を含むFactual Opinion Editing with Evidence (FOE)ベンチマークを導入する。
本評価は,現在行われている編集技術が現実的な意見と大きく対立していることを示し,しばしば表面的変化のみを達成する一方で,編集された意見とモデルが生み出す支持的証拠との整合性を維持することに失敗することを示した。
この制限に対処するために,明示的な指示に頼らずに意見のアライメントを実現する,シンプルで効果的な自己生成エビデンスアライメント手法を提案する。
このベンチマークと手法は,LLMにおける現実的な意見編集のセキュリティへの影響を理解するための基盤となる。
関連論文リスト
- EtCon: Edit-then-Consolidate for Reliable Knowledge Editing [85.20993502078899]
本稿では,理論的知識編集手法と実世界の応用性とのギャップを埋めることを目的とした知識編集パラダイムであるEdit-then-Consolidateを提案する。
本フレームワークは,実環境評価における編集信頼性と一般化を継続的に改善するとともに,局所性と事前学習能力の保存を向上する。
論文 参考訳(メタデータ) (2025-12-04T12:43:50Z) - Is Model Editing Built on Sand? Revealing Its Illusory Success and Fragile Foundation [50.40861036534546]
大きな言語モデル(LLM)は、必然的に時代遅れまたは誤った知識をエンコードする。そのような知識の更新、削除、そして忘れは、アライメント、安全性、その他の問題にとって重要である。
この問題を解決するために、モデル編集は有望なパラダイムとして現れ、特定の事実が更新され、他の知識を保持しながら、パラメータの小さなサブセットを正確に編集する。
前回の論文で大きな成功を収めたにもかかわらず、編集の信頼性は脆弱な基盤にかかっていることが判明した。
我々の経験的証拠は、編集が完全な意味論よりもショートカットに基づく可能性が高いことを示し、さらなる進歩の前にモデル編集の基盤を急激な再考を求める。
論文 参考訳(メタデータ) (2025-10-01T07:59:23Z) - How Robust is Model Editing after Fine-Tuning? An Empirical Study on Text-to-Image Diffusion Models [7.342540592387184]
T2I拡散モデルにおけるモデル編集と微調整の相互作用について検討する。
編集が微調整によって継続できないのは、微調整が具体的あるいは無関係である場合であってもである。
これらの発見は、デプロイされたAIシステムの信頼性の高い長期的な制御とアライメントを保証するための、より堅牢な技術の必要性を強調している。
論文 参考訳(メタデータ) (2025-06-23T09:10:29Z) - ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs [3.9295613363026174]
モデル編集における間接的知識漏洩とリップル効果を定量化するフレームワークであるThinkEvalを提案する。
ThinkEvalは、編集前後の事実の因果構造を分析するために、専門知識グラフを構築し、採用する。
我々はAlphaEdit, RECT, ROME, MEMIT, PRUNEの5つの編集技術を評価する。
論文 参考訳(メタデータ) (2025-06-02T07:24:12Z) - The Mirage of Model Editing: Revisiting Evaluation in the Wild [70.17413507444704]
我々は、広く使われている質問応答(QA)データセットに対応する新しいベンチマークであるQAEditと、タスクに依存しない評価フレームワークであるWILDを紹介する。
単一の編集実験により、現在行われている編集手法は、以前報告したよりもかなり悪い結果が得られた。
論文 参考訳(メタデータ) (2025-02-16T15:57:55Z) - Related Knowledge Perturbation Matters: Rethinking Multiple Pieces of Knowledge Editing in Same-Subject [49.559994791305535]
現在最先端の編集手法は、複数の関連知識を同じ主題に編集する作業で苦労している。
本稿では,textS2textRKE$(Same-Subject Related Knowledge Editing)ベンチマークを紹介する。
実験の結果,ROMやMEMITのような主流の位置情報編集手法だけが「関連する知識の摂動」を示すことがわかった。
論文 参考訳(メタデータ) (2025-02-08T04:47:17Z) - Uncovering Overfitting in Large Language Model Editing [35.55260822503773]
編集対象に不均等に高い確率を割り当てる編集オーバーフィット現象を同定し,検討する。
本稿では,多段階推論制約モジュールを導入し,新しい知識をリコールする際のモデルをガイドするLearning the Inference (LTI)を提案する。
論文 参考訳(メタデータ) (2024-10-10T11:09:00Z) - Potential and Challenges of Model Editing for Social Debiasing [20.186721346693577]
巨大なコーパスで訓練された大言語モデル(LLM)は、避けられないステレオタイプバイアスに悩まされる。
これらのバイアスを微調整で緩和することは、費用もデータもかかる。
ポストホックな方法でLLMを変更することに焦点を当てたモデル編集手法は、デバイアスに対処する大きな可能性を秘めている。
論文 参考訳(メタデータ) (2024-02-21T01:35:26Z) - Propagation and Pitfalls: Reasoning-based Assessment of Knowledge
Editing through Counterfactual Tasks [36.292901021210575]
ReCoE(Reasoning-based Counterfactual Editing dataset)という新しい推論ベースのベンチマークを導入する。
我々は既存の知識編集技術を徹底的に分析し、入力強化、微調整、位置と編集を行う。
全てのモデル編集手法は、特に特定の推論スキームにおいて、このデータセットで顕著に低い性能を示す。
論文 参考訳(メタデータ) (2024-01-31T04:12:59Z) - Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue [122.20016030723043]
大規模言語モデル(LLM)におけるモデル編集の副作用を評価する。
分析の結果,モデルの重みを過度に修正したモデル編集によって副作用が生じることが明らかとなった。
これを軽減するために、修正の重み付けを正規化するためにRECTというメソッドが提案されている。
論文 参考訳(メタデータ) (2024-01-09T18:03:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。