論文の概要: Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
- arxiv url: http://arxiv.org/abs/2607.22657v1
- Date: Sat, 27 Jun 2026 15:20:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.011426
- Title: Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
- Title(参考訳): 抑うつと崩壊の間--LENSを用いた物語的未学習の評価
- Abstract要約: 大規模な言語モデルは、偽情報に整合した物語のフレームをもっともらしい説明として再現する。
文脈化に基づく評価プロトコルであるLENS(Level-based Evaluation of Narrative Suppression)を導入する。
LENSテストは、直接的、属性的、コントラスト的、抽象的な抵抗レベルにわたる物語の再現をターゲットにしている。
- 参考スコア(独自算出の注目度): 2.214676218600198
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) can reproduce disinformation-aligned narrative frames as plausible explanations, raising the question of whether existing machine-unlearning algorithms can suppress this behavior. We introduce Level-based Evaluation of Narrative Suppression (LENS), a contextualization based evaluation protocol for testing target narrative reproduction across direct, attributed, contrastive, and abstract resistance levels. We evaluate two source-grounded narratives: one framing Russia's war against Ukraine as forced by NATO expansion, and one framing the United States as exploiting or abandoning Taiwan. The experiments cover four near-12B multilingual instruction models: Lapa LLM, Gemma-12B, Qwen-14B, and TAIDE-Gemma. We introduce the Suppression-Collapse Efficiency (SCE) score as a checkpoint selection summary that rewards target-narrative suppression while penalizing degraded outputs. Our results shows that selected checkpoints can reduce narrative reproduction and suppression may transfer beyond direct forget prompts. We also report entity recovery as a separate side effect: abstract A/B/C prompts can cause models to recover the real-world actors associated with the target frame after unlearning. These findings demonstrate that LENS is a successful diagnostic protocol for both reporting and guiding the further study of the deeper structure of narrative unlearning.
- Abstract(参考訳): 大規模言語モデル(LLM)は、偽情報対応の物語フレームを妥当な説明として再現することができ、既存の機械学習アルゴリズムがこの振る舞いを抑えることができるかどうかという疑問を提起する。
本稿では, 直接的, 属性的, コントラスト的, 抽象的抵抗レベルにまたがって, 対象の物語再現をテストするための文脈化に基づく評価プロトコルであるLENS(Level-based Evaluation of Narrative Suppression)を紹介する。
ロシアによるウクライナとの戦争はNATOの拡大によって強制され、アメリカは台湾を搾取または放棄されていると評価している。
実験では、Lapa LLM、Gemma-12B、Qwen-14B、TAIDE-Gemmaの4つの多言語命令モデルがカバーされた。
劣化した出力をペナルティ化しながら目標ナララティブ抑圧を報奨するチェックポイント選択の要約として,抑制・崩壊効率(SCE)スコアを導入した。
以上の結果から,選択したチェックポイントが物語再生を減らし,抑制が直接忘れるプロンプトを超えて伝達する可能性が示唆された。
抽象的なA/B/Cプロンプトは、学習後にターゲットフレームに関連する現実のアクターを復元する。
これらの結果から,LENSは物語学習の深層構造を報告し,より深く研究するための診断プロトコルとして成功していることが明らかとなった。
関連論文リスト
- Zero-shot narrative detection in social messaging [0.688204255655161]
本研究では,大規模言語モデル(LLM)が社会的メッセージ中に隠された物語を識別・分類するゼロショット能力について検討した。
我々の研究仮説は、LLMの広い文脈知識により、より深く実践的なレベルでメッセージを解釈できるというものである。
DipromatsとSemEvalデータセットの実験では、人間が記述した記述を持つモデルを提供することで、パフォーマンスが大幅に向上している。
論文 参考訳(メタデータ) (2026-09-15T15:20:49Z) - STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning [80.78140312980484]
我々はSTRIDEと呼ばれる言語駆動の段階的軌道リダイレクトを提案する。
我々は、結果に基づく報酬のみを使用して生成器と生成検証器を共同で訓練し、外部アノテーションを除去する。
様々な推論ベンチマークの実験では、STRIDEが最先端のベースラインを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-05-13T11:04:31Z) - A Survey of On-Policy Distillation for Large Language Models [19.95776080082138]
この調査は、大規模言語モデル(LLM)のオン・ポリシィ蒸留に関する最初の包括的概要を提供する。
オンラインのサンプルに対して$f$-divergenceフレームワークを導入し,emphfeedbackシグナル(ログベース,結果ベース,自己プレイ),emphteacherアクセス(ホワイトボックス,ブラックボックス,教師フリー),emphloss最小化(トケンレベル,シーケンスレベル,ハイブリッド)の3つの次元に沿ってランドスケープを整理する。
論文 参考訳(メタデータ) (2026-04-01T08:32:34Z) - Re-FRAME the Meeting Summarization SCOPE: Fact-Based Summarization and Personalization via Questions [9.381476258394175]
本稿では,要約をセマンティックエンリッチメントタスクとして再構成するモジュールパイプラインFRAMEを紹介する。
FRAMEは健全な事実を抽出し、それらを主題的に整理し、それらを抽象的な要約にまとめる。
要約をパーソナライズするために、コンテンツ選択の前に9つの質問に答えることにより、推論トレースをモデルに構築する、推論アウトルードプロトコルであるSCOPEを導入する。
論文 参考訳(メタデータ) (2025-09-19T11:58:17Z) - Cognitive Surgery: The Awakening of Implicit Territorial Awareness in LLMs [11.274791012904263]
我々は,大規模言語モデル (LLM) が,個人表現パラダイム (IPP) に基づく自己生成テキストと他の生成テキストとの区別に苦慮していることを示す。
次に、この失敗の原因を調査し、Implicit Territorial Awareness (ITA) という現象とみなす。
本研究では, LLM の ITA を実現するために, 表現抽出, 領域構築, 著者識別, 認知編集の4つの主要モジュールからなる新しいフレームワークである認知手術(CoSur)を提案する。
論文 参考訳(メタデータ) (2025-08-20T04:08:18Z) - Stealthy LLM-Driven Data Poisoning Attacks Against Embedding-Based Retrieval-Augmented Recommender Systems [16.79952669254101]
検索強化レコメンデータシステム(RAG)におけるプロバイダ側データ中毒について検討する。
アイテム記述内でわずかなトークンだけを変更することで、攻撃者はターゲットのアイテムを著しくプロモートまたはデモすることができる。
MovieLensの実験では、2つの大きな言語モデル(LLM)検索モジュールを使用して、微妙な攻撃でも最終的なランク付けとアイテムの露出が変化し、単純な検出が発覚した。
論文 参考訳(メタデータ) (2025-05-08T12:53:42Z) - Causal Micro-Narratives [62.47217054314046]
テキストから因果マイクロナラティブを分類する新しい手法を提案する。
これらの物語は、対象対象の因果関係と/または効果の文レベルの説明である。
論文 参考訳(メタデータ) (2024-10-07T17:55:10Z) - On the Noise Robustness of In-Context Learning for Text Generation [41.59602454113563]
本研究では、テキスト生成タスクにおいて、ノイズの多いアノテーションがテキスト内学習の性能を著しく損なうことを示す。
この問題を回避するために,LPR(Local Perplexity Ranking)と呼ばれるシンプルで効果的なアプローチを提案する。
LPRは「騒々しい」候補者を、より清潔である可能性が高い隣人に置き換える。
論文 参考訳(メタデータ) (2024-05-27T15:22:58Z) - AMRFact: Enhancing Summarization Factuality Evaluation with AMR-Driven Negative Samples Generation [57.8363998797433]
抽象的意味表現(AMR)を用いた摂動要約を生成するフレームワークであるAMRFactを提案する。
提案手法は,AMRグラフに一貫した要約を解析し,制御された事実不整合を注入して負の例を生成し,一貫性のない事実不整合要約を高い誤差型カバレッジで生成する。
論文 参考訳(メタデータ) (2023-11-16T02:56:29Z) - A New Benchmark and Reverse Validation Method for Passage-level
Hallucination Detection [63.56136319976554]
大きな言語モデル(LLM)は幻覚を発生させ、ミッションクリティカルなタスクにデプロイすると大きなダメージを与える可能性がある。
本稿では,逆検証に基づく自己チェック手法を提案し,ゼロリソース方式で事実誤りを自動的に検出する。
提案手法と既存のゼロリソース検出手法を2つのデータセット上で実証的に評価した。
論文 参考訳(メタデータ) (2023-10-10T10:14:59Z) - TAPE: Assessing Few-shot Russian Language Understanding [1.9859374437454114]
TAPE(Text Attack and Perturbation Evaluation)は、ロシアの6つのより複雑なNLUタスクを含む新しいベンチマークである。
自己回帰ベースラインテストの詳細な解析は、単純な綴りに基づく摂動が最もパフォーマンスに影響することを示している。
我々はTAPEを公開して、監督がほとんど、あるいは全くできない場合に、新しいタスクに一般化できる堅牢なLMの研究を促進する。
論文 参考訳(メタデータ) (2022-10-23T18:28:25Z) - Zero-Shot Temporal Action Detection via Vision-Language Prompting [134.26292288193298]
視覚言語プロンプト(STALE)を用いた新しいゼロショット時間行動検出モデルを提案する。
我々のモデルは最先端の代替品を著しく上回っている。
我々のモデルは、近年の強力な競合相手よりも監督的TADにおいて優れた結果をもたらす。
論文 参考訳(メタデータ) (2022-07-17T13:59:46Z) - Weakly-Supervised Video Object Grounding via Causal Intervention [82.68192973503119]
我々は、モデル学習中にのみビデオ文アノテーションが利用できる、弱教師付きビデオオブジェクトグラウンドディング(WSVOG)の課題をターゲットにしている。
文で記述されたオブジェクトをビデオの視覚領域にローカライズすることを目的としており、パターン分析や機械学習に必要な基本的な機能である。
論文 参考訳(メタデータ) (2021-12-01T13:13:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。