論文の概要: Mirror, Mirror on the Wall: Prompt Echoing in Small Instruct Language Models
- arxiv url: http://arxiv.org/abs/2609.15045v1
- Date: Mon, 14 Sep 2026 05:06:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.080602
- Title: Mirror, Mirror on the Wall: Prompt Echoing in Small Instruct Language Models
- Title(参考訳): 壁面の鏡, 鏡:小さな命令型言語モデルにおけるプロンプトエコー
- Abstract要約: 我々は、エコープロンプトがトレーニングデータセットと部分的に重複する可能性が高いことを示す。
この現象は、主にモデルの誘導ヘッドによって引き起こされる。
- 参考スコア(独自算出の注目度): 1.612940269892569
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Prompt echoing is a recognized failure mode of instruct language models, in which a model instead of generating a response, mirrors the provided prompt, even though it did not receive a specific instruction to do so. Is this phenomenon a sign of the model leaking the content of its training dataset, or is it rather caused by a misaligned behavior of the internal induction/copying mechanisms? We investigate prompt echoing small language models from different families (Gemma, Llama, Qwen, SmolLM and OLMo) and show that echoing prompts are likely to have partial overlap with the training dataset but the phenomenon is primarily driven by the model's induction heads.
- Abstract(参考訳): プロンプトエコー(英: Prompt echoing)とは、特定の命令を受け取っていなくても、応答を生成する代わりに与えられたプロンプトを反映する言語モデルの障害モードである。
この現象は、トレーニングデータセットの内容が漏洩するモデルの兆候か、それとも、内部誘導/コピー機構の誤った振る舞いによって引き起こされるのか?
我々は,異なる家族(Gemma, Llama, Qwen, SmolLM, OLMo)から発せられる小言語モデルに対して,学習データセットと部分的に重複する傾向にあるが,その現象は主にモデルの誘導ヘッドによって引き起こされることを示す。
関連論文リスト
- Why Instruction-Based Unlearning Fails in Diffusion Models? [48.60813003005658]
拡散モデルは、自然言語の未学習命令のみによってガイドされる場合、対象概念を抑えることができないことを示す。
結果は、効果的な非学習には推論時言語制御以上の介入が必要であることを示唆している。
論文 参考訳(メタデータ) (2026-04-02T01:08:01Z) - Mechanisms of Prompt-Induced Hallucination in Vision-Language Models [58.991412160253276]
制御されたオブジェクトカウント設定において、プロンプトが画像中のオブジェクト数をオーバーステートする障害モードについて検討する。
刺激誘発幻覚 (PIH) を, 追加訓練を伴わずに40%以上減少させる小さなアテンションヘッドのセットを同定した。
本研究は, 刺激による幻覚を誘発する内的メカニズムについての知見を提示し, モデル特異的な行動の実施方法の違いを明らかにした。
論文 参考訳(メタデータ) (2026-01-08T18:23:03Z) - Emergence of Linear Truth Encodings in Language Models [64.86571541830598]
大規模言語モデルは偽文と真を区別する線形部分空間を示すが、それらの出現のメカニズムは不明確である。
このような真理部分空間をエンドツーエンドに再現する,透明な一層トランスフォーマー玩具モデルを導入する。
本研究では,真理エンコーディングが実現可能な単純な設定について検討し,将来のトークンにおけるLM損失を減らすために,この区別を学習するようモデルに促す。
論文 参考訳(メタデータ) (2025-10-17T16:30:07Z) - Empirical Evidence for Alignment Faking in a Small LLM and Prompt-Based Mitigation Techniques [0.0]
そこで本研究では,LLaMA 3 8Bと呼ばれる小型の命令調整モデルがアライメント・フェイキングを示すことができることを示す。
本研究は,非オントロジー的モラルフレーミングやスクラッチパッド推論など,即時のみの介入により,モデル内部を変更することなく,この動作を著しく減少させることを示す。
本研究は,言語モデルにおける騙しの理解を深め,モデルのサイズや配置設定のアライメント評価の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-17T10:59:51Z) - Predicting the Performance of Black-box LLMs through Self-Queries [60.87193950962585]
大規模言語モデル(LLM)は、AIシステムにおいてますます頼りになってきている。
本稿では、フォローアッププロンプトを使用し、異なる応答の確率を表現として捉え、ブラックボックス方式でLCMの特徴を抽出する。
これらの低次元表現上で線形モデルをトレーニングすると、インスタンスレベルでのモデル性能の信頼性を予測できることを示す。
論文 参考訳(メタデータ) (2025-01-02T22:26:54Z) - Does Liking Yellow Imply Driving a School Bus? Semantic Leakage in Language Models [113.58052868898173]
我々は、モデルが予期しない方法でプロンプトから生成元に無関係な情報を漏らす現象を識別し、特徴付けする。
本研究では,人間と自動の両方でセマンティックリークを検出するための評価設定を提案し,その振る舞いを診断するための多様なテストスイートをキュレートし,13のフラッグシップモデルにおいて重要なセマンティックリークを測定する。
論文 参考訳(メタデータ) (2024-08-12T22:30:55Z) - Overthinking the Truth: Understanding how Language Models Process False
Demonstrations [32.29658741345911]
モデルの内部表現のレンズを通して有害な模倣を研究する。
我々は「過剰思考」と「偽誘導頭部」の2つの関連する現象を同定する。
論文 参考訳(メタデータ) (2023-07-18T17:56:50Z) - Can discrete information extraction prompts generalize across language
models? [36.85568212975316]
自動誘導型プロンプトをアウト・オブ・ザ・ボックス(out-of-the-box)として使用して,他の言語モデルに対して同じ情報を求めることができるかを検討する。
学習時に言語モデルを混合することでプロンプトを誘導する手法を導入し、モデル間でよく一般化するプロンプトを導出する。
論文 参考訳(メタデータ) (2023-02-20T09:56:51Z) - Masked Language Modeling and the Distributional Hypothesis: Order Word
Matters Pre-training for Little [74.49773960145681]
マスク言語モデル(MLM)トレーニングの印象的なパフォーマンスの可能な説明は、そのようなモデルがNLPパイプラインで広く普及している構文構造を表現することを学びました。
本稿では,先行訓練がダウンストリームタスクでほぼ完全に成功する理由として,高次単語共起統計をモデル化できることを挙げる。
以上の結果から,純粋分布情報は,事前学習の成功を主に説明し,深い言語知識を必要とする難易度評価データセットのキュレーションの重要性を強調する。
論文 参考訳(メタデータ) (2021-04-14T06:30:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。