論文の概要: Can LLMs Separate Pasted Artifacts from User Speech? Absorption at Unmarked Prompt Seams
- arxiv url: http://arxiv.org/abs/2610.04210v1
- Date: Sat, 03 Oct 2026 01:53:21 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:46:02.910811
- Title: Can LLMs Separate Pasted Artifacts from User Speech? Absorption at Unmarked Prompt Seams
- Title(参考訳): LLMはユーザ音声からペーストアーチファクトを分離できるか?
- Abstract要約: 大きな言語モデル(LLM)は、異なるソースからのテキストを組み合わせても、各ユーザメッセージをプレーンテキストとして受信する。
吸収について研究する: モデルが追従するユーザコメントをペーストしたテキストの一部として扱い、編集されたテキストに返却する現象。
- 参考スコア(独自算出の注目度): 2.58823060804068
- License:
- Abstract: Large language models (LLMs) receive each user message as plain text, even when it combines text from different sources. For example, a user may paste text into a prompt and keep typing a comment directly below it. We study absorption: a phenomenon where the model treats a trailing user comment as part of the pasted text, returning it inside the edited text. This happens even though the user did not intend the comment to become part of that text. Existing instruction-data separation benchmarks tell the model which text is instruction and which is data, then test whether it obeys that separation. They do not test harmless user speech following an unmarked paste. We introduce SEAM, a controlled benchmark of 300 editing examples. Each example is tested under six matched conditions that vary how the boundary between pasted text and later user speech is expressed. Across 20 models, absorption at a bare newline ranges from 7.7% to 66.7%. Adding a blank line does not significantly reduce absorption in any model, while boundary markers reduce it in 19 of 20 models. Comments that fit the pasted text, such as a code comment typed after code, are absorbed significantly more often in 17 of 20 models. Models often fail to separate pasted material from later user speech, and explicit boundaries reduce but do not remove this failure.
- Abstract(参考訳): 大きな言語モデル(LLM)は、異なるソースからのテキストを組み合わせても、各ユーザメッセージをプレーンテキストとして受信する。
例えば、ユーザーはテキストをプロンプトに貼り付け、コメントを直接入力し続けることができる。
吸収について研究する: モデルが追従するユーザコメントをペーストしたテキストの一部として扱い、編集されたテキストに返却する現象。
これは、ユーザーがコメントをそのテキストの一部にするつもりがなくても起こります。
既存の命令データ分離ベンチマークは、どのテキストが命令であり、どれがデータであるかをモデルに伝え、その分離に従うかどうかをテストする。
マークされていないペーストに従って無害なユーザースピーチをテストすることはない。
我々は300の編集例の制御されたベンチマークであるSEAMを紹介する。
それぞれの例は、6つの一致した条件の下でテストされ、ペーストされたテキストとその後のユーザー音声の境界がどのように表現されるかが異なる。
20モデル中、裸のニューラインでの吸収は7.7%から66.7%である。
空白線を追加することはどのモデルでも吸収を著しく減少させるものではないが、境界マーカーは20モデル中19モデルで吸収を減少させる。
コードに型付けされたコードコメントのようなペーストされたテキストに適合するコメントは、20モデル中17モデルでかなり頻繁に吸収される。
モデルは後続のユーザスピーチからペーストした素材を分離するのに失敗することが多く、明示的な境界は減少するが、この失敗を除去しない。
関連論文リスト
- ExaGPT: Example-Based Machine-Generated Text Detection for Human Interpretability [62.285407189502216]
LLM(Large Language Models)によって生成されたテキストの検出は、誤った判断によって致命的な誤りを引き起こす可能性がある。
本稿では,人間の意思決定プロセスに根ざした解釈可能な検出手法であるExaGPTを紹介する。
以上の結果から,ExaGPTは従来の強力な検出器よりも最大で40.9ポイントの精度を1%の偽陽性率で大きく上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-02-17T01:15:07Z) - Watermarking Language Models for Many Adaptive Users [47.90822587139056]
証明可能な保証付き言語モデルの透かし方式について検討する。
モデル生成テキストを個々のユーザに対してトレース可能なマルチユーザ透かしを導入する。
検出不能なChrist, Gunn, Zamir (2024) のゼロビットスキームが適応的に堅牢であることを証明する。
論文 参考訳(メタデータ) (2024-05-17T22:15:30Z) - Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training [55.321010757641524]
大きな言語モデル(LLM)のトレーニングに関する主要な関心事は、著作権のあるオンラインテキストを悪用するかどうかである。
本稿では,Web ユーザとコンテンツプラットフォームがtextbftextitunique 識別子を,信頼性と独立性のあるメンバシップ推論に活用することを提唱する,代替の textitinsert-and-detect 手法を提案する。
論文 参考訳(メタデータ) (2024-03-23T06:36:32Z) - HU at SemEval-2024 Task 8A: Can Contrastive Learning Learn Embeddings to Detect Machine-Generated Text? [0.0]
本稿では,SemEval-2024 Task 8, Multigenerator, Multi Domain, and Multilingual Black-Box Machine-Generated Text Detection'のために開発したシステムについて述べる。
重要な発見は、複数のモデルのアンサンブルがなくても、単一のベースモデルは、データ拡張と対照的な学習の助けを借りて、同等のパフォーマンスを持つことができるということです。
論文 参考訳(メタデータ) (2024-02-19T04:11:34Z) - Understanding writing style in social media with a supervised
contrastively pre-trained transformer [57.48690310135374]
オンラインソーシャルネットワークは、ヘイトスピーチから偽情報の拡散まで、有害な行動の場として機能している。
本稿では, 4.5 x 106テキストの公開資料から得られた大規模コーパスに基づいて学習したStyle Transformer for Authorship Representations (STAR)を紹介する。
512個のトークンからなる8つのドキュメントからなるサポートベースを使用して、著者を最大1616人の著者のセットから、少なくとも80%の精度で識別することができる。
論文 参考訳(メタデータ) (2023-10-17T09:01:17Z) - AutoReply: Detecting Nonsense in Dialogue Introspectively with
Discriminative Replies [71.62832112141913]
対話モデルは、不適切なメッセージを示す応答の確率を計算し、内観的に自分のメッセージの誤りを検出することができることを示す。
まず、手作りの返信は外交と同じくらい複雑なアプリケーションにおけるナンセンスを検出するタスクに有効であることを示す。
AutoReplyの生成した応答は手作りの応答よりも優れており、慎重に調整された大規模な教師付きモデルと同等に動作することがわかった。
論文 参考訳(メタデータ) (2022-11-22T22:31:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。