論文の概要: The Assistant as a Privileged Persona: A canonical reference in cross-persona self-recognition
- arxiv url: http://arxiv.org/abs/2606.00545v1
- Date: Sat, 30 May 2026 05:33:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.51639
- Title: The Assistant as a Privileged Persona: A canonical reference in cross-persona self-recognition
- Title(参考訳): 主観的人物としてのアシスタント:クロスパーソナ自己認識における標準的参照
- Authors: Asvin G,
- Abstract要約: 訓練後の言語モデルでは、文脈外の文から2つのアウトプットを認識できる。
本稿は、Llama-3.1-70B-Instruct上でのクロスパーソナライズ・オーサシップの判断に枠を広げる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-trained language models can recognize their own outputs from a sentence or two out of context. In a companion paper \citep{jack2026twomodes} we showed they can also recognize when they are currently acting on-policy, through the sharp entropy drop of assistant-mode generation. Both signals are tied to the Assistant persona that post-training mainly shapes. This paper widens the frame to cross-persona authorship judgement on Llama-3.1-70B-Instruct. We measure a matrix of authorship claim rates over a panel of evaluator and generator personas spanning librarian to dragon to Shakespeare, and make two claims. \emph{First}, on the Assistant's own row of the matrix, the Assistant's claim rate, the persona-vector distance from the Assistant in activation space, and the entropy gap between the Assistant's surprise on a persona's text and the persona's surprise on its own text are all tightly coupled. This extends the entropy signature of \emph{acting} from the companion paper to a retrospective signature of \emph{having acted}. \emph{Second}, this coupling fails off the Assistant's row: the natural symmetric extension of the entropy gap does not predict authorship for distinctive evaluators (pirate, dragon, Shakespeare); what does is asymmetric -- the evaluator's surprise compared to the Assistant's surprise on the same text, not to the generator's. We rule out the alternative that any persona could play this reference role by trying many candidate substitutes; none does. We interpret the asymmetry as the model performing an implicit Bayesian likelihood-ratio test against the Assistant as the canonical alternative hypothesis, with the persona-vector geometry of \citet{chen2025persona} (every persona a delta off the Assistant) ensuring that the Assistant is the only persona universally accessible to that test.
- Abstract(参考訳): 訓練後の言語モデルでは、文脈外の文から2つのアウトプットを認識できる。
共用紙 \citep{jack2026twomodes} では, 補助モード生成の急激なエントロピー低下を通じて, 現行の政治行動の時も認識できることを示した。
両方の信号は、主に訓練後の形状のアシスタントペルソナに結び付けられている。
本稿では,Llama-3.1-70B-Instructのクロスパーソナライズ・オーサシップの判断範囲を広げる。
著者の主張率の行列を、図書館員からドラゴンとシェイクスピアにまたがる評価官とジェネレータペルソナのパネル上で測定し、2つの主張を行う。
アシスタント自身の行列行、アシスタントのクレームレート、アクティベーション空間におけるアシスタントからのペルソナ-ベクター距離、そしてアシスタントのペルソナのテキストでのサプライズとペルソナのサプライズの間のエントロピーギャップは、すべて密結合である。
これは \emph{acting} のエントロピーシグネチャを共用紙から \emph{having act} の振り返りシグネチャに拡張する。
エントロピーギャップの自然な対称拡張は、固有の評価者(海賊版、ドラゴン版、シェイクスピア版)の著者数を予測しない。
我々は、任意のペルソナが多くの候補代替品を試すことで、この参照の役割を果たせるという代替案を除外する。
我々は、非対称性を、アシスタントに対して暗黙のベイズ的確率比検定を行うモデルとして解釈し、アシスタントがそのテストに普遍的にアクセス可能な唯一のペルソナであることを保証するために、a persona-vector geometry of \citet{chen2025persona} (すべてのペルソナはアシスタントのデルタである) と解釈する。
関連論文リスト
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - The Argument is the Explanation: Structured Argumentation for Trust in Agents [27.3171971392448]
人間はブラックボックスであり、彼らの神経過程を観察することはできないが、検証可能な議論を評価することで社会機能を評価する。
構造化された議論を用いて、説明と検証のレベルを提供する。
我々のパイプラインは、AAECが発行した列車/テストスプリット上で、最先端の94.44マクロF1を達成する。
論文 参考訳(メタデータ) (2025-10-03T19:04:15Z) - Non-Degenerate One-Time Pad and the integrity of perfectly secret messages [0.0]
本報告では, 自然拡散特性を持つ1時間パッド(OTP)と, それらの利点を生かした冗長性注入機構を新たに構築する。
この構成は、プレインテキストとキーを、factadicへの変換後のリーマー符号表現における置換群のメンバーとして解釈することに基づいている。
論文 参考訳(メタデータ) (2024-04-10T14:16:44Z) - Forging the Forger: An Attempt to Improve Authorship Verification via Data Augmentation [52.72682366640554]
著者検証(英語: Authorship Verification, AV)とは、ある特定の著者によって書かれたか、別の人物によって書かれたのかを推測するテキスト分類タスクである。
多くのAVシステムは敵の攻撃に弱いことが示されており、悪意のある著者は、その書体スタイルを隠蔽するか、あるいは他の著者の書体を模倣することによって、積極的に分類者を騙そうとしている。
論文 参考訳(メタデータ) (2024-03-17T16:36:26Z) - Operator learning without the adjoint [9.062164411594177]
我々は、随伴を問うことなく、自己随伴でない無限次元コンパクト作用素の族を近似することができることを証明した。
我々は随伴のないサンプル複雑性を導出する。
論文 参考訳(メタデータ) (2024-01-31T10:59:57Z) - Same or Different? Diff-Vectors for Authorship Analysis [78.83284164605473]
古典的な著作物分析において、特徴ベクトルは文書を表し、特徴の値は文書中の特徴の相対周波数(関数の増大)を表し、クラスラベルは文書の著者を表す。
筆者らの実験は共著者検証,著者検証,クローズドセットの著者帰属に取り組んでおり,DVは自然に第1の問題を解くのに向いているが,第2と第3の問題を解くための2つの新しい方法も提供している。
論文 参考訳(メタデータ) (2023-01-24T08:48:12Z) - PART: Pre-trained Authorship Representation Transformer [52.623051272843426]
文書を書く著者は、自分のテキストに識別情報を印字する。
以前の作品では、手作りの機能や分類タスクを使って著者モデルを訓練していた。
セマンティクスの代わりにテキストの埋め込みを学習するために、対照的に訓練されたモデルを提案する。
論文 参考訳(メタデータ) (2022-09-30T11:08:39Z) - Can You Fool AI by Doing a 180? $\unicode{x2013}$ A Case Study on
Authorship Analysis of Texts by Arata Osada [2.6954666679827137]
本稿では,倫理学と著者分析の分野をカバーする2つの疑問に答える試みである。
まず,著者識別システムが,作品の作者への正しい属性付けが可能かどうかを,長年にわたって大きな心理的移行を経た上で確認することに興味を抱いた。
第2に、著者の倫理的価値観の進化の観点から、著者の帰属体系が単一著者の発見に困難に直面する場合、それが何を意味するのかを確認した。
論文 参考訳(メタデータ) (2022-07-19T05:43:49Z) - Asymmetric Modality Translation For Face Presentation Attack Detection [55.09300842243827]
顔提示攻撃検出(PAD)は、悪意のあるユーザによって顔認識システムが偽造されるのを防ぐための重要な手段である。
両モードシナリオにおける非対称なモダリティ変換に基づく新しいフレームワークを提案する。
本手法は,異なる評価プロトコル下での最先端性能を実現する。
論文 参考訳(メタデータ) (2021-10-18T08:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。