論文の概要: The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation
- arxiv url: http://arxiv.org/abs/2607.17420v1
- Date: Sun, 19 Jul 2026 21:47:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.464002
- Title: The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation
- Title(参考訳): コードに反対するライブラリアン: LLMコード生成におけるモデル依存のアイデンティティ実現
- Abstract要約: 4つの条件(ペルソナなし、2人のエンジニアペルソナ、研究図書館ペルソナ)、12のコード生成タスク、2つのフロンティアモデル、5つのセル実行)をテストした。
事前登録された混合効果分析では, プロバイダが報告した出力トークンに対して, 条件・バイ・モデル相互作用が重要であった。
Claude Opusでは、最小限のエンジニアのペルソナが正確性を改善することなく可視出力を30%削減し、一方、徹底的なエンジニアのペルソナは正確性のないアウトプットを増加させた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Biographical personas are widely used in system prompts, but their effects on code generation are rarely evaluated under controlled, pre-registered conditions. We tested four prompt conditions (no persona, two engineer personas, and a research-librarian persona), 12 code-generation tasks, two frontier models, and five runs per cell (480 completions). Persona effects differed between the two tested models. Under the pre-registered mixed-effects analysis, the condition-by-model interaction was significant for provider-reported output tokens; a post-hoc visible-character measure showed the same qualitative pattern. Six GPT-5.5 completions were length-capped and are reported separately. On Claude Opus, the minimalist engineer persona reduced visible output by 30% (33% in provider tokens) without improving correctness, while the thorough engineer persona increased output without a correctness gain. In an exploratory post-hoc analysis, the librarian persona elicited in-character disclaimers in 55 of 60 Opus responses and 12 genuine no-code responses, lowering mean correctness from 0.92 to 0.67. GPT-5.5 produced neither behavior in its 59 non-truncated responses. These results are consistent with personas acting as Model-Dependent behavioral-policy biases rather than universal quality interventions. We release raw completions, derived scores, analysis artifacts, a pre-registration document, and an execution gate log; end-to-end test-based rescoring requires an unreleased task harness.
- Abstract(参考訳): バイオグラフィカルなペルソナはシステムプロンプトで広く使われているが、コード生成に対するその影響は、制御された事前登録条件下ではめったに評価されない。
4つの条件(ペルソナなし、2人のエンジニアペルソナ、研究図書館ペルソナ)、12のコード生成タスク、2つのフロンティアモデル、5つのセル(480の完了)をテストした。
ペルソナ効果は2つの試験モデルで異なる。
事前に登録した混合効果分析では, プロバイダが報告した出力トークンに対して条件・バイ・モデル相互作用が重要であり, ポストホック可視特性測定では, 同じ定性パターンを示した。
6機のGPT-5.5が完成し、別々に報告された。
Claude Opusでは、最小限のエンジニアペルソナが正確性を改善することなく可視出力を30%(プロバイダトークンでは33%)削減した。
探索的ポストホック分析では、司書のペルソナが60オプス応答55件、真にノーコード応答12件を抽出し、平均正しさを0.92から0.67まで下げた。
GPT-5.5は59個の非停止反応では振る舞わない。
これらの結果は、普遍的な品質介入よりもモデル依存行動政治バイアスとして働くペルソナと一致する。
我々は、生の完成品、派生スコア、分析アーティファクト、事前登録文書、実行ゲートログをリリースします。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - A Three-Tier Persona Vector for Controllable User Simulation in Agentic Evaluation [0.9918136378822991]
23の操作次元を持つ3層ペルソナベクトルを提案する。
我々は64,698件の会話で合成データ生成パイプライン内のペルソナモデルを評価する。
論文 参考訳(メタデータ) (2026-09-08T11:28:02Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets [13.85834524293015]
私たちは、ロールが想定する能力を測定し、通常、ロールが配置されるプロトコルの下でそれを欠いていることを見つけます。
モデルは、その候補がセット自体の作者よりもはるかに優れているかどうかを判断する。
論文 参考訳(メタデータ) (2026-08-02T05:00:44Z) - Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation [0.0]
不正検出システムは、説明可能でレビュー可能なまま、トランザクションボリュームの上昇とともにスケールする必要がある。
本研究では,勾配ブースト型分類器,グラフに基づく構造特徴,オートエンコーダに基づく異常信号,および調査エージェントを組み合わせた層状パイプラインについて検討する。
我々は,各コンポーネントは特定の条件下でのみ寄与し,調査エージェントからのもっともらしい根拠は,よりよい判断の証拠ではないと結論づける。
論文 参考訳(メタデータ) (2026-07-21T16:37:41Z) - Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer [13.399139714704226]
AI研究エージェントは、新しい材料に作用するモデリング変更を見つけることなく、目に見えるスコアを改善することができる。
クローズドループエージェントは、未確認のエビデンスや、タスク間で再利用され、組み合わせられるコード変更に生き残る決定を生成できることを示す。
論文 参考訳(メタデータ) (2026-07-19T07:02:44Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution [6.908637308550535]
SEVAは、エビデンスアライメント、ステップバイステップの推論チェーン、キャリブレーションされた信頼度、6カテゴリのエラー診断を発行する構造化検証エージェントである。
ClearFacts では、SEVA-3B は GPT-4o-mini (69.0 vs. 69.8 F1) と一致し、よりリッチで監査可能な出力を生成する。
論文 参考訳(メタデータ) (2026-06-29T02:37:13Z) - Philosophical Dispositions as Behavioral Constraints for AI-Assisted Code Review: An Empirical Study [0.0]
哲学的な配置を通してAIレビュアーの行動を制限するシステムを提案する。
それぞれの分布は(それがすることを拒否して)好意的に定義される
5つのプログラミング言語にまたがる7つのレポジトリ間で50のプルリクエストをマージしたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T23:57:25Z) - Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models [0.0]
GPT-5は完全な数学の文脈崩壊を示し、最適応答に対する特異な同一性を採用した。
クロード・ソネット4.5はSATアイテムに限定的ではあるが測定可能な役割特異的なバリエーションを保持していた。
全てのモデルは、異なる役割条件の感情的嗜好を示し、認知的制約が緩和されたときに社会影響の変動が再燃することを示した。
論文 参考訳(メタデータ) (2025-11-19T16:04:49Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。