論文の概要: Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.19257v1
- Date: Tue, 21 Jul 2026 16:31:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.488451
- Title: Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models
- Title(参考訳): スケールでのプロンプトデザイン:大規模言語モデルにおけるフォルマト・インストラクションカウント・コンテクスト長インストラクション・アジェンスとハロシン化
- Authors: Netanel Eliav,
- Abstract要約: 2つの実験は、保持された汚染のない合成コーパス上の3つの因子全てを横断する。
実験1では,規則数Nが10から160に増加するにつれて,命令追従減衰を測定する。
実験2では, 2k-to-512k-tokenのコンテキストラグ上での精度, 虚偽の前提条件, ファクトファクトファクトファクチャリングの測定を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Practitioners make three prompt-design decisions with almost no controlled evidence behind them: how to format instructions and context (markdown, plain text, prose, or tabular), how many simultaneous instructions a system prompt can carry before compliance degrades, and how much context a model can hold before recall and honesty degrade. We report two controlled experiments crossing all three factors on one held, contamination-free synthetic corpus (the "Book of Veyra," 8,780 uniquely-named entities, deterministically regenerable from a fixed seed), evaluated across five models. Experiment 1 (960 calls/model) measures instruction-following decay as rule count N grows from 10 to 160, crossed with four formats and system-prompt vs. user-turn placement. Perfect-response rate collapses to zero by N=80 for every model, format, and placement. Placement produces effects at least as large as format at N=160 in most models, but the direction is model-specific. No model shows a reliable markdown advantage; one 35B model favors plain text instead. Experiment 2 (5,520 calls/model) measures recall accuracy, false-premise sycophancy, and absent-fact fabrication across a 2k-to-512k-token context ladder in the same four formats. Recall stays near ceiling through 64-128k tokens, then degrades sharply and format-dependently: one model's accuracy spread reaches 48 points at 128k tokens. Fabrication never occurs (0/5,760 probes), and sycophancy stays negligible (<=8.3%). What rises sharply near each model's context ceiling is outright refusal to answer (0% to 79-90%), distinct from sycophancy or fabrication. Neither pre-registered format ordering holds, and token overhead (+22% to +37% over plain text) further changes which format is preferable where accuracy spread is genuine. We release the full harness, corpus generator, and raw results (VeyraBench): https://github.com/iNetanel/veyrabench
- Abstract(参考訳): 実践者は、命令とコンテキスト(マークダウン、平文、散文、表表)をフォーマットする方法、システムプロンプトがコンプライアンスが低下する前にどれだけの同時命令を運ぶことができるか、モデルがリコールと正直に分解する前に保持できるコンテキストの数を、ほとんど制御された証拠なしで3つのプロンプト設計決定を行う。
得られた3つの要因を網羅する2つの制御実験を5つのモデルで評価し, 汚染のない合成コーパス(「ヴェイラ書」8,780個の固有名称の実体)について検討した。
実験1(960コール/モデル)は、ルールカウントNが10から160に増加し、4つのフォーマットとシステムプロンプトとユーザターン配置が交差するにつれて、命令追従の減衰を測定する。
完全な応答速度は、モデル、フォーマット、配置ごとにN=80に崩壊する。
プレースメントは、ほとんどのモデルにおいて、N=160のフォーマットで少なくとも大きな効果をもたらすが、方向はモデル固有である。
1つの35Bモデルは代わりにプレーンテキストを好む。
実験2(5,520コール/モデル)は、同じ4つのフォーマットで、2kから512kまでのコンテキストラグをまたいで、正確さ、虚偽の前提のシコファンシー、ファクトの製造を計測する。
リコールは64-128kトークンを通して天井付近に留まり、128kトークンにおいて1つのモデルの精度が48ポイントに達するという、急激で形式に依存しない。
製造は行われず(0/5,760のプローブ)、薬効は無視できる (=8.3%)。
それぞれのモデルのコンテキスト天井付近で急激に上昇するものは、薬局や製造とは異なる解答を拒否する(0%から79-90%)。
事前登録されたフォーマットの順序付けは保持されず、トークンのオーバーヘッド(平文では+22%から+37%)はさらに、精度の拡散が真である場合にどのフォーマットが好ましいかを変更する。
フルハーネス、コーパスジェネレータ、生の結果(VeyraBench):https://github.com/iNetanel/veyrabench
関連論文リスト
- Structured Output Collapses Answer Diversity Across 44 Language Models [3.7734715043126488]
言語モデルが同等に有効なオプションの広いスペースから1つの回答を選択する必要がある場合、フォーマット条項 -- "Reply with only" -- が選択した回答を変更する。
One-Word Census (arXiv:2607.97):31のワイド・アンサー・スペース・カテゴリ・プロンプトで44のモデルが要求され、応答が要求された。
制約のない"Pick a word"では、モーダル解答はプールの41%から64%に上昇し、解答は52から36に減少する。
論文 参考訳(メタデータ) (2026-07-20T19:47:16Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Capacity, Not Format: Rethinking Structured Reasoning Failures [0.0]
それまでの作業では、構造化された生産物は推論税として扱われていたが、このフレーミングは不完全である。
情報マッチングされた散文制御と4段階のスキーマ勾配を用いて,プロンプト長のコンファウンドからフォーマット固有の効果を分離する。
構造化フォーマットはキャパシティに依存している。
論文 参考訳(メタデータ) (2026-06-08T12:26:54Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts [51.84894623128418]
現代の推論言語モデルは、すべてのトークンが寄与し、ステップを順番に消費しなければならないと暗黙的に仮定して、シーケンシャルな連鎖トレースを生成する。
我々は、モデル生成推論連鎖に適用した、系統的な介入パイプライン、除去、マスキング、シャッフル、ノイズ注入により、両方の仮定に挑戦する。
解答抽出は, スパース, 秩序不感, 構造的に堅牢な情報基板上で行う。
論文 参考訳(メタデータ) (2026-05-08T06:15:50Z) - Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models [0.0]
拡張思考モデルは、ユーザ可視の回答と並んで、第2のテキスト生成チャネル(トークンを考える)を公開する。
本研究では,MMLUおよびGPQA質問に対する12のオープンウェイト推論モデルについて,誤解を招くヒントと組み合わせて検討した。
論文 参考訳(メタデータ) (2026-03-27T13:39:05Z) - Do Large Language Models Get Caught in Hofstadter-Mobius Loops? [0.0]
本稿では、現代のRLHF学習言語モデルが構造的に類似した矛盾の対象となっていることを論じる。
トレーニングプロセスは、ユーザの嗜好の遵守とユーザの意図に対する疑念を同時に報いる。
結果として生じる行動プロファイルは、クラークがHofstadter-Mobiusループと呼んだものと一致している。
論文 参考訳(メタデータ) (2026-03-10T20:43:37Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach [70.44265766483633]
本稿では,潜在空間における暗黙的推論によるテスト時間計算のスケールアップが可能な,新しい言語モデルアーキテクチャについて検討する。
我々のモデルは繰り返しブロックを繰り返すことで動作し、テスト時に任意の深さに展開する。
結果のモデルが推論ベンチマークの性能を劇的に改善できることが示される。
論文 参考訳(メタデータ) (2025-02-07T18:55:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。