論文の概要: Instruction Duplication as an Inference-Time Control Primitive
- arxiv url: http://arxiv.org/abs/2609.04024v1
- Date: Thu, 03 Sep 2026 16:05:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.149436
- Title: Instruction Duplication as an Inference-Time Control Primitive
- Title(参考訳): 推論時間制御プリミティブとしての命令重複
- Authors: Victor Lavrenko,
- Abstract要約: 手続き的命令は制御可能な言語モデルシステムの基本的要件である。
手続き的命令のみを繰り返す最小限のブラックボックス推論時間制御である命令重複を導入する。
- 参考スコア(独自算出の注目度): 0.003596046562524959
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Procedural instruction following is a basic requirement for controllable language-model systems, especially when generated trajectories are inspected or repaired downstream. We introduce instruction duplication, a minimal black-box inference-time control that repeats only the procedural instruction, without retraining or decoding changes. Across seven instruction-tuned models, 300 medical multiple-choice questions, eight placement conditions, and 16,800 scheduled generations, moving from one to two copies raises the deterministic All-8 diagnostic--responses passing all eight observable tests--from 90.22% to 93.17% (+2.95 percentage points), eliminating 30.2% of the failures remaining after one copy. Pre-provisional TF-IDF recall rises from 73.44% to 74.81% (+1.38 points; Holm-adjusted p < .001), while final-answer accuracy remains exactly 60.21%. Premature commitment increases from 1.52% to 2.30% (p_Holm = .00536). A blinded challenge audit yields 10/30 directional confirmations, 20/30 perceptual ties, and no reversals; its prespecified 28/30 confirmation criterion is not met. Yet this distinction can matter operationally when a downstream system acts on the generated trajectory. In Answer Engineering (AE), where explicit trajectory state determines local repair, the published reason-first no-editing SSNHL endpoint was 25.1%; system-only AE was later reproduced at 84.2%, and the same trailing duplicate raised it to 97.1%. For conductive diagnostic branch preservation, the corresponding values are 58.9% published without editing, 78.6% with reproduced AE, and 73.8% with AE plus duplication--a within-AE decrease, but still 14.9 points above the no-editing baseline. Instruction duplication is therefore a low-complexity, placement-sensitive control whose practical value can emerge through the downstream system that consumes the exposed trajectory.
- Abstract(参考訳): 手続き的命令は制御可能な言語モデルシステムの基本的要件であり、特に生成された軌道が下流で検査または修復される場合である。
命令重複は最小限のブラックボックス推論時間制御であり、手続き的命令のみを繰り返すが、再学習や復号化は行わない。
7つの命令調整されたモデル、300の医療的多重選択問題、8つの配置条件、16,800の定期的な世代が1から2つのコピーに移行し、決定論的オール8の診断応答が90.22%から93.17%(+2.95ポイント)まで上昇し、1コピー後に残る障害の30.2%が取り除かれた。
TF-IDFの予備リコールは73.44%から74.81%(+1.38ポイント、ホルム調整されたp < .001)に上昇するが、最終回答精度は60.21%のままである。
早期のコミットメントは1.52%から2.30%に増加する(p_Holm = 00536)。
盲目の課題監査では10/30の方向確認、20/30の知覚的結びつき、反転がなく、予め規定された28/30の確認基準は満たされていない。
しかし、下流システムが生成された軌道に作用する場合、この区別は運用上重要である。
明示的な軌道状態が局所的な修復を決定するAnswer Engineering (AE)では、発行された理由優先のSSNHLエンドポイントは25.1%であり、システムのみのAEは84.2%で再現され、同じ後続の複製で97.1%まで上昇した。
導電性診断枝保存の場合、対応する値は編集なしで58.9%、再生されたAEは78.6%、AE+重複が73.8%、-AE内は14.9ポイント減少する。
したがって、命令重複は低複雑で配置に敏感な制御であり、その実際の値は露出した軌道を消費する下流システムを通して現れる。
関連論文リスト
- Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch [44.05969616406614]
Autoresearchは、変更を提案し、フルトレーニングジョブを実行し、メトリックを改善する変更を維持することによって、マシンラーニングコードを改善する。
本研究では,この事前執行判断の信頼性が,自動検索の軌道上でどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-07-30T05:08:15Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning [0.6999740786886536]
MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
論文 参考訳(メタデータ) (2026-07-22T13:34:17Z) - Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost [2.9867974725783113]
Constrained Path Reasoning (CPR)は、ソース認識パス仮説とステージレベルの会計とをペアリングする。
CPRは、タスク互換のコミットメントは、移行を分解し、候補の質量を集中し、正規性を誘導し、そのゲインが宣伝されたエラーや実行コストを超えたときにフィードバックを公開することができると予測している。
論文 参考訳(メタデータ) (2026-07-19T13:11:18Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers [0.0]
デプロイされた安全分類器における分散シフトのオンラインモニタリングシステムを提案する。
検出後、共形吸収層は、目標誤差を回復する決定に適応する。
このシステムは平均遅延39.5800ステップで86.6%の検知を実現している。
論文 参考訳(メタデータ) (2026-06-10T11:24:25Z) - ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking [2.2573512203799626]
本稿では,NLUを独立したツールコールとして再構成する有界神経シンボルアーキテクチャであるReacTODを提案する。
有界ReActループは反復自己補正を可能にし、MultiWOZ上のシングルパス推論よりも最大9.3ポイント精度を向上させる。
論文 参考訳(メタデータ) (2026-05-18T20:06:04Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training [18.22030439716779]
安全のために調整された大きな言語モデル(LLM)は、しばしば人口統計の違いを認めない。
このアイデンティティ・ブラインドネスは、誤った応答、不必要な拒絶、あるいは一般的な"equal-treatment"デフォルトをもたらす。
DART(Distill-Audit-Repair Training)を導入する。
論文 参考訳(メタデータ) (2026-04-18T05:28:53Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。