論文の概要: What Should Data Teach? Moving Bottlenecks Across Circuit, Store, and Use
- arxiv url: http://arxiv.org/abs/2609.32991v1
- Date: Sat, 26 Sep 2026 22:40:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 11:25:55.590805
- Title: What Should Data Teach? Moving Bottlenecks Across Circuit, Store, and Use
- Title(参考訳): データ教育とは何か? ボトルネックを回路、ストア、使用中に移動させる
- Abstract要約: サーキットビューでは、計算の作成、必要なコンテンツの提供、利用可能なルートの選択という、3つの異なるボトルネックが明らかにされている。
350Mモデルの連続実験は、3つの介入を同じ事実に結びつける。
- 参考スコア(独自算出の注目度): 18.3334052811574
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: What should data teach a language model at a particular point in training? A circuit view reveals three distinct bottlenecks: forming a computation, making its required content available, and selecting among available routes. A shared diagnosis-to-data principle connects them: localize the missing operation, preserve its causal relation, vary shortcut-bearing context, and re-audit the residual. Formation-sensitive selection and prerequisite ordering accelerate a binding-matching-transport path; a brief early prefix from the same training multiset retains a validation advantage through 100B tokens. Availability counterfactuals then distinguish writing content from invoking available memory, while paired supervision and context-opportunity ranking improve matched route decisions and long-context answer likelihood. A continuous 350M-model experiment connects the three interventions on the same facts: early circuit training improves subsequent learning, and the complete sequence outperforms stage-replacement controls on facts withheld from Use teaching. Independent query surfaces and opposed-source decisions expose conditional arbitration as the remaining frontier. Together, these results show why a change in the limiting operation calls for a change in supervision, not merely a new ranking of difficult examples.
- Abstract(参考訳): トレーニングの特定の時点で、データは言語モデルに何を教えるべきか?
サーキットビューでは、計算の作成、必要なコンテンツの提供、利用可能なルートの選択という、3つの異なるボトルネックが明らかにされている。
共通診断とデータの原則は、欠落した操作の局所化、因果関係の保存、ショートカット・ベアリングのコンテキストの変化、残余の再監査とを結びつける。
生成に敏感な選択と事前条件順序付けは、バインディングマッチング-トランスポートパスを加速する; 同じトレーニングマルチセットからの短いプレフィックスは、100Bトークンを通じて検証の優位性を保持する。
可用性のカウンターファクトは、コンテンツの書き込みと利用可能なメモリの呼び出しを区別し、ペア化された監視とコンテキスト-機会ランキングは、一致したルート決定と長文の応答可能性を改善する。
初期の回路トレーニングはその後の学習を改善し、完全なシーケンスは、Use教示から守られた事実のステージ置換制御より優れている。
独立したクエリサーフェスと反対ソース決定は、条件付き仲裁を残りのフロンティアとして公開する。
これらの結果から,運用制限の変更が,単に困難な事例の新たなランキングではなく,監督の変更を要求する理由が示唆された。
関連論文リスト
- When Should the Count Change? Learning State Maintenance for Causal Video Counting [11.588679307869372]
StaMinaは状態条件の更新を通じてカウント状態を維持することを学ぶ。
部分的なビデオオーバーラップと連結アノテーションの保留グループによるカウント適応の評価を行った。
論文 参考訳(メタデータ) (2026-09-28T15:29:48Z) - TTRSD: Test-Time Reinforcement Learning with Self-Distillation for Vision-Language Models [27.31606612106555]
テスト時強化学習により、未ラベル入力を用いて視覚言語モデルに適応することができる。
我々は,多視点応答レベル自己蒸留と視覚的コントラストトークン選択を組み合わせたテスト時強化学習フレームワークTTRSDを提案する。
論文 参考訳(メタデータ) (2026-09-27T09:49:39Z) - Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training [9.956488020809491]
バウンダリ・キャリブレーション・インターベンション・トランスファー(BCIT)は、重量変化トレーニングの前に経験的再利用を認可する手法である。
BCITは、観測された効果をソースのコンテキストに結び付け、適用性条件をチェックし、名前付きハードコンフリクトで候補者を拒否し、制限付きトレーニングトライアルを通じて現在の証拠を取得する。
完全に訓練された候補者は、まだ共有採用ルールに直面しており、観察されたイベントだけがメモリを拡張します。
論文 参考訳(メタデータ) (2026-08-27T07:22:16Z) - Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models [0.0]
最近の研究は、いくつかの大きな言語モデル表現が内容や参照を持っていることを示唆している。
この論文はそのギャップから何に従うか尋ねる。
出力は、目標とタスク固有のアレンジメントが生成し、受け入れ、または取り下げるものに相違がある場合、応答可能である。
論文 参考訳(メタデータ) (2026-08-14T12:30:19Z) - Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails [6.708653593551749]
我々は,MLLMの継続的な適応が,その答えだけでなく,視覚的,テキスト的,OCR,チャート,文書的エビデンスをいかに活用するかを考察する。
モデルが異なるあるいは根拠のないエビデンスチャネルに静かに移行している間に、解答精度を保ちながら、エンフィデントエビデンス利用の忘れを識別する。
我々は,リプレイ不要な依存制約付き連続学習フレームワークであるtextscRCLを提案する。
論文 参考訳(メタデータ) (2026-07-02T10:50:37Z) - Learn to Rank: Visual Attribution by Learning Importance Ranking [58.69028273772474]
コンピュータビジョンモデルのための視覚属性マップを生成する新しい手法を提案する。
提案手法は, 任意の数段階の勾配補正を施した1つの前方通過において, 密度の高い画素レベルの属性を生成する。
我々の実験は、一貫した定量的改善と、よりシャープで境界に沿った説明を示す。
論文 参考訳(メタデータ) (2026-04-07T12:53:22Z) - Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior [58.751981587234916]
本稿では,Refinement Provenance Inference (RPI)監査タスクをRefinement Provenance Inference (RPI)として定式化する。
本稿では,ロジットレベルの信号で教師が強制する可能性機能を融合させるロジットベースのフレームワークであるReProを提案する。
トレーニング中、ReProはシャドウファインチューニングを通じて転送可能な表現を学び、訓練データアクセスなしで、見えない犠牲者の証明を推測するために軽量のリニアヘッドを使用する。
論文 参考訳(メタデータ) (2026-01-05T10:16:41Z) - Unsupervised 3D registration through optimization-guided cyclical
self-training [71.75057371518093]
最先端のディープラーニングベースの登録方法は、3つの異なる学習戦略を採用している。
本稿では,教師なし登録のための自己指導型学習パラダイムを提案する。
腹部, 肺の登録方法の評価を行い, 測定基準に基づく監督を一貫して上回り, 最先端の競争相手よりも優れていた。
論文 参考訳(メタデータ) (2023-06-29T14:54:10Z) - Mitigating Catastrophic Forgetting in Task-Incremental Continual
Learning with Adaptive Classification Criterion [50.03041373044267]
本稿では,継続的学習のための適応型分類基準を用いた教師付きコントラスト学習フレームワークを提案する。
実験により, CFLは最先端の性能を達成し, 分類基準に比べて克服する能力が強いことが示された。
論文 参考訳(メタデータ) (2023-05-20T19:22:40Z) - DisCor: Corrective Feedback in Reinforcement Learning via Distribution
Correction [96.90215318875859]
ブートストラップに基づくQ-ラーニングアルゴリズムは必ずしも修正フィードバックの恩恵を受けないことを示す。
本稿では,この最適分布に対する近似を計算し,トレーニングに使用する遷移の重み付けに使用する新しいアルゴリズムであるDisCorを提案する。
論文 参考訳(メタデータ) (2020-03-16T16:18:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。