論文の概要: Short Data, Long Context: Distilling Positional Knowledge in Transformers
- arxiv url: http://arxiv.org/abs/2604.06070v1
- Date: Tue, 07 Apr 2026 16:50:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.937811
- Title: Short Data, Long Context: Distilling Positional Knowledge in Transformers
- Title(参考訳): 短データ, 長期コンテキスト: 変圧器の位置的知識の蒸留
- Authors: Patrick Huber, Ernie Chang, Chinnadhurai Sankar, Rylan Conway, Igor Fedorov, Md Rifat Arefin, Adithya Sagar,
- Abstract要約: 本研究は,ロジットに基づく知識蒸留により,長文検索能力を学生モデルに伝達可能であることを示す。
本稿では,ロジットに基づく知識蒸留が位置情報伝達を直接実現できることを実証する。
- 参考スコア(独自算出の注目度): 15.340745781611561
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Extending the context window of language models typically requires expensive long-context pre-training, posing significant challenges for both training efficiency and data collection. In this paper, we present evidence that long-context retrieval capabilities can be transferred to student models through logit-based knowledge distillation, even when training exclusively on packed short-context samples within a long-context window. We provide comprehensive insights through the lens of Rotary Position Embedding (RoPE) and establish three key findings. First, consistent with prior work, we show that phase-wise RoPE scaling, which maximizes rotational spectrum utilization at each training stage, also achieves the best long-context performance in knowledge distillation setups. Second, we demonstrate that logit-based knowledge distillation can directly enable positional information transfer. Using an experimental setup with packed repeated token sequences, we trace the propagation of positional perturbations from query and key vectors through successive transformer layers to output logits, revealing that positional information systematically influences the teacher's output distribution and, in turn, the distillation signal received by the student model. Third, our analysis uncovers structured update patterns in the query state during long-context extension, with distinct parameter spans exhibiting strong sensitivity to long-context training.
- Abstract(参考訳): 言語モデルのコンテキストウィンドウを拡張するには、通常、高価な長期コンテキスト事前トレーニングが必要で、トレーニング効率とデータ収集の両方に重大な課題が生じる。
本稿では,ロングコンテキストウィンドウ内に短文サンプルを詰め込んだ場合であっても,ログベースの知識蒸留により,長期コンテキスト検索機能が学生モデルに移行可能であることを示す。
ロータリー位置埋め込み (Rotary Position Embedding, RoPE) のレンズによる包括的洞察を提供し, 3つの重要な知見を立証する。
まず, 学習段階ごとの回転スペクトル利用を最大化する位相方向の RoPE スケーリングが, 知識蒸留設備において, 最高の長期的性能を達成することを示す。
第2に,ロジットに基づく知識蒸留により位置情報伝達が直接可能となることを示す。
繰り返しトークン列を蓄積した実験装置を用いて,逐次的なトランスフォーマー層を通してクエリとキーベクタから位置摂動の伝播をトレースし,その位置情報が教師の出力分布に系統的に影響を及ぼし,学生モデルで受信した蒸留信号を明らかにする。
第3に、長文拡張中のクエリ状態の構造化された更新パターンを明らかにし、長文学習に強い感度を示すパラメータスパンを識別した。
関連論文リスト
- How to Train Your Long-Context Visual Document Model [0.0]
本研究は,344Kの文脈における長文視覚言語モデルの訓練に関する総合的かつ大規模な研究である。
MMLongBenchDocの両パラメータスケールに対する最先端性能を実現する。
テキストから視覚への長いコンテキストの変換を逆に拡張し、視覚的長期のコンテキストのトレーニングが長いコンテキストのテキストのパフォーマンスに転送されることを示す。
論文 参考訳(メタデータ) (2026-02-16T23:26:51Z) - On-Policy Context Distillation for Language Models [92.82835176360864]
本稿では, オンライン蒸留とコンテキスト蒸留を橋渡しするフレームワークである, オン・ポリティ・コンテキスト蒸留(OPCD)を提案する。
実験的知識蒸留とシステム急速蒸留の2つの重要な応用におけるOPCDの有効性を実証する。
論文 参考訳(メタデータ) (2026-02-12T18:58:28Z) - Towards Long-window Anchoring in Vision-Language Model Distillation [32.38498360433994]
大きな視覚言語モデル(VLM)は、強い長文理解を示すが、その主流である小さな枝は、限られたウィンドウサイズで言語学的・写真的アライメントに失敗する。
知識蒸留により,窓の大きさのロータリー位置埋め込み(RoPE)を補完する学生の能力が向上することが判明した。
本稿では,2つの相補的コンポーネントを介し,長距離の注意機構の伝達を直接目的とするLAidを提案する。
論文 参考訳(メタデータ) (2025-12-25T08:39:14Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - ACER: Automatic Language Model Context Extension via Retrieval [36.40066695682234]
現在のオープンウェイト・ジェネリリストのロングコンテキストモデルは、実用的ロングコンテキスト処理タスクにはまだ欠けている。
短文LMを用いて,この処理を模倣するテキスト自動データ合成パイプラインを構築した。
短文LMは、タスク固有の長文機能を得るために、これらの自己生成データを使ってさらに調整される。
論文 参考訳(メタデータ) (2024-10-11T17:57:06Z) - The mechanistic basis of data dependence and abrupt learning in an
in-context classification task [0.3626013617212666]
本研究では,言語固有の特定の分布特性が,2種類の学習のトレードオフや同時出現を制御していることを示す。
インコンテキスト学習は、誘導ヘッドの突然の出現によって駆動され、その後、インウェイト学習と競合する。
注意に基づくネットワークの急激な遷移は、ICLを実現するのに必要な多層演算の特定の連鎖によって生じると提案する。
論文 参考訳(メタデータ) (2023-12-03T20:53:41Z) - Effective Long-Context Scaling of Foundation Models [90.57254298730923]
最大32,768個のトークンの効率的なコンテキストウィンドウをサポートする長文LLMを提示する。
我々のモデルは、ほとんどの通常のタスクにおいて一貫した改善を達成し、Llama 2よりも長いコンテキストタスクを大幅に改善します。
論文 参考訳(メタデータ) (2023-09-27T21:41:49Z) - Improving Sequential Recommendations via Bidirectional Temporal Data Augmentation with Pre-training [46.5064172656298]
プレトレーニングによる双方向時間データ拡張(BARec)について紹介する。
提案手法は, 双方向の時間的拡張と知識強化による微調整を活用して, 真正な擬似優先順位項目を合成する。
5つのベンチマークデータセットに関する包括的実験分析により、短いシーケンスと長いシーケンスコンテキストの両方において、BARecの優位性が確認された。
論文 参考訳(メタデータ) (2021-12-13T07:33:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。