論文の概要: The Order Is The Message
- arxiv url: http://arxiv.org/abs/2603.25047v1
- Date: Tue, 24 Mar 2026 22:14:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.120377
- Title: The Order Is The Message
- Title(参考訳): 注文はメッセージです
- Abstract要約: 2つの固定順序戦略は、入力空間の0.3%からなるトレーニングセットからエポック487、659で99.5%のテスト精度を達成する。
本稿では、学習効率の向上、グルーキングの再解釈、およびコンテンツレベルの監査を回避したチャンネルの安全性リスクについて論じる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In a controlled experiment on modular arithmetic ($p = 9973$), varying only example ordering while holding all else constant, two fixed-ordering strategies achieve 99.5\% test accuracy by epochs 487 and 659 respectively from a training set comprising 0.3\% of the input space, well below established sample complexity lower bounds for this task under IID ordering. The IID baseline achieves 0.30\% after 5{,}000 epochs from identical data. An adversarially structured ordering suppresses learning entirely. The generalizing model reliably constructs a Fourier representation whose fundamental frequency is the Fourier dual of the ordering structure, encoding information present in no individual training example, with the same fundamental emerging across all seeds tested regardless of initialization or training set composition. We discuss implications for training efficiency, the reinterpretation of grokking, and the safety risks of a channel that evades all content-level auditing.
- Abstract(参考訳): モジュラー算術(p = 9973$)の制御実験において、全ての定数を保ちながら順序付けを行う場合、入力空間の0.3\%からなるトレーニングセットから、2つの固定順序付け戦略がエポックス487と659で99.5\%のテスト精度を達成する。
IIDベースラインは同じデータから 5{,}000 のエポック後に 0.30 % を達成する。
対向的構造化順序付けは学習を完全に抑制する。
一般化モデルは、基本周波数が注文構造のフーリエ双対であるフーリエ表現を確実に構成し、個々の訓練例に存在しない情報を符号化する。
本稿では、学習効率の向上、グルーキングの再解釈、および全てのコンテンツレベルの監査を回避するチャンネルの安全性リスクについて論じる。
関連論文リスト
- OPEN-1B: A Fully Auditable Training Run [0.7223361655030193]
トレーニング中のデータサンプルのすべての操作は、コモディティハードウェア上で独立して再現可能である。
我々は、単一のコモディティハードウェア上で実行される大規模分散トレーニングの個々のステップをリプレイし、公開された軌道に対してそれをチェックできるようにします。
この体制下でトレーニングされたモデルであるOpen-1Bと、その完全な事前トレーニングデータセット、すべての中間チェックポイント、トレーニング、トレーニングの任意のステップを再現し検証するために必要な監査ハーネスを合わせてリリースします。
論文 参考訳(メタデータ) (2026-09-15T16:23:08Z) - SAM3-LoRA: Parameter-Efficient Adaptation of a Concept-Promptable Foundation Model for Multi-Class Structural Defect Segmentation [0.0]
本研究は,多層構造欠陥セグメンテーションにおけるローランド適応(LoRA)をSAM3に適用する。
本稿では,COCOスタイルのクラスラベルインスタンスセグメンテーションから直接,概念実証可能なモデルをトレーニングする監督手順について述べる。
論文 参考訳(メタデータ) (2026-08-31T23:19:59Z) - Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Bit-Identical Medical Deep Learning via Structured Orthogonal Initialization [0.0]
深層学習トレーニングは非決定論的であり、異なるランダムなシードを持つ同一のコードは、集約メトリクスに異を唱えるが個々の予測に異を唱えるモデルを生成する。
ランダム性の3つの源を除去する検証ビット識別訓練の枠組みを提案する。
論文 参考訳(メタデータ) (2026-03-30T05:04:57Z) - Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning [43.11305591635628]
オルモ3-7Bは400サンプルの128エポックで訓練され、51200サンプルの1エポックを12-26ポイント上回った。
トレーニングトークンの精度は、繰り返しが飽和した時に確実にシグナルとなる。
論文 参考訳(メタデータ) (2026-02-11T18:58:54Z) - Architecture-Agnostic Curriculum Learning for Document Understanding: Empirical Evidence from Text-Only and Multimodal [13.329839705160927]
文書理解モデルにおいて,プログレッシブなデータスケジューリングが一貫した効率向上をもたらすかどうかを検討する。
このスケジュールは,6.67から10.0までの有効エポックなデータ削減と合わせて,ウォールクロックのトレーニング時間を約33%短縮することを確認した。
論文 参考訳(メタデータ) (2026-02-02T10:09:26Z) - Rethinking Zero-Shot Time Series Classification: From Task-specific Classifiers to In-Context Inference [34.15455500037426]
我々は、ラベル付きトレーニングセットをコンテキストとして扱い、単一のフォワードパスで全てのテストインスタンスのラベルを予測する、コンテキスト内学習フレームワークTIC-FMを提案する。
TIC-FMは、時系列エンコーダとスプリットメイク潜在メモリ変換器を備えた軽量プロジェクションアダプタをペアリングする。
128のUCRデータセットに対する実験は、極低ラベルの状況で一貫した利得で、強い精度を示す。
論文 参考訳(メタデータ) (2026-01-31T09:17:45Z) - Leveraging Randomness in Model and Data Partitioning for Privacy Amplification [8.52745154080651]
トレーニングプロセスにおける固有のランダム性は、プライバシーの増幅にどのように活用できるかを考察する。
この中には、(1)データパーティショニング、(2)サンプルがトレーニングイテレーションのサブセットのみに参加し、(2)モデルパーティショニング、(2)サンプルがモデルのパラメータのサブセットだけを更新する。
以上の結果から、複雑な方法でデータと相互作用する訓練プロセスのランダム性は、重要なプライバシーの増幅のために体系的に活用できることが示唆された。
論文 参考訳(メタデータ) (2025-03-04T22:49:59Z) - The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning [86.19804569376333]
インストラクションチューニングにおいてゼロショットの一般化は非常に早い段階で起こることを示す。
より基礎的なトレーニングデータアレンジメントフレームワークであるテスト中心型マルチターンアレンジメントを提案する。
論文 参考訳(メタデータ) (2024-06-17T16:40:21Z) - Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language
Models [107.05966685291067]
テスト時間プロンプトチューニング (TPT) を提案し, 適応的なプロンプトを1つのテストサンプルで学習する。
TPTはCLIPのゼロショットトップ1の精度を平均3.6%改善する。
クロスデータセットの一般化を目に見えないカテゴリで評価する際、PTは追加のトレーニングデータを使用する最先端のアプローチと同等に機能する。
論文 参考訳(メタデータ) (2022-09-15T17:55:11Z) - BatchFormer: Learning to Explore Sample Relationships for Robust
Representation Learning [93.38239238988719]
本稿では,各ミニバッチからサンプル関係を学習可能なディープニューラルネットワークを提案する。
BatchFormerは各ミニバッチのバッチ次元に適用され、トレーニング中のサンプル関係を暗黙的に探索する。
我々は10以上のデータセットに対して広範な実験を行い、提案手法は異なるデータ不足アプリケーションにおいて大幅な改善を実現する。
論文 参考訳(メタデータ) (2022-03-03T05:31:33Z) - Uncertainty-aware Self-training for Text Classification with Few Labels [54.13279574908808]
本研究は,アノテーションのボトルネックを軽減するための半教師あり学習手法の1つとして,自己学習について研究する。
本稿では,基礎となるニューラルネットワークの不確実性推定を取り入れて,自己学習を改善する手法を提案する。
本手法では,クラス毎に20~30個のラベル付きサンプルをトレーニングに利用し,完全教師付き事前学習言語モデルの3%以内で検証を行う。
論文 参考訳(メタデータ) (2020-06-27T08:13:58Z) - Pre-training Is (Almost) All You Need: An Application to Commonsense
Reasoning [61.32992639292889]
事前学習されたトランスモデルの微調整は、一般的なNLPタスクを解決するための標準的なアプローチとなっている。
そこで本研究では,可視性ランキングタスクをフルテキスト形式でキャストする新たなスコアリング手法を提案する。
提案手法は, ランダム再起動にまたがって, より安定した学習段階を提供することを示す。
論文 参考訳(メタデータ) (2020-04-29T10:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。