論文の概要: Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training
- arxiv url: http://arxiv.org/abs/2607.00368v1
- Date: Wed, 01 Jul 2026 03:07:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.698833
- Title: Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training
- Title(参考訳): 複雑さを超えて - LLMテストタイムトレーニングにおけるデプロイメントメモリクレームの振る舞い評価フレームワーク
- Abstract要約: 大規模言語モデルテストタイムトレーニング(TTT)は、しばしばローカルプロキシメトリクスによって評価される。
TTTメモリを校正する行動評価フレームワークを導入する。
- 参考スコア(独自算出の注目度): 30.22002300048916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model test-time training (TTT) is often evaluated through local proxy metrics: models are updated on recent tokens, retrieved context, target-domain data, or verifiable task attempts, and then judged by perplexity, future-token loss, long-context performance, or reward. These metrics are well matched to claims about stream adaptation, domain adaptation, context compression, and reward-backed test-time improvement. They are weaker evidence, however, for a capability that TTT results are increasingly used to motivate: deployed assistant memory, personalization, or sparse post-deployment learning, which instead requires behavioral evidence such as later recall, paraphrase robustness, retention, locality, conflict handling, and use in downstream actions after the original support context is removed. We introduce a behavioral evaluation framework that calibrates TTT memory claims to the evidence that supports them. It has two components: a claim-calibrated evidence ladder that separates stream/domain adaptation, bridge internalization, and deployment-time behavioral learning; and an evaluation protocol with matched explicit-memory baselines and mutually exclusive failure categories. We validate the framework by auditing recent TTT and memory-adjacent work and by instantiating it as a controlled diagnostic in which, in a sparse nonce-fact setting, one-step LoRA updates lower support and answer loss across three Qwen3 model scales while generated free-form recall stays at zero, exposing a measurable gap between proxy improvement and deployment behavior. The framework gives authors and evaluators a concrete standard for aligning TTT memory claims with the evidence actually reported.
- Abstract(参考訳): 大規模な言語モデルテストタイムトレーニング(TTT)は、しばしばローカルプロキシメトリクスを通じて評価される。最近のトークン、検索されたコンテキスト、ターゲットドメインデータ、検証可能なタスク試行に基づいてモデルが更新され、複雑度、将来的な損失、長期コンテキストのパフォーマンス、報酬によって判断される。
これらのメトリクスは、ストリーム適応、ドメイン適応、コンテキスト圧縮、報奨付きテスト時間の改善に関する主張とよく一致します。
デプロイされた補助記憶、パーソナライゼーション、またはスパースなポストデプロイ学習は、代わりに、後のリコール、パラフレーズの堅牢性、保持、局所性、コンフリクトハンドリング、元のサポートコンテキストが削除された後、下流アクションでの使用といった行動的エビデンスを必要とする。
TTTメモリを校正する行動評価フレームワークを導入する。
ストリーム/ドメイン適応、ブリッジ内部化、デプロイメント時の振る舞い学習を分離するクレーム校正されたエビデンスラグ、明示的なメモリベースラインと相互に排他的な障害カテゴリを備えた評価プロトコルである。
我々は,最近のTTTおよびメモリ隣接処理を監査し,かつ,その制御された診断として,一段階のLoRAが3つのQwen3モデルスケールに対するサポートと回答の損失を低減し,フリーフォームのリコールをゼロに保ちながら,プロキシ改善とデプロイメント動作の間に測定可能なギャップを露呈する,制御された診断手法として検証する。
このフレームワークは、著者や評価者に対して、TTTメモリクレームを実際に報告された証拠と整合させるための具体的な標準を提供する。
関連論文リスト
- RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails [6.708653593551749]
我々は,MLLMの継続的な適応が,その答えだけでなく,視覚的,テキスト的,OCR,チャート,文書的エビデンスをいかに活用するかを考察する。
モデルが異なるあるいは根拠のないエビデンスチャネルに静かに移行している間に、解答精度を保ちながら、エンフィデントエビデンス利用の忘れを識別する。
我々は,リプレイ不要な依存制約付き連続学習フレームワークであるtextscRCLを提案する。
論文 参考訳(メタデータ) (2026-07-02T10:50:37Z) - EVAF: A Test-Retest Protocol for Selective Parametric Consolidation [0.0]
本稿では,LRA統合のためのEcho-Valence Attractor Field機構であるEVAFを紹介する。
GPT-2 と TinyLlama 全体で、EVAF は高頻度で高サプライズな体験を優先的に統合する。
テスト-再テスト測定では, 凍結, 検索のみ, アンゲートの連続更新ベースラインよりも, 干渉後の動作持続性が強いことが示された。
論文 参考訳(メタデータ) (2026-06-29T07:53:50Z) - The Evaluation Game: Beyond Static LLM Benchmarking [2.168753020470345]
本稿では,評価者とトレーナーの相互作用を2人プレイヤゲームとして形式化するゲーム理論フレームワークを提案する。
モデルの局所性依存性を示す実証的証拠を提供する。
ベンチマークは静的なプロンプトのセットではなく,評価者のグループアクションの下での軌道である。
論文 参考訳(メタデータ) (2026-05-19T05:22:21Z) - Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation [18.70132691409063]
Test-Time Adaptationは、推論時間におけるトレーニングとテストドメイン間の分散シフトを軽減することを目的としている。
ドメインとセマンティックシフトの結合は、しばしば特徴空間を崩壊させ、分類とアウト・オブ・ディストリビューションの検出の両方を著しく劣化させる。
ドメイン適応とOOD検出を相乗的で閉ループで堅牢に行う軽量かつ効果的なフレームワークであるDOCOを提案する。
論文 参考訳(メタデータ) (2026-04-23T15:29:29Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search [26.52140212357349]
テキストベースの人物検索は、厳格なプライバシー制約と手動アノテーションの高コストによって引き起こされるデータ不足により、固有の制限に直面している。
既存の手法は通常、合成人体カプセルデータに基づいてモデルを事前訓練するPretrain-then-Finetuneパラダイムに依存している。
オフラインテスト時間適応方式により、広範囲なターゲットドメインの監視に依存しない新しいPretrain-then-Adaptパラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-07T07:48:15Z) - The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior [58.751981587234916]
本稿では,Refinement Provenance Inference (RPI)監査タスクをRefinement Provenance Inference (RPI)として定式化する。
本稿では,ロジットレベルの信号で教師が強制する可能性機能を融合させるロジットベースのフレームワークであるReProを提案する。
トレーニング中、ReProはシャドウファインチューニングを通じて転送可能な表現を学び、訓練データアクセスなしで、見えない犠牲者の証明を推測するために軽量のリニアヘッドを使用する。
論文 参考訳(メタデータ) (2026-01-05T10:16:41Z) - Memory in Large Language Models: Mechanisms, Evaluation and Evolution [8.158439933515131]
我々は,4つの分類法(パラメトリック,文脈,外部,手続き/エピソード)とメモリ四倍法(ロケーション,永続性,書き込み/アクセスパス,制御性)を提案する。
DMM Gov: DAPT/TAPT, PEFT, モデル編集(ROME, MEND, MEMIT, SERAC)、RAGをコーディネートして監査可能なループを形成する。
これにより、再現可能で、同等で、統制可能な、研究と展開のための座標系が得られる。
論文 参考訳(メタデータ) (2025-09-23T10:06:58Z) - BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping [64.8477128397529]
本稿では,テスト時間適応フレームワークを提案する。
我々は、インスタンスに依存しない履歴サンプルとインスタンスを意識したブースティングサンプルから特徴を検索するための軽量なキー値メモリを維持している。
理論的には,本手法の背後にある合理性を正当化し,アウト・オブ・ディストリビューションとクロスドメイン・データセットの両方において,その有効性を実証的に検証する。
論文 参考訳(メタデータ) (2024-10-20T15:58:43Z) - Mitigating Catastrophic Forgetting in Task-Incremental Continual
Learning with Adaptive Classification Criterion [50.03041373044267]
本稿では,継続的学習のための適応型分類基準を用いた教師付きコントラスト学習フレームワークを提案する。
実験により, CFLは最先端の性能を達成し, 分類基準に比べて克服する能力が強いことが示された。
論文 参考訳(メタデータ) (2023-05-20T19:22:40Z) - A Closer Look at Temporal Sentence Grounding in Videos: Datasets and
Metrics [70.45937234489044]
2つの広く使用されているTSGVデータセット(Charades-STAとActivityNet Captions)を再編成し、トレーニング分割と異なるものにします。
基本的なIoUスコアを校正するために、新しい評価基準「dR@$n$,IoU@$m$」を導入する。
すべての結果は、再編成されたデータセットと新しいメトリクスがTSGVの進捗をよりよく監視できることを示している。
論文 参考訳(メタデータ) (2021-01-22T09:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。