論文の概要: Shaping Persistent Representations from Independent Interactions
- arxiv url: http://arxiv.org/abs/2609.34604v1
- Date: Mon, 28 Sep 2026 08:35:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 12:00:40.779498
- Title: Shaping Persistent Representations from Independent Interactions
- Title(参考訳): 独立相互作用による永続表現の形成
- Abstract要約: SPRIIは、相互作用間の関係を永続的文脈の弱い監視として利用する訓練原理である。
SPRIIは、ダウンストリームタスクのパフォーマンスが平均10%以上、永続的プロパティ読み出しが15%以上であることを示す。
- 参考スコア(独自算出の注目度): 18.806440777491993
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models learn environment dynamics from interaction experience. These dynamics depend on the current state and actions, as well as on properties that persist across interactions. Yet standard predictive training can reduce error using local evidence alone, without organizing persistent information into reusable context. We introduce SPRII, a training principle that uses relations between interactions as weak supervision for persistent context while retaining the learner's native objective. For example, different trajectories of the same system share persistent properties even when their states and actions differ. SPRII uses such relations to guide context learning without numerical property labels. Two composable components encourage contexts from related interactions to agree (Align) and use one interaction's context to predict another's future (Cross). Our analysis distinguishes three linked questions: what persistent information is accessible in the learned context (Formation), how that context influences a fixed predictor (Use), and whether it reduces task error (Value). Success at one stage does not guarantee success at the next. Controlled experiments show that more reliable relations improve representation organization, but adding a shared-property constraint can reduce access to a property that remains shared. Context substitutions change predictions at fixed model weights, while the benefit from history depends on prediction horizon and readout. Evaluations span thirteen settings, including controlled physical systems, public dynamics tasks, robotic and tactile data, and partner interaction, across multiple learner families. Relative to the corresponding baselines, SPRII yields average gains of over 10% in downstream task performance and over 15% in persistent-property readout. The project page is available at https://persistent-learning-review.netlify.app/interactive.html.
- Abstract(参考訳): 世界モデルは相互作用経験から環境力学を学ぶ。
これらのダイナミクスは、現在の状態とアクション、および相互作用間で持続する特性に依存します。
しかし、標準的な予測トレーニングは、永続的な情報を再利用可能なコンテキストにまとめることなく、ローカルエビデンスだけでエラーを減らすことができる。
SPRIIは,学習者のネイティブな目的を維持しつつ,相互作用間の関係を永続的コンテキストの弱い監視として利用する訓練原理である。
例えば、同じシステムの異なる軌跡は、状態や動作が異なる場合でも永続的な性質を共有する。
SPRIIは、そのような関係を利用して、数値的なプロパティラベルなしで文脈学習をガイドする。
2つの構成可能なコンポーネントは、関連する相互作用からコンテキストを奨励し(Align)、1つのインタラクションのコンテキストを使用して、別のインタラクションの将来を予測する(Cross)。
本分析では,学習コンテキスト(フォーメーション)でどのような永続的な情報がアクセス可能か,そのコンテキストが固定予測器(Use)にどのように影響するか,タスクエラー(Value)を低減するか,という,3つの関連した質問を区別する。
ある段階での成功は、次の段階での成功を保証しません。
制御された実験は、より信頼性の高い関係が表現組織を改善することを示しているが、共有プロパティ制約を追加することで、共有されたままのプロパティへのアクセスを減らすことができる。
文脈置換は一定のモデルの重みで予測を変更するが、歴史の利点は予測の水平線と読み出しに依存する。
評価は、コントロールされた物理システム、パブリックダイナミクスタスク、ロボットと触覚データ、そして複数の学習者の家族間でのパートナーインタラクションを含む13の設定にまたがる。
対応するベースラインに対して、SPRIIは、ダウンストリームタスクのパフォーマンスで10%以上、永続的プロパティ読み込みで15%以上、平均的なゲインを得る。
プロジェクトのページはhttps://persistent-learning-review.netlify.app/interactive.htmlで公開されている。
関連論文リスト
- Learning Dynamics of Continual Learning: A Unified View of Data Attribution, Forgetting, and Plasticity Loss [36.55356475801966]
現代の言語モデルは、一度訓練されたり凍結されたりするのではなく、生涯にわたって更新される可能性が高い。
これらの課題は、進化する更新-振る舞いの相互作用によって管理されていることを示す。
論文 参考訳(メタデータ) (2026-09-27T14:38:02Z) - S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? [66.17176838165994]
大規模言語モデル(LLM)は、ますます外部環境と相互作用し、かなりの行動経験を蓄積する。
エージェントがその振る舞いを積極的にテストし、得られた経験を判断し、その経験を使って将来の意思決定を改善することができるかどうかは不明だ。
LLM自己改善評価のための対話型ベンチマークである textbfStextsuperscript3Gym を導入する。
論文 参考訳(メタデータ) (2026-08-31T17:05:41Z) - Learning from the Future: Privileged Self-Distillation for Sequential Recommendation [51.993699802866956]
本稿では,学習時間情報と推論時間情報とを分離するフレームワークを提案する。
Privileged Self-Distillation (PSD)は、学習時間情報を推論時間情報から分離する。
PSDは1つの段階でエンドツーエンドに最適化され、デプロイされたモデルと推論コストは変わらない。
論文 参考訳(メタデータ) (2026-07-29T15:47:22Z) - Learning with Preserving for Continual Multitask Learning [4.847042727427382]
タスク出力の保存から共有表現空間の維持に焦点を移す新しいフレームワークであるLawP(Learning with Preserving)を紹介した。
LwPは破滅的な忘れを緩和するだけでなく、CMTLタスクにおける最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-11-11T22:23:20Z) - Playpen: An Environment for Exploring Learning Through Conversational Interaction [84.0413820245725]
本研究は,対話ゲームが学習のフィードバック信号の源として機能するかどうかを考察する。
本稿では,対話ゲームによるオフラインおよびオンライン学習環境であるPlaypenを紹介する。
SFTによる模倣学習は、目に見えないインスタンスのパフォーマンスを向上させるが、他のスキルに悪影響を及ぼす。
論文 参考訳(メタデータ) (2025-04-11T14:49:33Z) - Multi-Task Self-Supervised Time-Series Representation Learning [3.31490164885582]
時系列表現学習は、時間的ダイナミクスとスパースラベルを持つデータから表現を抽出することができる。
自己教師型タスクの利点を組み合わせた時系列表現学習手法を提案する。
本稿では,時系列分類,予測,異常検出という3つのダウンストリームタスクの枠組みについて検討する。
論文 参考訳(メタデータ) (2023-03-02T07:44:06Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z) - Dynamic Relation Discovery and Utilization in Multi-Entity Time Series
Forecasting [92.32415130188046]
多くの現実世界のシナリオでは、実体の間に決定的かつ暗黙的な関係が存在する可能性がある。
本稿では,自動グラフ学習(A2GNN)を用いたマルチグラフニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2022-02-18T11:37:04Z) - You Mostly Walk Alone: Analyzing Feature Attribution in Trajectory
Prediction [52.442129609979794]
軌道予測のための最近の深層学習手法は有望な性能を示す。
そのようなブラックボックスモデルが実際にどのモデルを予測するために使うのかは、まだ不明である。
本稿では,モデル性能に対する異なるキューの貢献度を定量化する手法を提案する。
論文 参考訳(メタデータ) (2021-10-11T14:24:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。