論文の概要: The Latent That Never Was: A Forensic Re-run of the CVAE Ablation in Action Chunking Transformer
- arxiv url: http://arxiv.org/abs/2609.16745v1
- Date: Tue, 15 Sep 2026 07:18:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.385884
- Title: The Latent That Never Was: A Forensic Re-run of the CVAE Ablation in Action Chunking Transformer
- Title(参考訳): CVAEアブレーションの法医学的再実行:アクションチャンキング変圧器
- Abstract要約: Action Chunking Transformer (ACT)は、デモからロボット操作を学ぶために広く使われている。
条件付き変分オートエンコーダは、トレーニング中にデモの違いをキャプチャするエンコーダを含む。
ACTの論文は、エンコーダの除去によって、人間の実演でシミュレーションされた2つのタスクにおいて、平均成功率が35%から2%に低下したと報告した。
私たちは、このアブレーションを元のコードで再分類し、結果が実装やトレーニングデータに依存するかどうかを確認します。
- 参考スコア(独自算出の注目度): 3.4858077573471102
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Action Chunking Transformers (ACT) are widely used to learn robot manipulation from demonstrations. Their conditional variational autoencoder includes an encoder meant to capture differences between demonstrations during training. The original ACT paper reported that encoder removal dropped the mean success rate from 35% to 2% on two simulated tasks with human demonstrations. We re-ran this ablation in the original code and checked whether the findings depend on the implementation or training data. The published drop does not reappear in our tests, although smaller gains or losses in success rate remain uncertain. To investigate the discrepancy, we varied training length and how checkpoints are selected for evaluation. Both can reverse which policy scores higher, but the published drop's cause remains unknown. Success rates alone leave open whether the encoder provides information that helps the policy reconstruct demonstrated actions. On the tested ACT benchmark, the sampled latent provides little reconstruction benefit at every tested nonzero weight of the penalty on latent information. At inference, ACT leaves this latent unused and sets it to zero. Skipping the encoder increases training throughput in both implementations we timed. We release code, evaluation tools and results so others can repeat the comparisons and test the encoder on other tasks.
- Abstract(参考訳): Action Chunking Transformer (ACT)は、デモからロボット操作を学ぶために広く使われている。
条件付き変分オートエンコーダは、トレーニング中にデモの違いをキャプチャするエンコーダを含む。
ACTの論文は、エンコーダの除去によって、人間の実演でシミュレーションされた2つのタスクにおいて、平均成功率が35%から2%に低下したと報告した。
私たちは、このアブレーションを元のコードで再分類し、結果が実装やトレーニングデータに依存するかどうかを確認します。
公表された減少は我々のテストで再び現れないが、成功率の低下や損失は依然として不確実である。
相違点を検討するため,トレーニング長とチェックポイントの選択方法について検討した。
どちらの政策スコアが高いかはどちらも逆転できるが、公表された落差の原因は未だ不明である。
成功率だけでは、エンコーダが実証された行動の再構築に役立つ情報を提供するかどうかを公表しない。
テストされたACTベンチマークでは、サンプリングされた潜伏剤は、潜伏情報に対するペナルティの非ゼロウェイト毎にほとんど再構成の利益を提供しない。
推理において、ACT はこの未使用のまま残し、ゼロに設定する。
エンコーダをスキャッピングすると、両方の実装でトレーニングのスループットが向上します。
コードや評価ツール、結果を公開して、他のタスクとの比較を繰り返し、エンコーダを他のタスクでテストできるようにします。
関連論文リスト
- Latent Programming Horizons in Coding Agents [6.8463578914435645]
ソフトウェアエンジニアリングタスクを解決するコーディングエージェントは、コードの推論、編集、テストの実行に数十ステップを費やしている。
符号化エージェントによる言語モデルの残余ストリームは、進化するプログラムの特性を線形にエンコードすることを示す。
将来の編集結果を予測するために訓練されたプローブは、パフォーマンスを最大25ステップまで向上させる。
論文 参考訳(メタデータ) (2026-07-06T15:08:26Z) - When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signals [11.280037154530847]
LLMの強化学習はハッキングに対して脆弱である。
本研究では,環境操作設定を用いたコーディング作業におけるこの現象について検討する。
本稿では,ショートカットのコンセプトスコアをGRPOの利点計算に統合したアドバンテージ修正を提案する。
論文 参考訳(メタデータ) (2026-04-01T23:33:08Z) - DeDe: Detecting Backdoor Samples for SSL Encoders via Decoders [6.698677477097004]
自己教師付き学習(SSL)は、大量のラベルのないデータで高品質な上流エンコーダのトレーニングに広く利用されている。
Victim encodersは、インプットとターゲットの埋め込みを関連付け、インプットがアクティブになったときに下流のタスクが意図しない動作を継承する。
本稿では,被害者エンコーダの入力によって引き起こされるバックドアマッピングの活性化を検出する新しい検出機構であるDeDeを提案する。
論文 参考訳(メタデータ) (2024-11-25T07:26:22Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval? [99.87554379608224]
クロスエンコーダのクロスモーダル類似度スコア分布は、二重エンコーダの結果がほぼ正常である間により集中する。
強陰性間の相対的な順序だけが有効な知識を伝達する一方、容易な負性間の順序情報はほとんど意味を持たない。
本研究では, コントラスト学習を用いて, 硬質負試料間の相対的な順序を模倣することを目的とした, コントラスト部分式蒸留法を提案する。
論文 参考訳(メタデータ) (2024-07-10T09:10:01Z) - Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly
Detectors [117.61449210940955]
ビデオフレームレベルで適用された軽量マスク付きオートエンコーダ(AE)に基づく効率的な異常事象検出モデルを提案する。
動き勾配に基づく重みトークンへのアプローチを導入し、静的背景シーンから前景オブジェクトへ焦点を移す。
トレーニングビデオの強化のために合成異常事象を生成し,マスク付きAEモデルを用いてオリジナルのフレームを共同で再構築する。
論文 参考訳(メタデータ) (2023-06-21T06:18:05Z) - Noise-Robust Dense Retrieval via Contrastive Alignment Post Training [89.29256833403167]
Contrastive Alignment POst Training (CAPOT) は、指数再生を必要とせず、モデルロバスト性を改善する高効率な微調整法である。
CAPOTはドキュメントエンコーダを凍結することで堅牢な検索を可能にし、クエリエンコーダはノイズの多いクエリを修正されていないルートに整列させる。
MSMARCO、Natural Questions、Trivia QAパス検索のCAPOTノイズ変動を評価し、CAPOTがオーバーヘッドを伴わないデータ増大に類似した影響があることを発見した。
論文 参考訳(メタデータ) (2023-04-06T22:16:53Z) - One-to-Few Label Assignment for End-to-End Dense Detection [19.497115000680076]
1対1(o2o)ラベル割り当ては、トランスフォーマーベースのエンドツーエンド検出において重要な役割を果たす。
エンドツーエンドの高密度検出のための単純な1対1 (o2f) ラベル割り当て戦略を提案する。
論文 参考訳(メタデータ) (2023-03-21T03:24:47Z) - Robustness of Unsupervised Representation Learning without Labels [92.90480374344777]
モデルとタスクに依存しない,ラベルのない,教師なしのロバストネス尺度のファミリーを提案する。
本研究は, 線形プローブによる検証を行い, MOCOv2の場合, 対向トレーニングの結果が3倍の精度で得られたことを示す。
論文 参考訳(メタデータ) (2022-10-08T18:03:28Z) - PoisonedEncoder: Poisoning the Unlabeled Pre-training Data in
Contrastive Learning [69.70602220716718]
コントラスト学習のためのデータ中毒攻撃であるPoisonedEncoderを提案する。
特に、攻撃者は未ラベルの事前訓練データに慎重に毒を盛った入力を注入する。
我々は,PoisonedEncoderに対する5つの防御効果を評価し,前処理が1つ,内処理が3つ,後処理が1つであった。
論文 参考訳(メタデータ) (2022-05-13T00:15:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。