論文の概要: Beyond End-Task Success: How to Audit Visual Experience Retrieval in Robotics
- arxiv url: http://arxiv.org/abs/2609.26567v1
- Date: Tue, 22 Sep 2026 15:18:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.723552
- Title: Beyond End-Task Success: How to Audit Visual Experience Retrieval in Robotics
- Title(参考訳): エンドツーエンドの成功を超えて - ロボティクスにおける視覚的エクスペリエンスの検索方法
- Abstract要約: ほとんどの評価では、選択した経験の成功のみを報告します。
ルールではなくライブラリを記述するスコアは、フィールドが次に構築したものを誤解させる。
すべての選択肢の結果が知られているので、スコアはシーン毎の選択やライブラリの品質にトレースすることができる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robots that store past experiences must select which one to reuse in a new scene. Most systems select by visual similarity, and most evaluations report only the success of the selected experience. That number does not show whether the selection was good: a rule can score well by repeatedly using one broadly transferable experience, or poorly because its preferred experience is weak. Since robots increasingly adapt by reuse rather than retraining, a score that describes the library rather than the rule misleads what the field builds next. We contribute an audit methodology: execute every stored experience in every query scene, over two manipulation tasks, three reuse mechanisms, and libraries of $K=3$, $10$, and $50$. Because every alternative's outcome is known, a score can be traced to per-scene selection or to library quality. The audited rules select by nearest-neighbor distance in five visual embeddings, from raw pixels to CLIP. (1) One fixed experience, chosen with hindsight, captures 30-58% of the gap between random selection and an oracle; per-scene selection competes for the remaining 0.07-0.15 in success rate. (2) At $K\ge10$, visual rules concentrate on one experience 1.5-3 times more than the oracle does, and their scores then follow that experience's quality. (3) Wherever a rule differs significantly from a shuffle that keeps its selection rates but pairs them with scenes at random, the rule is worse, for every learned image policy. (4) Visual distance predicts well whether a given pair will succeed (AUROC up to 0.96), yet ranks the candidates within one scene no better than chance for four of five embeddings at $K=50$ (AUROC 0.45-0.52). Exhaustive execution is usually infeasible, so the audit reduces to two cheap reports any study can give: the distribution of selected experiences, and the success of the best single experience in hindsight.
- Abstract(参考訳): 過去の体験を保存しているロボットは、新しいシーンで再利用するロボットを選択する必要がある。
ほとんどのシステムは視覚的類似性によって選択され、ほとんどの評価は選択した経験の成功のみを報告します。
この数字は、選択が良いかどうかを示さない: ルールは、広範に転送可能な経験を繰り返し使用することで、良いスコアを得られるか、または、その好ましくない経験が弱いため、悪い値を示す。
ロボットは再トレーニングではなく再利用によって適応する傾向にあるので、ルールではなくライブラリを記述するスコアは、フィールドが次に構築するものを誤解させる。
2つの操作タスク、3つの再利用メカニズム、そして$K=3$、10$、50$のライブラリです。
すべての選択肢の結果が知られているので、スコアはシーン毎の選択やライブラリの品質にトレースすることができる。
監査されたルールは、生のピクセルからCLIPまでの5つの視覚的埋め込みにおいて、最寄りの距離で選択される。
1) ランダム選択と託宣のギャップの30~58%を後視で選択した固定経験が, 残り0.07~0.15を成功率で獲得した。
2)K\ge10$では、視覚的なルールは託宣の1.5~3倍の体験に集中し、それらのスコアはその経験の質に従う。
3) 規則が選択率を保ちながらランダムなシーンと組み合わせるシャッフルとは大きく異なるが,学習された画像ポリシーのすべてにおいて,ルールはより悪い。
(4) 視覚距離は、与えられたペアが成功するかどうか(AUROCが0.96まで)をよく予測するが、5つの埋め込みのうち4つが$K=50$(AUROC 0.45-0.52)(AUROC 0.45-0.52)(英語版))となる可能性は低い。
通常、排他的実行は不可能であるため、監査は、任意の研究で得られる2つの安価なレポートに還元される。
関連論文リスト
- Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use [54.30773141960395]
マルチターンインタラクションにおけるトレーニング可能な状態を特定するために、Critical-State RLを導入する。
それぞれの報酬がタスク成功に対するアクションの効果を捉えているかどうか、参照ポリシーよりも改善できるかどうかを評価する。
Berkeley Function Calling Leaderboard (BFCL) v4の実験では、診断選択された州でのトレーニングと代替州でのトレーニングを比較している。
論文 参考訳(メタデータ) (2026-09-21T17:57:20Z) - Are Coreset Selection Methods Worth Their Cost? [9.563027159959587]
Coreset選択は、ラベル付きトレーニングセットの代表的なサブセットを選択して、トレーニングを安くする。
ダウンストリームトレーニングを標準化し、同じ監査可能なウォールクロック予算に選択とトレーニングを課金するエンドツーエンドベンチマークを導入する。
CIFAR-10とTiny ImageNetの8つの壁面の予算アンカーで、洗練されたセレクタがアンカーに勝つことはない。
論文 参考訳(メタデータ) (2026-09-19T08:58:52Z) - S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? [66.17176838165994]
大規模言語モデル(LLM)は、ますます外部環境と相互作用し、かなりの行動経験を蓄積する。
エージェントがその振る舞いを積極的にテストし、得られた経験を判断し、その経験を使って将来の意思決定を改善することができるかどうかは不明だ。
LLM自己改善評価のための対話型ベンチマークである textbfStextsuperscript3Gym を導入する。
論文 参考訳(メタデータ) (2026-08-31T17:05:41Z) - Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation [52.58737865652009]
NLPにおけるMultiple-choice Question answering (MCQA)ベンチマークは、数右スコアリング(精度)を用いる。
教育試験において、スコアリング方式は、応答モードモデルが従うこと、および応答のグレーディングルールの組み合わせであり、どの能力に報酬を与えるかを規定する重要な設計選択である。
我々は、MCQAが6つの教育にインスパイアされた6つのスキームで、正確性を超えた能力を評価することで、数字右の代替手段がどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-08-30T16:35:22Z) - Moving the Mean Toward the Known Good, Not Beyond It: What Inference-Time Interventions and Weight Consolidation Buy in Open-Ended Generation [0.0]
オンラインのビンパッキングで生成、セレクト、LoRAの統合のサイクルでは、候補に対するトレーニングは、保持された変種で書かれたものを価値にシフトする。
確認バッテリーは、すべての手順を3回複製し、新鮮な種と、正確に1回だけ読み取られた未解決の保留セットを格納する。
最もよく観察された候補は、正確には古典的なアウトのレベル(全3系統で0.021028)に移行し、ランダムな制御のために移動した。
The tails cut both way: the per-candidate rate of better-than-classic candidate (10% to 3)
論文 参考訳(メタデータ) (2026-08-28T21:41:17Z) - Counterfactual Bias Testing for Application Tracking System [1.007765066765576]
本稿では,タスク特化LDMエージェントを用いて,アイデンティティニュートラルベース履歴を合成し,人口統計学的治療を注入する。
それは、微調整された文埋め込みモデルとコサイン類似性を通じて、ジョブ記述に対する候補をランク付けする。
カウンターファクトアル(スコアデルタ、平均絶対ランク変更、フリップレート)、グループフェアネス(トップK保持、4/5/インパクト比)、メリットアウェア(リコール@K、nDCG@K、平等機会、等化オッズ)にまたがる9メトリックフェアネススイートを計算する。
論文 参考訳(メタデータ) (2026-08-27T10:01:36Z) - Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - Towards Compute-Optimal Many-Shot In-Context Learning [69.38428467281862]
マルチショットICLにおけるデモ選択のための2つの戦略を提案する。
最初の方法は、テストサンプルの類似性に基づいて選択された少数のデモと、キャッシュされるランダムなデモの集合を組み合わせる。
第2の戦略は、ランダムなデモをk平均クラスタリングによるテストサンプル表現から選択したセントロイドに置き換えることによって、第1の戦略を改善する。
論文 参考訳(メタデータ) (2025-07-22T04:21:03Z) - Improving the Computational Efficiency of Adaptive Audits of IRV Elections [54.427049258408424]
AWAIREは、任意の数の候補でIRVコンテストを監査できるが、当初の実装では、候補数とともに指数関数的に増加するメモリと計算コストが増大していた。
本稿では,従来の6候補と比較して,55候補のIRVコンテストを実際に実施する3つの方法で,AWAIREのアルゴリズム実装を改善した。
論文 参考訳(メタデータ) (2024-07-23T13:28:00Z) - Beyond Greedy Search: Tracking by Multi-Agent Reinforcement
Learning-based Beam Search [103.53249725360286]
既存のトラッカーは通常、フレーム毎のトラッキング結果として最大スコアの場所または提案を選択する。
本稿では,この問題に対処するために,新しいマルチエージェント強化学習に基づくビームサーチ戦略(BeamTracking と呼ばれる)を提案する。
論文 参考訳(メタデータ) (2022-05-19T16:35:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。