論文の概要: Ambient @ EgoProactive 2026 : Proactive Egocentric Assistance with Visually Grounded Supervision
- arxiv url: http://arxiv.org/abs/2609.07099v2
- Date: Thu, 10 Sep 2026 07:26:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.256336
- Title: Ambient @ EgoProactive 2026 : Proactive Egocentric Assistance with Visually Grounded Supervision
- Title(参考訳): Ambient @EgoProactive 2026 : 視覚的接地によるアクティブなエゴセントリック支援
- Authors: Logesh Kumar Umapathi,
- Abstract要約: 我々はECCV 2026 Wearable AI ChallengeのEgoProactiveトラックに応募する。
このタスクでは、ウェアラブルアシスタントが、8秒間のエゴセントリックなビデオのそれぞれに介入するか、沈黙を保つかを判断する必要がある。
- 参考スコア(独自算出の注目度): 0.13537117504260623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present our submission to the EgoProactive track of the ECCV 2026 Wearable AI Challenge, which ranked first in the large-model division and second in the <=2B division. The task requires a wearable assistant to decide after each eight-second segment of egocentric video whether to intervene or remain silent. Our approach has two main components. First, we reformulate intervention timing as single-token classification. Rather than generating either $interrupt$<utterance> or $silent$, the model predicts yes or no, and we derive the decision from the renormalised probabilities of these two tokens. This formulation improved macro-F1 by 0.249 and G-mean by 0.30 over free-form generation. Second, because labelled data were limited to the released validation set, we generated additional supervision using a tool-calling video agent that inspects each clip and assigns intervention timestamps. A narration-only alternative was four times larger and ten times cheaper, but transferred worse than supervision from an unrelated real corpus, suggesting that visual grounding is more important than annotation volume for this task.
- Abstract(参考訳): 我々は,ECCV 2026 Wearable AI ChallengeのEgoProactiveトラックに応募し,<=2Bディビジョンで第1位,<=2Bディビジョンで第2位となった。
このタスクでは、ウェアラブルアシスタントが、8秒間のエゴセントリックなビデオのそれぞれに介入するか、沈黙を保つかを判断する必要がある。
このアプローチには2つの主要なコンポーネントがあります。
まず、介入タイミングをシングルトークン分類として再構成する。
Interrupt$<utterance> または $silent$ を生成する代わりに、モデルは yes または no を予測し、これらの2つのトークンの再正規化確率から決定を引き出す。
この定式化によりマクロF1は0.249倍、G平均は0.30倍向上した。
第2に、ラベル付きデータはリリースされた検証セットに限られていたため、各クリップを検査し、介入タイムスタンプを割り当てるツールコールビデオエージェントを使用して、追加の監視を発生させた。
ナレーションのみの代替案は4倍大きく10倍安かったが、無関係な実コーパスからの監督よりも悪化しており、視覚的なグラウンドニングがこのタスクのアノテーションボリュームよりも重要であることが示唆された。
関連論文リスト
- Attention Capture Is Not Detection: A Two-Stage Account of How Humans Miss Localized AI Image Edits [0.0]
AI生成の画像編集を抑制するプラットフォームは、検出可能性を単一の未分化プロパティとして扱う。
編集領域はアテンションキャプチャを駆動し、意味的妥当性は判断精度とルック・ブ・フェイル・トゥ・シー(LBFS)エラー率を駆動する。
論文 参考訳(メタデータ) (2026-08-14T01:26:00Z) - Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models [54.097381112138]
現在の自己進化型LMMは、イメージキャプションや視覚的質問応答といった視覚言語理解タスクに苦慮している。
モデルの視覚条件を直接正規化する,純粋に教師なしの自己進化型フレームワークであるVISEを提案する。
VISEは、専門的な役割、外部報酬モデル、アノテーションなしで単一のモデル内で動作します。
論文 参考訳(メタデータ) (2026-06-25T17:59:55Z) - Looking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM Agents [0.4855342112648282]
LLMエージェントは誤呼ツールであり、自然の推測では、モデルは混み合ったハーネスで適切なツールを見られなかった。
レンズコンカレントな作業セットは別として、ラベル付きツール定義セグメントに対するモデルの注意を、その逆で示します。
論文 参考訳(メタデータ) (2026-06-15T07:58:56Z) - PURGE: Projected Unlearning via Retain-Guided Erasure [5.069332646113575]
PURGEは、単純だが未発見の観測(継続学習(CL)と機械未学習(MU))に基づいて構築された機械学習アルゴリズムである。
CLは古いタスクを忘れずに新しいタスクを学習しようとします。MUは、反対方向に同じ根底にある緊張力を表す保持パフォーマンスを損なうことなく、特定のデータを消去しようとします。
PURGEは、MIA AUROCを0.5(理想)に近い精度で達成し、勾配上昇、KLユニフォーム、プライバシーユーティリティフロンティアのいくつかのベースラインを達成しながら、常に96%以上の精度を維持している。
論文 参考訳(メタデータ) (2026-06-02T15:53:01Z) - Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect [0.0]
本研究は,小言語モデルが内的アクティベーションを検出・報告できるかどうかを考察する。
まず,先行研究で使用される二項検出パラダイムが,質問内容に関係なく肯定的応答に偏りを示すため,小さなモデルで構築されていることを示す。
次に、モデル自身の摂動前進パスから構築した文局在化例を教師付き微調整するEmphIntrospection Fine-Tuning(IFT)を導入する。
論文 参考訳(メタデータ) (2026-05-08T05:30:26Z) - Clustered Switchback Designs for Experimentation Under Spatio-temporal Interference [44.644520116360106]
我々は, 平均治療効果 (GATE) を推定し, 全単位を常に治療やコントロールに曝露した平均結果の差を推定した。
そこで我々は,単位をクラスタにグループ化し,時間ステップをブロックにグループ化する,クラスタ化されたスイッチバック設計を提案する。
良好なクラスタリングを許容するグラフに対して, トラッピングされたHorvitz-Thompson推定器が$tilde O(1/NT)$平均二乗誤差(MSE)を達成することを示す。
我々の結果は、citethu2022switchback、ugander2013graph、citetleung2022rateの結果を同時に一般化する。
論文 参考訳(メタデータ) (2023-12-25T01:00:58Z) - WR-ONE2SET: Towards Well-Calibrated Keyphrase Generation [57.11538133231843]
キーワード生成は、入力文書を要約する短いフレーズを自動的に生成することを目的としている。
最近登場したONE2SETパラダイムは、キーフレーズをセットとして生成し、競争性能を達成した。
本稿では, ONE2SET を拡張した WR-ONE2SET を提案する。
論文 参考訳(メタデータ) (2022-11-13T09:56:24Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z) - Cross-Model Pseudo-Labeling for Semi-Supervised Action Recognition [98.25592165484737]
CMPL(Cross-Model Pseudo-Labeling)と呼ばれる,より効果的な擬似ラベル方式を提案する。
CMPLは、それぞれRGBモダリティとラベル付きデータのみを使用して、Kinetics-400とUCF-101のTop-1の精度を17.6%と25.1%で達成している。
論文 参考訳(メタデータ) (2021-12-17T18:59:41Z) - Completely Self-Supervised Crowd Counting via Distribution Matching [92.09218454377395]
我々は,密集した群集数に対するトレーニングモデルに対する完全な自己超越的アプローチを提案する。
トレーニングに必要な入力は、大量の未ラベルの群衆画像以外は、群衆数に近似した上限である。
提案手法は,自然群集が逆伝播の誤り信号を生成するために利用可能な電力法分布に従うという考え方に富む。
論文 参考訳(メタデータ) (2020-09-14T13:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。