論文の概要: Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model
- arxiv url: http://arxiv.org/abs/2609.07154v2
- Date: Thu, 10 Sep 2026 07:20:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.05927
- Title: Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model
- Title(参考訳): Ambient @EgoLongQA 2026:Sub-2Bモデルへの長期映像認識の蒸留
- Authors: Logesh Kumar Umapathi,
- Abstract要約: 我々はECCV 2026におけるウェアラブルAIチャレンジのEgoLongQAトラックへの参加について述べる。
我々のシステムは、1つの2Bビジョン言語モデルで、1つの欲求のフォワードパスで10分間のエゴセントリックなビデオについての複数の選択の質問に答える。
- 参考スコア(独自算出の注目度): 0.13537117504260623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We describe our entry to the EgoLongQA track of the Wearable-AI Challenge in ECCV 2026, which placed first in the <=2B parameter division with 0.8279 on the held-out test set. Our system is a single 2B vision-language model that answers multiple-choice questions about ten-minute egocentric videos in one greedy forward pass; It is obtained by distilling the junior perception module of a tool-using agentic pipeline, not the agent itself into a small student, using teacher traces filtered to those that answered correctly. it reaches 89% of the accuracy of the large agentic pipeline using 1.1% of its parameters. This raises a 27.1% base model to 81.4% on our held-out questions. The 2B backbone has 2.2132B parameters and therefore over the divisional limit, to make the entry admissable we prune the multilingual embedding table from 248,320 to 143,469 rows, reaching 1.9985B with provably identical logits on retained rows.
- Abstract(参考訳): 本稿では,ECCV 2026におけるウェアラブルAIチャレンジのEgoLongQAトラックへのエントリーについて述べる。
本システムでは, エージェント自体を小学生にするのではなく, ツールを用いたエージェントパイプラインの下部知覚モジュールを蒸留し, 正解した教師のトレースを用いて, 複数項目の映像の多点選択に答える, 単一の2B視覚言語モデルを構築した。
1.1%のパラメータを使って 大きなエージェントパイプラインの精度の89%に達する。
これにより27.1%のベースモデルを81.4%に引き上げることができた。
2Bのバックボーンは2.2132Bパラメータを持ち、したがって分割極限を超えて、エントリを許容できるように、多言語の埋め込みテーブルを248,320行から143,469行に訓練し、確実に同じロジットを持つ1.9985Bに達する。
関連論文リスト
- Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent [0.0]
アーキテクチャが検証ループをインストールする1つのプロダクションシステムについて検討する。
ループの端から端までを計測し、経験的検証器混同行列を生成する。
論文 参考訳(メタデータ) (2026-07-19T03:20:33Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Disagreement-Based Cross-Model Routing for Implicit Video Question Answering [0.0]
我々はImplicitQAベンチマークを用いて,複数選択のビデオ質問応答について検討した。
このベンチマークでは、単一のフロンティアビデオLLMが、その精度の天井付近ですでに動作している。
ラベルやトレーニングを必要とせず、純粋な推論時間である、不一致に基づくクロスモデルルーティングを提案する。
論文 参考訳(メタデータ) (2026-05-31T05:56:27Z) - Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents [9.457255218406333]
プロダクションAIエージェントは、非常に反復的なユーザ固有のクエリを頻繁に受信する。
この冗長性は会話記憶によって利用でき、コスト負担から効率上の利点へと繰り返し変換される。
論文 参考訳(メタデータ) (2026-03-24T09:55:11Z) - Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1 [0.0]
本稿では,2025の基礎モデルを用いた二値鳥画像分割のための二重パイプラインフレームワークを提案する。
我々は,プロンプトベースのファンデーションモデルパイプラインが,タスク固有のエンドツーエンドのセグメンテーションネットワークより優れていることを示す。
論文 参考訳(メタデータ) (2026-02-26T23:12:17Z) - SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement [100.85923086072204]
我々はThinkLite-VLを紹介した。これは最先端(SoTA)パフォーマンスを実現する視覚推論モデルのファミリーで、トレーニングサンプルの桁数を桁違いに減らしている。
我々はMonte Carlo Tree Search (MCTS) を用いて、各インスタンスの解決に必要な視覚言語モデル(VLM)の推論反復数を用いてサンプルの難易度を測定する。
ThinkLite-VL-7BとThinkLite-VL-72Bは、8つの視覚的推論ベンチマークにおいて、それぞれのベースモデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-04-10T17:49:05Z) - Common 7B Language Models Already Possess Strong Math Capabilities [61.61442513067561]
本稿では,LLaMA-2 7Bモデルと事前学習を併用したモデルが,すでに強力な数学的能力を示していることを示す。
拡張スケーリングの可能性は、公開されている数学の質問の不足によって制限されている。
論文 参考訳(メタデータ) (2024-03-07T18:00:40Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z) - DeBERTa: Decoding-enhanced BERT with Disentangled Attention [119.77305080520718]
2つの新しい手法を用いてBERTモデルとRoBERTaモデルを改善する新しいモデルアーキテクチャDeBERTaを提案する。
これらの手法により,モデル事前学習の効率化と,自然言語理解(NLU)と自然言語生成(NLG)の両方の性能向上が期待できる。
論文 参考訳(メタデータ) (2020-06-05T19:54:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。