論文の概要: VisualClaw: A Real-Time, Personalized Agent for the Physical World
- arxiv url: http://arxiv.org/abs/2606.16295v1
- Date: Mon, 15 Jun 2026 06:58:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.129765
- Title: VisualClaw: A Real-Time, Personalized Agent for the Physical World
- Title(参考訳): VisualClaw:物理世界のためのリアルタイムパーソナライズされたエージェント
- Authors: Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao, Cihang Xie,
- Abstract要約: 2つの原則に基づいて構築された自己進化型マルチモーダルエージェントであるVisualClawを紹介する。
第一に、ハイブリッド符号化は、情報の少ないストリーミングフレームをカスケードゲートでフィルタリングすることにより、デプロイメントコストを低減する。
第二に、スキルの進化により、エージェントは失敗から学び、将来の質問に役立つスキルバンク更新を生成する。
- 参考スコア(独自算出の注目度): 76.89211120690028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision language models are serving as general-purpose interfaces for complex multimodal tasks. However, deployment still faces three gaps: VLMs typically incur high latency and cost when processing dense video frames and long prompts, the agent scaffold remains static after deployment, and standard video-QA benchmarks do not test whether agents can use visual evidence inside tool-using workspaces. We present VisualClaw, a self-evolving multimodal agent built around two principles. First, hybrid encoding reduces deployment cost by filtering less informative streaming frames with a cascaded gate and compressing the text skill bank through hot/cold top-k injection. Second, skill evolution lets the agent learn from failures: retrieved memories condition an evolver as direct concatenated context or as guided evidence, producing skill-bank updates that help future questions. Across 4 video-QA benchmarks with 2 VLMs, VisualClaw cuts per-question API cost by an average -98% versus full-frame upload and by -25.9% over the offline uniform 8 frame baseline, while boosting accuracy in most settings, e.g., an average +3.85% and a peak +15.80% on EgoSchema with Gemini 3 Flash. To address the gap, we curate VisualClawArena, a 200-scenario multimodal agentic benchmark built through a strict five-stage pipeline; models must use video evidence, documents, dynamic updates, and executable checks inside a workspace. On VisualClawArena, the same framework with computer-use agent backends improves macro accuracy by +2.9% for Codex (GPT-5.5) and +3.2% for Claude Code (Sonnet 4.6) over no-evolution baselines, with a -9.5% cost reduction compared to the uniform-sampled baseline. These properties make VisualClaw a natural fit for edge applications, where the cascade reduces a 1-hour streaming session from ~3,600 API uploads down to only 5-20 calls and the self-evolution makes it a perfect personalized assistant.
- Abstract(参考訳): 視覚言語モデルは複雑なマルチモーダルタスクのための汎用インタフェースとして機能している。
しかし、デプロイには3つのギャップがある: VLMは一般的に、高密度のビデオフレームとロングプロンプトを処理する際に、高いレイテンシとコストを発生させ、エージェントの足場はデプロイ後に静的のままであり、標準のビデオQAベンチマークでは、ツールを使用するワークスペース内で、エージェントが視覚的エビデンスを使用できるかどうかを検証していない。
2つの原則に基づいて構築された自己進化型マルチモーダルエージェントであるVisualClawを紹介する。
第一に、ハイブリッドエンコーディングは、情報を少ないストリーミングフレームをカスケードゲートでフィルタリングし、ホット/コールドトップkインジェクションを通じてテキストスキルバンクを圧縮することにより、デプロイメントコストを低減する。
第2に、スキルの進化によって、エージェントは失敗から学ぶことができる: 取り出した記憶条件は、直接結合されたコンテキストまたはガイド付きエビデンスとして進化し、将来の質問に役立つスキルバンク更新を生成する。
2つのVLMを持つ4つのビデオQAベンチマークで、VisualClawは、クエリごとのAPIコストを、フルフレームのアップロードに対して平均-98%、オフラインのUniversal 8フレームベースラインに対して-25.9%削減する一方で、ほとんどの設定では、平均+3.85%、ピーク+15.80%の精度をGemini 3 FlashでEgoSchemaで向上させる。
このギャップに対処するために、厳格な5ステージパイプラインを通じて構築された200-scenarioのマルチモーダルエージェントベンチマークであるVisualClawArenaをキュレートする。
VisualClawArenaでは、コンピュータ使用エージェントバックエンドを持つ同じフレームワークで、Codex (GPT-5.5) で+2.9%、Claude Code (Sonnet 4.6) で+3.2%、非進化ベースラインで-9.5%のコスト削減を実現している。
これらの特性により、VisualClawはエッジアプリケーションに自然にフィットし、カスケードは1時間のストリーミングセッションを3,600のAPIアップロードから5~20の呼び出しに減らし、自己進化によってパーソナライズされたアシスタントになる。
関連論文リスト
- PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks [15.973951643113963]
PP-OCRv6は、アーキテクチャの革新とデータ中心の最適化を組み合わせた軽量なOCRシステムである。
我々の社内ベンチマークでは、PP-OCRv6_mediumは83.2%の認識精度と86.2%の検出Hmeanを達成した。
論文 参考訳(メタデータ) (2026-06-11T09:35:16Z) - ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces [17.202580606345666]
生産性タスクを自動化するために、大規模言語モデル(LLM)エージェントがますますデプロイされる。
既存のベンチマークは単純化された環境に依存しており、現実的なマルチサービス環境をキャプチャできない。
我々は,現実的な生産性設定におけるLCMエージェントの評価と改善のためのベンチマークであるClawsBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-06T21:09:06Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild [74.7263562191605]
大規模言語モデル(LLM)エージェントは、複雑なタスクにますます使われている。
既存の方法は、知識を蒸留せずに生の軌跡を保存するか、静的なスキルライブラリを維持するか、または再訓練のために破壊的なダウンタイムを必要とする。
本稿では,基本的なLCMポリシと再利用可能な行動スキルのライブラリを共同で進化させるメタ学習フレームワークであるMetaClawを紹介する。
論文 参考訳(メタデータ) (2026-03-17T22:30:30Z) - Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory [50.30283773196725]
既存のアプローチは、時間とともにフレームレベルの詳細を蓄積するためにキーバリューキャッシングに依存していますが、フレーム毎に限られた数のトークンを使用します。
より詳細な時間的理解と推論を可能にするためにトークン予算のスケーリングを提案する。
論文 参考訳(メタデータ) (2026-02-20T18:59:50Z) - VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding [9.415923244280542]
VideoBrainは、Vision-Language Modelsが学習したサンプリングポリシーを通じて視覚情報を適応的に取得することを可能にするエンドツーエンドフレームワークである。
提案手法は,ビデオ間の意味検索を行うCLIPエージェントと,時間間隔内での高密度サンプリングを行うUniformエージェントの2つの補完エージェントを特徴とする。
論文 参考訳(メタデータ) (2026-02-04T00:08:35Z) - VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos [62.29924199978745]
VideoAgentTrekは、Webスケールで公開されているスクリーン録画ビデオからトレーニングデータを自動的にマイニングするスケーラブルなパイプラインである。
生のビデオには暗黙のデモが含まれているが、明示的なアクションラベルがない。
39,000のYouTubeチュートリアルビデオに適用されたパイプラインは、自動的に1250万のインタラクションステップを生成します。
論文 参考訳(メタデータ) (2025-10-22T11:25:48Z) - Graph of Agents: Principled Long Context Modeling by Emergent Multi-Agent Collaboration [9.151759069858924]
本稿では,モデルに依存しない長期コンテキストモデリング問題を圧縮問題として定式化するフレームワークを提案する。
この目的を最大化する入力依存の協調構造を動的に構築するグラフ・オブ・エージェント(GoA)を提案する。
GoAはLongBenchの128KコンテキストウィンドウであるLlama 3.1 8Bを超え、有効コンテキスト長が劇的に増加した。
論文 参考訳(メタデータ) (2025-09-26T04:15:40Z) - Spatiotemporal Contrastive Video Representation Learning [87.56145031149869]
ラベルのないビデオから視覚的表現を学習するための,自己指導型コントラスト映像表現学習(CVRL)法を提案する。
我々の表現は、コントラスト時間的損失を用いて学習され、同じ短いビデオから2つの強化されたクリップが埋め込み空間にまとめられる。
本研究では,ビデオ自己教師型学習におけるデータ向上の要因について検討し,空間的情報と時間的情報の両方が重要であることを明らかにする。
論文 参考訳(メタデータ) (2020-08-09T19:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。