論文の概要: SERUM: State Extraction and Refinement for User Modeling
- arxiv url: http://arxiv.org/abs/2607.29181v1
- Date: Fri, 31 Jul 2026 09:02:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.668679
- Title: SERUM: State Extraction and Refinement for User Modeling
- Title(参考訳): SERUM: ユーザモデリングのための状態抽出とリファインメント
- Abstract要約: 本研究では,非構造化エゴセントリックビデオから直接有限状態挙動モデルを抽出するフレームワークであるSERUMを提案する。
ラベル列に一階マルコフモデルを適用することにより,行動構造を評価する。
1) 反復ラベルリファインメントは,数回のパス後に平衡と呼ばれる安定な状態語彙に収束し,(2) 正規化されたマルコフモデルは,周波数ベースラインよりもはるかに低いパープレキシティと高い動作予測を達成し,(3) 人間のアノテータは最終パスラベルを,第1パスラベルよりも正確かつ有意義に改善したと評価する。
- 参考スコア(独自算出の注目度): 17.94894550460533
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic assistants capable of proactive, personalized interactions require structured models of user intent and workflow. However, building these models from raw, unstructured screen activity remains an open challenge. We present SERUM, a multi-pass framework that extracts finite-state behavioral models directly from unstructured egocentric video using hierarchical VLM annotation. Processing screen recordings through a sliding window, SERUM alternates between activity-recognition and intent-inference passes, with each pass refining labels using accumulated prior context to reduce hallucination and temporal conflation seen in single-pass annotation. Synonymous states are then merged via sentence embeddings and human-calibrated thresholds into a compact, coherent taxonomy. We evaluate behavioral structure by fitting first-order Markov models over the resulting label sequences (both actions and intents) and measuring predictive accuracy against frequency baselines. Across 61 egocentric videos in four domains (coding, cooking, physical activities, and daily life), we find: (1) iterative label refinement converges to a stable state vocabulary, which we term schematic equilibrium, after several passes; (2) normalized Markov models achieve substantially lower perplexity and higher action predictions than frequency baselines, with the largest gains on structured tasks like coding; and (3) human annotators rate final-pass labels as accurate and meaningfully improved over first-pass labels. To our knowledge, SERUM is the first system to produce interpretable process models from unstructured egocentric screen video without manual annotation, opening a scalable pathway for user modeling and behavioral understanding in the wild. Our demo, code, and results are publicly available
- Abstract(参考訳): プロアクティブでパーソナライズされたインタラクションが可能なエージェントアシスタントは、ユーザ意図とワークフローの構造化モデルを必要とする。
しかし、これらのモデルを生の、非構造化のスクリーンアクティビティから構築することは、依然としてオープンな課題である。
本稿では,階層的VLMアノテーションを用いて,非構造化エゴセントリックビデオから直接有限状態挙動モデルを抽出するマルチパスフレームワークであるSERUMを提案する。
画面記録をスライドウィンドウで処理し、SERUMはアクティビティ認識とインテント推論のパスを交互に処理し、各パス精製ラベルは蓄積した事前コンテキストを使用して、単一パスアノテーションで見られる幻覚と時間的衝突を低減する。
共生状態は、文の埋め込みと人間の校正しきい値によって、コンパクトで一貫性のある分類にマージされる。
ラベル配列(動作と意図の両方)に1次マルコフモデルを適用し,周波数ベースラインに対する予測精度を計測することにより,行動構造を評価する。
4つの領域(コーディング、調理、身体活動、日常生活)における61の自我中心的ビデオのうち、(1)反復ラベルの洗練は、いくつかのパスの後、スキーマ平衡と呼ばれる安定した状態語彙に収束し、(2)正規化されたマルコフモデルは、符号化のような構造化されたタスクに最も大きな利得を持つ周波数ベースラインよりも、著しく低いパープレキシティと高いアクション予測を達成し、(3)人間の注釈者は、最終パスラベルを、第一パスラベルよりも正確かつ有意に改善した評価を行う。
我々の知る限り、SERUMは、手動のアノテーションを使わずに、非構造化エゴシックなスクリーンビデオから解釈可能なプロセスモデルを作成し、ユーザモデリングと行動理解のためのスケーラブルな経路を開く最初のシステムである。
私たちのデモ、コード、結果が公開されています
関連論文リスト
- Compositional Benchmark Synthesis for Hierarchical Human Action Recognition [4.812022454180755]
4段階階層型インテンションベンチマークを合成するベンチマーク生成および評価フレームワークを提案する。
エピソードは、主題一貫性制約の下で遷移モデルによって組み立てられる。
被検体の使用量を0.566から0.248に削減する。
論文 参考訳(メタデータ) (2026-08-11T10:22:22Z) - DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction [21.818459524136376]
DeepGaze3.5-VLは、複数のデータセットにまたがる新たな最先端技術を確立し、MIT1003上で2.18ビットの情報ゲイン(IG)を実現し、DeepGaze IIIよりも46%改善した。
我々の生成フレームワークは、直接的行動介入のための強力な計算ツールとして機能し、生体内での動作が実験的に困難または不可能な、制御されたシリカ内シミュレーションを可能にします。
論文 参考訳(メタデータ) (2026-07-02T12:25:45Z) - DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation [58.47973015036709]
DisPOSEは、本質的に離散的な多視点人物割り当て問題を近似する自己教師型フレームワークである。
特定可能なシンクホーン射影を用いることにより、本モデルは有効かつ実現可能な課題への解の導出を学ぶ。
提案手法は、標準データセット上での最先端の自己教師手法よりも優れている。
論文 参考訳(メタデータ) (2026-06-05T16:14:39Z) - SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing [76.349958946335]
本稿では,映像編集をセマンティックアンカーとモーションモデリングに分解するフレームワークであるSAMA(factorized Semantic Anchoring and Motion Alignment)を提案する。
まずセマンティックアンカリング(Semantic Anchoring)を導入し、スパースアンカフレームでのセマンティックトークンとビデオ潜在者を共同で予測することで、信頼性の高い視覚アンカを確立する。
第2に、モーションアライメントは同じバックボーンをモーション中心のビデオ復元のプリテキストタスクで事前トレーニングする。
論文 参考訳(メタデータ) (2026-03-19T17:59:51Z) - Peeking Into The Future For Contextual Biasing [8.769657210925777]
本稿では,アテンションベースエンコーダデコーダ(AED)モデルに対するコンテキストバイアス法を提案する。
複数の将来トークンを同時に予測し、モデルが"未来を覗き込む"ことを可能にし、潜在的な候補エンティティをスコアする。
提案手法は,ベースラインAEDモデルと比較して,名前付き単語の誤り率を最大50.34%向上させる。
論文 参考訳(メタデータ) (2025-12-19T14:56:28Z) - Bridging Weakly-Supervised Learning and VLM Distillation: Noisy Partial Label Learning for Efficient Downstream Adaptation [51.67328507400985]
ノイズ部分ラベル学習(NPLL)では、各トレーニングサンプルは、複数のノイズアノテータによって注釈付けされた候補ラベルのセットに関連付けられている。
本稿では、事前学習された視覚言語モデルによって注釈付けされた部分ラベルからの学習に焦点を当てる。
革新的な協調整合正則化(Co-Reg)法を提案する。
論文 参考訳(メタデータ) (2025-06-03T12:48:54Z) - Higher-Order DeepTrails: Unified Approach to *Trails [7.270112855088838]
人間の振る舞いを分析し、理解し、記述することは、Webブラウジングやトラフィックナビゲーションなど、異なる設定で有利である。
本稿では,従来,シーケンス内の高次依存関係のモデル化に用いられてきた自動回帰言語モデルを用いて,シーケンス全体を解析することを提案する。
提案手法は,HypTrails,MixedTrails,さらにはSubTrailsなど,従来の作業で導入された異なる設定に容易に適用可能であることを示す。
論文 参考訳(メタデータ) (2023-10-06T06:54:11Z) - STMT: A Spatial-Temporal Mesh Transformer for MoCap-Based Action Recognition [50.064502884594376]
本研究では、モーションキャプチャー(MoCap)シーケンスを用いた人間の行動認識の問題点について検討する。
メッシュシーケンスを直接モデル化する新しい時空間メッシュ変換器(STMT)を提案する。
提案手法は,スケルトンベースモデルやポイントクラウドベースモデルと比較して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-03-31T16:19:27Z) - LESS: Label-Efficient Semantic Segmentation for LiDAR Point Clouds [62.49198183539889]
我々は,LiDAR点雲を用いた屋外シーンのためのラベル効率のよいセマンティックセマンティックセマンティクスパイプラインを提案する。
本手法は,半弱教師付き学習を用いて,効率的なラベリング手法を設計する。
提案手法は,100%ラベル付き完全教師付き手法と比較して,さらに競争力が高い。
論文 参考訳(メタデータ) (2022-10-14T19:13:36Z) - An audiovisual and contextual approach for categorical and continuous
emotion recognition in-the-wild [27.943550651941166]
第2回ワークショップおよびABAW(Affective Behavior Analysis in-wild)の会場における映像による視覚的感情認識の課題に取り組む。
顔の特徴の抽出にのみ依存する標準的な手法は、上記の感情情報のソースが、頭や身体の向き、解像度の低さ、照明不足によってアクセスできない場合に、正確な感情予測を欠くことが多い。
我々は、より広い感情認識フレームワークの一部として、身体的および文脈的特徴を活用することで、この問題を緩和したいと考えています。
論文 参考訳(メタデータ) (2021-07-07T20:13:17Z) - Document Ranking with a Pretrained Sequence-to-Sequence Model [56.44269917346376]
関連ラベルを「ターゲット語」として生成するためにシーケンス・ツー・シーケンス・モデルをどのように訓練するかを示す。
提案手法は,データポーラ方式におけるエンコーダのみのモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2020-03-14T22:29:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。