論文の概要: Semantic Action Graph: A Shared Representation for Agent Grounding and Human Interpretation of Sports Highlights
- arxiv url: http://arxiv.org/abs/2609.20768v1
- Date: Thu, 17 Sep 2026 17:46:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.409907
- Title: Semantic Action Graph: A Shared Representation for Agent Grounding and Human Interpretation of Sports Highlights
- Title(参考訳): セマンティックアクショングラフ:スポーツハイライトのエージェント接地と人間解釈のための共有表現
- Abstract要約: スポーツマッチをパフォーマー、アクション、受信者、モーメント、状態ノードとして表現する軽量ドメインスキーマであるセマンティックアクショングラフを、役割、時間、結果エッジで接続する。
SportSAGEは4モジュールハイライトパイプラインとグラフインターフェースを組み合わせたデザインプローブで、12人のサッカーファンからのフィードバックを報告する。
参加者は生成されたハイライトや物語の品質に満足し、マッチハイライトを検索、ナビゲート、解釈するためにグラフインターフェースを使用した。
- 参考スコア(独自算出の注目度): 10.42150048686831
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generative agents are increasingly used to select and narrate video highlights, but they typically operate over unstructured or frame-level representations. Their output is consequently difficult for a viewer to verify and steer toward individual preferences. We present the semantic action graph, a lightweight domain schema that represents a sports match as performer, action, recipient, moment, and state nodes connected by role, temporal, and outcome edges. The schema demonstrates three key properties: 1) connected event sequences, 2) a shared, closed vocabulary, and 3) frame-addressable moments, making it suitable to serve two consumers at once: an agentic pipeline that composes narrated highlights, and a visual interface through which viewers query and inspect the same structure. We instantiate it in SportSAGE, a design probe pairing a four-module highlight pipeline with a graph interface, and report feedback from 12 soccer fans. Participants were satisfied with the quality of the generated highlights and narratives, and used the graph interface to search, navigate, and interpret the match highlights. These results provide early evidence that one small, human-readable schema can ground agent generation and support human interpretation at the same time.
- Abstract(参考訳): 生成エージェントはビデオハイライトの選択やナレーションに使用されることが多いが、通常は非構造的あるいはフレームレベルの表現に対して動作する。
結果として、視聴者が個人の好みを検証し、判断することが困難になる。
スポーツマッチをパフォーマー、アクション、受信者、モーメント、状態ノードとして表現する軽量ドメインスキーマであるセマンティックアクショングラフを、役割、時間、結果エッジで接続する。
スキーマは3つの重要な特性を示します。
1)連結イベントシーケンス
2 共有し、閉じた語彙及び
ナレーションされたハイライトを構成するエージェントパイプラインと、ビューアが同じ構造をクエリして検査するビジュアルインターフェースだ。
SportSAGEは4モジュールハイライトパイプラインとグラフインターフェースを組み合わせたデザインプローブで、12人のサッカーファンからのフィードバックを報告する。
参加者は生成されたハイライトや物語の品質に満足し、マッチハイライトを検索、ナビゲート、解釈するためにグラフインターフェースを使用した。
これらの結果は、1つの小型で可読なスキーマがエージェントの生成と人間の解釈を同時に支援できるという初期の証拠を提供する。
関連論文リスト
- IAE-VTG: Interaction-Aligned Action-Entity Video Temporal Grounding [40.70112555953827]
Video Temporal Grounding (VTG)は、自然言語クエリにマッチするビデオセグメントをローカライズする。
IAE-VTGは、強いベースラインを一貫して改善し、標準基盤メトリクスの競争力や最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-09-09T05:25:37Z) - Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding [67.1767666115821]
本稿では,時間的文接地(TSG)の課題に対処する。
本稿では、より実用的で困難なTSG設定を目標とし、教師なし時間文の接地を行う。
我々のモデルは、この一般的な知識を直接利用して、ビデオとクエリを相関させ、トレーニングなしで関連セグメントを正確に検索することができる。
論文 参考訳(メタデータ) (2026-05-29T02:16:11Z) - SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning [53.638998508418545]
本稿では,画像の協調とキャプション'(セグキャプション)を新たに導入する。
SegCaptioningは、オブジェクトを囲むバウンディングボックスのような直接的なプロンプトを、(カプセル、マスク)ペアで表されるさまざまな意味解釈に変換することを目的としている。
このタスクは、ユーザの意図を最小限のプロンプトから正確に把握し、同時に複数の意味的に整列したキャプションワードとマスクを予測するなど、大きな課題を生じさせる。
論文 参考訳(メタデータ) (2025-12-01T18:33:04Z) - Click2Graph: Interactive Panoptic Video Scene Graphs from a Single Click [4.3686715534918275]
PVSG(Panoptic Video Scene Graph Generation)の最初のインタラクティブフレームワークであるClick2Graphを紹介する。
Click2Graphは、時間をかけて被写体を追跡し、対話するオブジェクトを自律的に発見し、被写体、オブジェクト、述語>三つ子を予測し、時間的に一貫したシーングラフを形成する。
本フレームワークでは,主観的なオブジェクトプロンプトを生成する動的インタラクション探索モジュールと,共同エンティティと述語推論を行うセマンティック分類ヘッドという2つの重要なコンポーネントを導入している。
論文 参考訳(メタデータ) (2025-11-20T00:49:25Z) - Player-Team Heterogeneous Interaction Graph Transformer for Soccer Outcome Prediction [8.197004730382396]
HIGFormerは,サッカー結果予測のための新しいグラフ強化トランスフォーマーベースディープラーニングモデルである。
きめ細かいプレイヤーダイナミクスとハイレベルなチームインタラクションの両方をキャプチャします。
大規模な実世界のサッカーデータセットであるWyScout Open Accessデータセットの実験では、HIGFormerが予測精度において既存の手法を大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2025-07-14T06:43:36Z) - A Hybrid Graph Network for Complex Activity Detection in Video [40.843533889724924]
複雑なアクティビティ検出(CompAD)は、分析を長期的なアクティビティに拡張する。
本稿では,局所的な(短期的な)動的シーンを符号化したグラフに適用した注目と,全体の長期的活動をモデル化した時間グラフを組み合わせたハイブリッドグラフニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2023-10-26T15:49:35Z) - Bridge-Prompt: Towards Ordinal Action Understanding in Instructional
Videos [92.18898962396042]
本稿では,隣接するアクション間のセマンティクスをモデル化する,プロンプトベースのフレームワークであるBridge-Promptを提案する。
我々は個々のアクションラベルを、個々のアクションセマンティクスのギャップを埋める監視のための統合テキストプロンプトとして再構成する。
Br-Promptは複数のベンチマークで最先端を達成する。
論文 参考訳(メタデータ) (2022-03-26T15:52:27Z) - Unified Graph Structured Models for Video Understanding [93.72081456202672]
リレーショナル・テンポラル関係を明示的にモデル化するメッセージパッシンググラフニューラルネットワークを提案する。
本手法は,シーン内の関連エンティティ間の関係をより効果的にモデル化できることを示す。
論文 参考訳(メタデータ) (2021-03-29T14:37:35Z) - Language and Visual Entity Relationship Graph for Agent Navigation [54.059606864535304]
VLN(Vision-and-Language Navigation)は、エージェントが自然言語の指示に従って現実世界の環境をナビゲートする必要がある。
テキストと視覚間のモーダル関係をモデル化するための新しい言語とビジュアルエンティティ関係グラフを提案する。
実験によって、私たちは最先端技術よりも改善できる関係を利用しています。
論文 参考訳(メタデータ) (2020-10-19T08:25:55Z) - ConsNet: Learning Consistency Graph for Zero-Shot Human-Object
Interaction Detection [101.56529337489417]
画像中のHuman, Action, Object>の形のHOIインスタンスを検出・認識することを目的としたHuman-Object Interaction (HOI) Detectionの問題点を考察する。
我々は、オブジェクト、アクション、インタラクション間の多レベルコンパレンシーは、稀な、あるいは以前には見られなかったHOIのセマンティック表現を生成するための強力な手がかりであると主張している。
提案モデルでは,人-対象のペアの視覚的特徴とHOIラベルの単語埋め込みを入力とし,それらを視覚-意味的関節埋め込み空間にマッピングし,類似度を計測して検出結果を得る。
論文 参考訳(メタデータ) (2020-08-14T09:11:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。