論文の概要: SSC: A Verifiable Structured Representation for Bimanual Manipulation Labelling
- arxiv url: http://arxiv.org/abs/2608.04425v1
- Date: Wed, 05 Aug 2026 04:09:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.707714
- Title: SSC: A Verifiable Structured Representation for Bimanual Manipulation Labelling
- Title(参考訳): SSC: 双方向マニピュレーションラベリングのための検証可能な構造化表現
- Authors: Yupu Lu, Shuang Wu, Sihan Chen, Ruihua Han, Yichen Zhang, Marcus Kalander, Jia Pan,
- Abstract要約: サブタスクラベルは、ポリシートレーニングと評価のために、長い水平操作のデモを短いセマンティックセグメントに分解する。
本稿では,これらの極端を橋渡しする状態遷移表現であるStructured Subtask Chain (SSC)を提案する。
SSCは3つの視覚言語支援機能をサポートしている: SSTを自然言語としてレンダリングし、組立チェーンを4つの状態遷移規則でチェックし、クエリ解決カスケードで未特定フィールドを完成させる。
- 参考スコア(独自算出の注目度): 21.381690220961502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Subtask labels decompose a long-horizon manipulation demonstration into shorter semantic segments for policy training and evaluation. Natural language descriptions are easy to read, but their linguistic variability makes automatic verification difficult. Rigid template formats, such as BEHAVIOR-1K's skill_annotation, are linguistically over-segmented, hindering both readability and annotation consistency. We propose the Structured Subtask Chain (SSC), a state-transition representation that bridges these extremes. A demonstration is a sequence of Structured Subtask Template (SST) entries. Each SST stores core action components (subject, predicate, object), flexible conditions (adverbial modifiers such as spatial or instrumental phrases), a base-motion field separate from arm actions, and an after-state scene graph. Built on this format, SSC supports three vision-language assisted functions: rendering SSTs as natural language, checking the assembled chain against four state-transition rules, and completing underspecified fields through a query resolution cascade. We instantiate the pipeline on BEHAVIOR-1K (50 tasks, 3 episodes per task, 2,357 annotated action cells) for logic verification and content completion, evaluating 13 selected state-of-the-art VL models as candidate verifiers and reporting labelling anomalies.
- Abstract(参考訳): サブタスクラベルは、ポリシートレーニングと評価のために、長い水平操作のデモを短いセマンティックセグメントに分解する。
自然言語の記述は読みやすいが、その言語的多様性は自動検証を困難にしている。
BEHAVIOR-1Kの skill_annotation のような厳格なテンプレートフォーマットは言語的に過剰に分離されており、可読性とアノテーションの整合性を妨げている。
本稿では,これらの極端を橋渡しする状態遷移表現であるStructured Subtask Chain (SSC)を提案する。
デモはStructured Subtask Template(SST)エントリのシーケンスである。
各SSTは、コアアクションコンポーネント(サブジェクト、述語、オブジェクト)、フレキシブル条件(空間や楽器句などの副詞)、ベースモーションフィールドをアームアクションから分離し、アフターステートシーングラフを格納する。
SSCは3つの視覚言語支援機能をサポートしている: SSTを自然言語としてレンダリングし、組立チェーンを4つの状態遷移規則でチェックし、クエリ解決カスケードで未特定フィールドを完成させる。
BEHAVIOR-1K(50のタスク、3のエピソード、1のタスク、3のエピソード、2,357のアノテートされたアクションセル)上のパイプラインを、論理検証とコンテンツ補完のためにインスタンス化し、13の選択された最先端VLモデルを候補検証として評価し、ラベル付け異常を報告する。
関連論文リスト
- dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model [17.615596275551358]
本稿では,XMLスタイルのタグを用いた音声編集のための,正確で明示的なインタフェースについて検討する。
dots.tts.editは継続的自己回帰型dots.tts基盤モデルから適応したエディタである。
doteBenchはバイリンガル・アセスメント・スイートで, 正確な指示の追従, 局所保存, 音質を計測する。
論文 参考訳(メタデータ) (2026-08-02T15:03:37Z) - Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis [13.853304646673637]
マルチモーダル感覚分析(MSA)は、自然言語と非言語的モダリティを統合することで、複雑な人間の感情を解釈することを目的としている。
SentiLLMは、連続した生信号をコンパクトで意味のあるトークンに蒸留するフレームワークである。
提案手法は,MSAにおける構造抽象パラダイムの有効性を実証し,4つのデータセット上での優れた性能を実現する。
論文 参考訳(メタデータ) (2026-07-30T07:23:27Z) - SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models [63.28435103335999]
セマンティックオブジェクト対応のための新しいベンチマークであるSOCOを紹介する。
視覚基盤のバックボーンは強い意味構造をエンコードするが、関連するカテゴリ間での伝達対応は不十分であることを示す。
また,LVLMは画像マッチングよりもテキストプロンプト部分のローカライゼーションが優れていることを示す。
論文 参考訳(メタデータ) (2026-05-29T17:58:48Z) - Job Skill Extraction via LLM-Centric Multi-Module Framework [51.37063712967151]
本稿では,意味検索,文脈内学習,教師付き微調整を組み合わせたLLM中心のフレームワークであるSRICLを提案する。
SRICLは、6つの公的なスパンラベル付きジョブアド文のコーパスにおいて、GPT-3.5よりも相当なSTRICT-F1の改善を達成し、ベースラインを加速し、無効なタグと幻覚したスパンを激減する。
論文 参考訳(メタデータ) (2026-04-23T10:46:07Z) - Text-as-Signal: Quantitative Semantic Scoring with Embeddings, Logprobs, and Noise Reduction [0.0]
本稿では,テキストコーパスを定量的意味信号に変換するための実用的なパイプラインを提案する。
本稿では,Qwen埋め込み, UMAP, モデル出力空間から直接導出される意味指標, および3段階の異常検出手順が, 操作用テキスト・アズ・サインのワークフローにどのように組み合わされているかを示す。
論文 参考訳(メタデータ) (2026-03-17T19:56:29Z) - Paragraph Segmentation Revisited: Towards a Standard Task for Structuring Speech [61.00008468914252]
本稿では,音声処理とテキストセグメンテーションの交点における3つのギャップを埋める,欠落した構造化ステップとして,段落セグメンテーションを再考する。
ベンチマークは、伝統的に段落のセグメンテーションが後処理の一部ではない未調査の音声領域に焦点を当てている。
第二に、制約付き復号法を提案し、大言語モデルが原文を保存しながら段落を挿入できるようにする。
第三に、コンパクトモデル(MiniSeg)が最先端の精度を実現し、階層的に拡張されると、最小計算コストで章や段落を共同で予測できることが示される。
論文 参考訳(メタデータ) (2025-12-30T23:29:51Z) - Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection [39.748035737067745]
本稿では,言語に基づく物体検出のための文内階層関係に基づく言語表現の再構成を提案する。
重要な洞察は、テキストトークンを中核となる構成要素、属性、関係("talk in pieces")に切り離し、その後階層的に構造化された文レベルの表現に集約する必要性である。
OmniLabelベンチマークによる実験結果は24%のパフォーマンス向上を示し、言語構成の重要性を示している。
論文 参考訳(メタデータ) (2025-09-29T02:14:26Z) - HVL: Semi-Supervised Segmentation leveraging Hierarchical Vision-Language Synergy with Dynamic Text-Spatial Query Alignment [16.926158907882012]
本稿では,変圧器を用いたセグメンテーションネットワークにおいて,ドメイン不変のテキスト埋め込みをオブジェクトクエリとして統合する統合型ビジョン・ランゲージフレームワークを提案する。
以上の結果から,言語誘導セグメンテーションはラベル効率ギャップを橋渡しし,より詳細な一般化を可能にした。
論文 参考訳(メタデータ) (2025-06-16T19:05:33Z) - Exploiting Contextual Target Attributes for Target Sentiment
Classification [53.30511968323911]
TSCの既存のPTLMベースモデルは、1)PTLMをコンテキストエンコーダとして採用した微調整ベースモデル、2)テキスト/単語生成タスクに分類タスクを転送するプロンプトベースモデル、の2つのグループに分類される。
我々は,PTLM を TSC に活用する新たな視点として,言語モデリングと文脈的ターゲット属性による明示的ターゲットコンテキスト相互作用の利点を同時に活用する。
論文 参考訳(メタデータ) (2023-12-21T11:45:28Z) - Prompting Language Models for Linguistic Structure [73.11488464916668]
本稿では,言語構造予測タスクに対する構造化プロンプト手法を提案する。
提案手法は, 音声タグ付け, 名前付きエンティティ認識, 文チャンキングについて評価する。
PLMはタスクラベルの事前知識を事前学習コーパスに漏えいすることで有意な事前知識を含むが、構造化プロンプトは任意のラベルで言語構造を復元することも可能である。
論文 参考訳(メタデータ) (2022-11-15T01:13:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。