論文の概要: A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection
- arxiv url: http://arxiv.org/abs/2604.13046v1
- Date: Fri, 13 Mar 2026 11:53:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.63174
- Title: A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection
- Title(参考訳): マルチモーダルデータ収集におけるLLM駆動トリガー生成のためのドメイン特化言語
- Authors: Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax,
- Abstract要約: 本稿では,意図駆動型オンデバイスデータ収集のための宣言型フレームワークを提案する。
高レベルのユーザ要求に基づいて,マルチモーダルセンサデータの選択的収集を可能にする。
制約のないコード生成よりも高い生成一貫性と実行レイテンシを実現する。
- 参考スコア(独自算出の注目度): 0.8466401378239364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data-driven systems depend on task-relevant data, yet data collection pipelines remain passive and indiscriminate. Continuous logging of multimodal sensor streams incurs high storage costs and captures irrelevant data. This paper proposes a declarative framework for intent-driven, on-device data collection that enables selective collection of multimodal sensor data based on high-level user requests. The framework combines natural language interaction with a formally specified domain-specific language (DSL). Large language models translate user-defined requirements into verifiable and composable DSL programs that define conditional triggers across heterogeneous sensors, including cameras, LiDAR, and system telemetry. Empirical evaluation on vehicular and robotic perception tasks shows that the DSL-based approach achieves higher generation consistency and lower execution latency than unconstrained code generation while maintaining comparable detection performance. The structured abstraction supports modular trigger composition and concurrent deployment on resource-constrained edge platforms. This approach replaces passive logging with a verifiable, intent-driven mechanism for multimodal data collection in real-time systems.
- Abstract(参考訳): データ駆動システムはタスク関連データに依存するが、データ収集パイプラインは受動的で無差別である。
マルチモーダルセンサストリームの継続的なロギングは、高いストレージコストを発生させ、無関係なデータをキャプチャする。
本稿では,高レベルのユーザ要求に基づくマルチモーダルセンサデータの選択的収集を可能にする,インテント駆動オンデバイスデータ収集のための宣言的フレームワークを提案する。
このフレームワークは、自然言語と公式に定義されたドメイン固有言語(DSL)を組み合わせる。
大きな言語モデルは、ユーザ定義の要件を検証可能で構成可能なDSLプログラムに変換し、カメラ、LiDAR、システムテレメトリを含む異種センサ間で条件トリガを定義する。
車両およびロボットの知覚タスクに関する実証的な評価は、DSLベースのアプローチが、同等な検出性能を維持しながら、制約のないコード生成よりも高い生成一貫性と実行レイテンシを実現することを示している。
構造化された抽象化は、モジュール型のトリガー合成とリソース制約のあるエッジプラットフォームへの同時デプロイをサポートする。
このアプローチは、受動的ロギングを、リアルタイムシステムにおけるマルチモーダルデータ収集の検証可能な、意図駆動のメカニズムに置き換える。
関連論文リスト
- Explainable Semantic Textual Similarity via Dissimilar Span Detection [53.32175252285023]
テキストのペア間で意味的に異なるスパンを識別することを目的として,DSD(Dissimilar Span Detection)タスクを導入する。
これにより、ユーザーはどの特定の単語やトークンが類似度スコアに悪影響を及ぼすかを理解したり、STS依存のダウンストリームタスクのパフォーマンス向上に使用することができる。
論文 参考訳(メタデータ) (2026-03-22T11:32:31Z) - OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs [31.589945976149973]
我々は、Attributionを世代追跡問題として形式化する軽量でモデルに依存しないフレームワークであるOmniTraceを紹介した。
本研究では, 世代別スパンレベルの属性が, 自己帰属よりも安定かつ解釈可能な説明をもたらすことを示す。
この結果から,属性を構造化された生成時トレース問題として扱うことは,オムニモーダル言語モデルにおける透明性のスケーラブルな基盤となることが示唆された。
論文 参考訳(メタデータ) (2026-03-20T17:25:00Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - AgentSkiller: Scaling Generalist Agent Intelligence through Semantically Integrated Cross-Domain Data Synthesis [30.512393568258105]
大規模言語モデルエージェントは、ツールを介して現実世界の問題を解決する可能性を実証するが、汎用的な知性は、質の低い長期データによってボトルネックとなる。
本稿では,現実的なセマンティックなドメイン間でのマルチターンインタラクションデータを合成する,完全に自動化されたフレームワークであるAgentSkillerを提案する。
論文 参考訳(メタデータ) (2026-02-10T03:21:42Z) - Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation [50.22481337087162]
Referring Video Object (RVOS) は、テキストクエリに基づくビデオ内のオブジェクトのセグメンテーションを目的としている。
Refer-Agent (Refer-Agent) は、共用多エージェントシステムである。
論文 参考訳(メタデータ) (2026-02-03T14:48:12Z) - CaveAgent: Transforming LLMs into Stateful Runtime Operators [31.548422546991915]
CaveAgentは"LLM-as-Text-Generator"から"LLM-as-as-Runtime"にパラダイムを変換するフレームワークです。
CaveAgentは小売業のタスクで10.5%の成功率の向上を実現し、マルチターンシナリオではトークン総消費を28.4%削減している。
論文 参考訳(メタデータ) (2026-01-04T15:32:47Z) - FABRIC: Framework for Agent-Based Realistic Intelligence Creation [3.940391073007047]
大規模言語モデル(LLM)はエージェントとしてますます多くデプロイされ、目標を分解し、ツールを実行し、動的環境で結果を検証することが期待されている。
本稿では,LLMのみを用いたエージェントデータの統一化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-20T18:20:22Z) - SAM2Auto: Auto Annotation Using FLASH [13.638155035372835]
VLM(Vision-Language Models)は、注釈付きデータセットの不足により、大規模言語モデルに遅れている。
SAM2Autoは、人間の介入やデータセット固有のトレーニングを必要としないビデオデータセットのための、最初の完全に自動化されたアノテーションパイプラインである。
本システムでは, 検出誤差を最小限に抑えつつ, ビデオシーケンス全体にわたって一貫した物体追跡を確実にするため, 統計的手法を用いている。
論文 参考訳(メタデータ) (2025-06-09T15:15:15Z) - Binary Code Similarity Detection via Graph Contrastive Learning on Intermediate Representations [52.34030226129628]
バイナリコード類似度検出(BCSD)は、脆弱性検出、マルウェア分析、コードの再利用識別など、多くの分野で重要な役割を果たしている。
本稿では,LLVM-IRと高レベルのセマンティック抽象化を利用して,コンパイル差を緩和するIRBinDiffを提案する。
IRBinDiffは1対1の比較と1対多の検索シナリオにおいて,他の主要なBCSD手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-10-24T09:09:20Z) - ToolACE: Winning the Points of LLM Function Calling [139.07157814653638]
ToolACEは、正確で複雑で多様なツール学習データを生成するように設計された自動エージェントパイプラインである。
我々は、合成データに基づいてトレーニングされたモデルが、8Bパラメータだけで、バークレー・ファンクション・カリング・リーダーボード上で最先端のパフォーマンスを達成することを実証した。
論文 参考訳(メタデータ) (2024-09-02T03:19:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。