論文の概要: STRIDE: Automated Evaluation of Text-to-Trajectory Alignment across Diverse Contexts
- arxiv url: http://arxiv.org/abs/2609.34799v2
- Date: Tue, 29 Sep 2026 09:09:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.772276
- Title: STRIDE: Automated Evaluation of Text-to-Trajectory Alignment across Diverse Contexts
- Title(参考訳): STRIDE: 様々な文脈におけるテキスト・トラック・アライメントの自動評価
- Abstract要約: 既存の歩行者軌跡メトリクスは、実際の人間のデータと軌跡を比較する。
シナリオ記述と歩行者軌跡のコンテキストアライメントを評価するための最初のフレームワークSTRIDEを紹介する。
観衆領域におけるSTRIDEをSTRIDE-Benchとしてインスタンス化し、1Kシナリオ、6Kの行動質問、1Kの測定で30の現実世界の地図で予測された回答をキャリブレーションした。
- 参考スコア(独自算出の注目度): 22.41577482971691
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language-conditioned trajectory generation is here, but its evaluation has not kept pace. Existing pedestrian trajectory metrics compare trajectories with real-world human data. This does not scale to text-to-trajectory generation across diverse contexts, as collecting human trajectories for every scenario is costly and infeasible. Moreover, pedestrian behavior is heterogeneous and context-dependent, with no single metric as the correct answer, and current evaluation frameworks are not transferable to this domain. These challenges make scalable, reliable evaluation difficult. We introduce STRIDE, the first framework for evaluating context alignment between scenario descriptions and pedestrian trajectories. STRIDE addresses these challenges through three design choices. First, we derive our VRDST evaluation protocol from sociological theories to define a complete evaluation space. Second, it decomposes high-level context into scenario-adaptive behavioral questions. Third, every question is resolved against a deterministic measurement tool library that yields reproducible answers. Together, STRIDE enables complete, verifiable, automated, and scalable evaluation across diverse contexts without requiring human trajectory data. We instantiate STRIDE in the crowd domain as STRIDE-Bench, comprising 1K scenarios, 6K behavioral questions, and 11K measurements with calibrated expected answers across 30 real-world maps. Comprehensive human validations show that STRIDE-Bench is consistent with human behavior and judgment, achieving 80% human agreement. We further evaluate several text-to-trajectory models, finding limited context-alignment capability and persistent challenges in fine-grained context conditioning. We believe that the STRIDE framework provides a first step toward principled evaluation of context-aligned pedestrian trajectory generation.
- Abstract(参考訳): 言語条件付き軌道生成はここにあるが、その評価はペースを保っていない。
既存の歩行者軌跡メトリクスは、実際の人間のデータと軌跡を比較する。
これは、さまざまな文脈でテキスト・ツー・トラジェクトリの生成にスケールしない。
さらに、歩行者の行動は異質で文脈に依存しており、正しい答えとして単一の指標は存在せず、現在の評価フレームワークは、この領域に転送できない。
これらの課題は、スケーラブルで信頼性の高い評価を困難にします。
シナリオ記述と歩行者軌跡のコンテキストアライメントを評価するための最初のフレームワークSTRIDEを紹介する。
STRIDEは3つの設計選択を通じてこれらの課題に対処する。
まず、社会理論からVRDST評価プロトコルを導出し、完全な評価空間を定義する。
第二に、高レベルのコンテキストをシナリオ適応的な行動問題に分解する。
第三に、すべての質問は再現可能な回答をもたらす決定論的測定ツールライブラリに対して解決される。
STRIDEは、人間の軌道データを必要とせずに、さまざまなコンテキストにわたる完全な、検証可能な、自動化された、スケーラブルな評価を可能にする。
観衆領域におけるSTRIDEをSTRIDE-Benchとしてインスタンス化し、1Kシナリオ、6Kの行動質問、1Kの測定で30の現実世界の地図で予測された回答をキャリブレーションした。
包括的人間の検証は、STRIDE-Benchが人間の行動と判断に一致し、80%の人間の合意を達成していることを示している。
さらに,いくつかのテキスト・ツー・トラジェクトリ・モデルの評価を行い,コンテキストアライメント能力の制限や,きめ細かいコンテキスト条件付けにおける永続的課題について検討した。
我々は、STRIDEフレームワークが、コンテキストに沿った歩行者軌道生成の原則的評価に向けた第一歩になると信じている。
関連論文リスト
- DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents [29.982261116765162]
DynSTEERはエージェント軌道評価のための動的ステージワイドフレームワークである。
キー実行ノードでロールアウトをセグメンテーションし、ステージレベルの結果に基づいてマルチ層レビュー戦略を適用する。
公開タスクビューからパス耐性のマイルストーングラフをコンパイルし、参照リークなしでさまざまな法的パスを保存する。
論文 参考訳(メタデータ) (2026-09-13T16:18:03Z) - HarnessEval-W: Agentifying the Evaluation of Visual Worlds [149.63310396189317]
HarnessEval-Wは、世界モデルのベンチマークのためのエージェント化された評価パイプラインである。
HarnessEval-Wは固定ルーブリックを適用するのではなく、評価問題を測定可能なサブプロブレムに分解する。
330件の評価事例に対して,HarnessEval-Wを18の代表的な世界モデルに適用した。
論文 参考訳(メタデータ) (2026-08-17T17:43:24Z) - MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents [7.0922719251235655]
MetaSpaceは、エンボディエージェントの空間認知を評価するために設計された新しいフレームワークである。
そこで,MetaSpaceは最先端MLLMエージェントの空間認識誤りを90,422個検出することに成功した。
その結果、全てのSOTAエージェントは平均スコアが0.44から0.52であり、人間ベンチマークの0.96よりもかなり低いことが示唆された。
論文 参考訳(メタデータ) (2026-07-26T14:07:20Z) - Developing A Framework to Support Human Evaluation of Bias in Generated Free Response Text [8.41305848182636]
本稿では,自由テキスト応答のための半自動バイアス評価フレームワークの開発に向けての道程について述べる。
我々は、パイプラインの自動化を支援するバイアスの運用定義と、複数の選択を越えてバイアスを分類する方法論をどのように開発したかについて議論した。
論文 参考訳(メタデータ) (2025-05-05T22:26:55Z) - Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings [36.449658676568234]
大規模言語モデル(LLM)-as-judgeパラダイムは、モデル出力の安価で信頼性の高い高速な評価要求を満たすために使われてきた。
実世界の文脈評価シナリオにインスパイアされた8つの分割に対して2,000の挑戦的な応答対を持つ判定ベンチマークであるContextualJudgeBenchを提案する。
我々の総合的研究は、文脈情報とその評価基準が最先端モデルにおいても重要な課題であることを示している。
論文 参考訳(メタデータ) (2025-03-19T18:09:19Z) - Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation [50.60733773088296]
音声言語翻訳国際ワークショップ(IWSLT 2023)における共有タスクの結果を総合的に評価する。
本稿では,セグメントコンテキストによる自動回帰と直接評価に基づく効果的な評価戦略を提案する。
分析の結果,1) 提案した評価戦略は頑健であり,他の種類の人的判断とよく相関している,2) 自動測定基準は通常,必ずしも直接評価スコアとよく関連しているわけではない,3) COMET は chrF よりもわずかに強い自動測定基準である,といった結果を得た。
論文 参考訳(メタデータ) (2024-06-06T09:18:42Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - INSTRUCTSCORE: Explainable Text Generation Evaluation with Finegrained
Feedback [80.57617091714448]
テキスト生成のための説明可能な評価指標であるInstructScoreを提案する。
LLaMAに基づいてテキスト評価基準を微調整し、生成されたテキストのスコアと人間の可読性診断レポートを生成する。
論文 参考訳(メタデータ) (2023-05-23T17:27:22Z) - Forecasting Human Trajectory from Scene History [51.72069374835107]
我々は,暗黙の場面の規則性から学習することで,将来の軌跡を予測することを提案する。
本研究では,シーン履歴情報を歴史的グループ軌跡と個々人のインタラクションの2つのタイプに分類する。
本稿では,シーン履歴をシンプルかつ効果的なアプローチで活用する,SHENet(Scene History Excavating Network)を提案する。
論文 参考訳(メタデータ) (2022-10-17T03:56:02Z) - TRUE: Re-evaluating Factual Consistency Evaluation [29.888885917330327]
TRUE: 多様なタスクから既存のテキストの標準化されたコレクション上での、事実整合性メトリクスの総合的な研究である。
我々の標準化により、前述した相関よりも動作可能で解釈可能なサンプルレベルのメタ評価プロトコルが実現される。
さまざまな最先端のメトリクスと11のデータセットから、大規模NLIと質問生成と回答に基づくアプローチが、強力で相補的な結果をもたらすことが分かりました。
論文 参考訳(メタデータ) (2022-04-11T10:14:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。