論文の概要: UTP-Bench: Uncertainty-aware Travel Planning Benchmark
- arxiv url: http://arxiv.org/abs/2609.02421v1
- Date: Wed, 02 Sep 2026 10:42:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.236161
- Title: UTP-Bench: Uncertainty-aware Travel Planning Benchmark
- Title(参考訳): UTP-Bench: 不確実な旅行計画ベンチマーク
- Abstract要約: 本稿では,不確実性を考慮した旅行計画のための大規模ベンチマークであるUPP-Benchを紹介する。
このデータセットは、インドの504都市にまたがる現実世界の旅行データを統合する。
本稿では,3つの評価指標,すなわち Buffer Adequacy Score (BAS), Crowd-Aware Timing Score (CATS), Transport Delay absorption Score (TDAS)を提案する。
- 参考スコア(独自算出の注目度): 8.15237621583531
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Models (LLMs) have recently demonstrated strong capabilities in automated travel itinerary generation. However, real- world travel planning is inherently uncertain: transportation delays, crowd fluctuations, and unexpected stochastic delays frequently inval- idate otherwise feasible schedules. Existing benchmarks like TravelPlanner and TripCraft assume deterministic environments, evaluating only static constraint satisfaction and ignoring whether generated plans remain robust when such uncertainties arise. To address this limitation, we introduce UTP-Bench1 , a large-scale benchmark for uncertainty-aware travel planning. The dataset integrates real-world travel data spanning 504 cities of India, including attractions, restau- rants, accommodations, and multi-modal trans- portation networks. To model realistic disrup- tions, UTP-Bench incorporates empirical delay distributions and crowd-density patterns col- lected from major cities, enabling evaluation of travel plans under stochastic conditions. We further propose three evaluation metrics, namely Buffer Adequacy Score (BAS), Crowd- Aware Timing Score (CATS), and Transport Delay Absorption Score (TDAS), which quan- tify the ability of generated itineraries to main- tain robustness against transit delays and crowd variability. Experiments with state-of-the-art LLMs like GPT-5, Qwen3, Mistral and Phi-4 re- veal substantial gaps between model-generated and human-authored plans, particularly in tem- poral buffering, delay-aware transportation scheduling, and crowd-sensitive planning.
- Abstract(参考訳): 大規模言語モデル (LLM) は、最近、自動走行反復生成において強力な機能を示した。
しかし、現実の旅行計画には本質的に不確実性があり、交通の遅延、群衆の変動、予期せぬ確率的な遅延は、多くの場合、実現可能なスケジュールである。
TravelPlannerやTripCraftといった既存のベンチマークは決定論的環境を前提としており、静的な制約満足度のみを評価し、そのような不確実性が発生した時に生成された計画が堅牢であるかどうかを無視している。
この制限に対処するため,不確実性を考慮した旅行計画のための大規模ベンチマークであるUTP-Bench1を導入する。
このデータセットは、アトラクション、レストラン、宿泊施設、マルチモーダルトランスポーテーションネットワークを含む、インドの504都市にわたる現実世界の旅行データを統合する。
UTP-Benchは、現実的なディスラプションをモデル化するために、大都市から収集された経験的遅延分布と群集密度パターンを取り入れ、確率的条件下での旅行計画の評価を可能にする。
さらに, バッファアデクシースコア(BAS), クラウドアウェアタイピングスコア(CATS), トランスポート遅延吸収スコア(TDAS)の3つの評価指標を提案する。
GPT-5、Qwen3、Mistral、Phi-4といった最先端のLCMを使った実験は、モデル生成と人為的な計画の間に大きなギャップを埋める。
関連論文リスト
- TRIPPULSE: Multi-Agent Travel Planning with Review-Grounded Reasoning [8.15237621583531]
レビューグラウンドトラベルプランニングのためのマルチエージェントフレームワークであるTRIPPULSEを提案する。
我々は,100K以上の実世界レビューでTRIPCRAFTを増強し,人間中心の旅行体験との整合性を評価するためのLCM-as-a-Judge尺度であるReview-Grounded Per-Sona Alignment (RGPA)を導入した。
論文 参考訳(メタデータ) (2026-08-31T15:02:37Z) - Shift & Drift: A Zero-Shot Benchmark for Generalizable and Robust Autonomous Driving Motion Planning [60.888463449435484]
シフト・アンド・ドリフト(Shift & Drift)は、分散シフトの2つの重要な軸にまたがる、厳密なストレス-テスト運動プランナーのための新しいデュアルトラックベンチマークである。
擬似学習手法は,IDベンチマークにおいて高いスコアを得るが,時間的に相関したアクティベーションノイズを受けると持続的なドリフトに悩まされることを示す。
本研究は, 模擬忠実度と閉ループレジリエンスのトレードオフを実証的に明らかにし, 信頼性の高い展開に向けた進捗を評価するための厳密なベンチマークをコミュニティに提供する。
論文 参考訳(メタデータ) (2026-07-08T18:23:48Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - TripTide: A Benchmark for Adaptive Travel Planning under Disruptions [8.592189274445149]
TripTideは、大規模言語モデルの現実的な破壊の下での修正能力を評価する最初のベンチマークである。
実験の結果,LLMは連続的な一貫性とセマンティック安定性を維持し,空間偏差は短い旅行では大きいが,長い旅行では小さくなることがわかった。
TripTideは、LLMベースの旅行計画における適応性、パーソナライゼーション、レジリエンスを評価するためのベンチマークを確立している。
論文 参考訳(メタデータ) (2025-10-24T10:39:55Z) - STRATA-TS: Selective Knowledge Transfer for Urban Time Series Forecasting with Retrieval-Guided Reasoning [27.775793400546345]
STRATA-TSは、ドメイン適応検索と推論可能な大規模モデルを組み合わせることで、不足するデータレシエーションの予測を改善するフレームワークである。
効率的な配置を実現するため, 教師付き微調整により, 推論過程をコンパクトなオープンモデルに蒸留する。
シンガポール、ノッティンガム、グラスゴーの3つのパーキングアベイラビリティーデータセットの実験では、STRATA-TSは強い予測と転送ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2025-08-26T03:18:53Z) - Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces [59.80143393787701]
大規模言語モデル(LLM)は不確実性に対処し、導入障壁を低くしながら再計画の加速を約束する。
本稿では,自然言語対話のアクセシビリティと目標解釈の検証可能な保証とを組み合わせたニューロシンボリック・フレームワークを提案する。
わずか100個の不確実性フィルタで微調整された軽量モデルは、GPT-4.1のゼロショット性能を上回り、推論遅延を50%近く削減する。
論文 参考訳(メタデータ) (2025-07-15T14:24:01Z) - Wide-Horizon Thinking and Simulation-Based Evaluation for Real-World LLM Planning with Multifaceted Constraints [39.01715254437105]
本稿では,多面制約による計画課題を解決するための多面計画(MAoP)について紹介する。
MAoPは直接計画するのではなく、ストラテジストを活用して、さまざまな側面から事前計画を行い、プランナーのための計画青写真を提供する。
論文 参考訳(メタデータ) (2025-06-14T09:37:59Z) - TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning [7.841787597078323]
TripCraft は LLM によるパーソナライズされた旅行計画のための,新たなベンチマークを確立している。
パラメータ情報設定は食事スケジューリングを著しく向上させ、7日間のシナリオでは時間的食事スコアが61%から80%に向上する。
論文 参考訳(メタデータ) (2025-02-27T20:33:28Z) - DelayPTC-LLM: Metro Passenger Travel Choice Prediction under Train Delays with Large Language Models [31.509436717815102]
本稿では,大規模言語モデル(DelayPTC-LLM)によるメトロ遅延を考慮した旅行選択予測手法を提案する。
従来の予測モデルとDelayPTC-LLMの比較分析は、輸送システムの破壊下で一般的に発生する複雑なスパースデータセットを扱う上で、LLMの優れた能力を示している。
論文 参考訳(メタデータ) (2024-09-28T13:09:15Z) - Physics-guided Active Sample Reweighting for Urban Flow Prediction [75.24539704456791]
都市フロー予測は、バス、タクシー、ライド駆動モデルといった交通サービスのスループットを見積もる、微妙な時間的モデリングである。
最近の予測解は、物理学誘導機械学習(PGML)の概念による改善をもたらす。
我々は、PN(atized Physics-guided Network)を開発し、P-GASR(Physical-guided Active Sample Reweighting)を提案する。
論文 参考訳(メタデータ) (2024-07-18T15:44:23Z) - Latent Plan Transformer for Trajectory Abstraction: Planning as Latent Space Inference [53.419249906014194]
オフライン強化学習から得られたデータセットを用いた計画のための生成モデルについて検討する。
本稿では,Transformerベースのトラジェクトリジェネレータと最終戻り値との接続に潜時変数を利用する新しいモデルであるLatent Plan Transformerを紹介する。
論文 参考訳(メタデータ) (2024-02-07T08:18:09Z) - TravelPlanner: A Benchmark for Real-World Planning with Language Agents [63.199454024966506]
我々は,旅行計画に焦点を当てた新しい計画ベンチマークであるTravelPlannerを提案する。
豊富なサンドボックス環境、400万近いデータレコードにアクセスするためのさまざまなツール、計画意図とリファレンスプランを慎重にキュレートした1,225のツールを提供する。
包括的評価では、現在の言語エージェントがそのような複雑な計画タスクを処理できないことが示されており、GPT-4でさえ0.6%の成功率しか達成できない。
論文 参考訳(メタデータ) (2024-02-02T18:39:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。