論文の概要: Multitask Reinforcement Learning for Assisting Choice Model Specification
- arxiv url: http://arxiv.org/abs/2609.18441v1
- Date: Wed, 16 Sep 2026 10:32:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.756707
- Title: Multitask Reinforcement Learning for Assisting Choice Model Specification
- Title(参考訳): 選択モデル仕様支援のためのマルチタスク強化学習
- Abstract要約: 我々は、転送可能な仕様戦略をトランスポート選択データセット間で学習する強化学習フレームワークであるDelphosを紹介する。
Delphosは、モデルの仕様をシーケンシャルな意思決定問題として捉えている。
一連のモデリングアクションを適用し、推定環境からフィードバックを受け取る。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Discrete choice model specification is a time-consuming task in which modellers often specify and estimate multiple models while balancing goodness-of-fit, parsimony, and behavioural plausibility. We present Delphos, a multitask reinforcement learning framework that learns transferable specification strategies across transport choice datasets. Delphos frames model specification as a sequential decision-making problem in which it applies a sequence of modelling actions and receives feedback from an estimation environment based on model performance and convergence. To transfer modelling decisions across datasets with different sets of variables, Delphos represents utility specifications as sets of modelling terms using a DeepSet-Q architecture, allowing a shared specification policy to learn across multiple datasets. Trained on nine transport choice datasets, Delphos consistently outperforms independently trained single-task agents, indicating that sharing modelling experience improves learning efficiency and helps identify promising sequences of modelling decisions with fewer unsuccessful estimation attempts. When applied without further training to the unseen Swissmetro and Decisions datasets, the same agent identifies competitive specifications in less than 20 minutes on a standard CPU. It achieves a higher log-likelihood per observation than the VNS metaheuristic on Swissmetro and performance comparable to a published MNL specification developed by expert modellers on Decisions. These findings show that accumulating and reusing modelling experience enables Delphos to function as an intelligent assistant for discrete choice model specification. It reduces manual trial-and-error while allowing modellers to retain control over model diagnosis, refinement, and final selection.
- Abstract(参考訳): 離散選択モデル仕様(disdisrete choice model specification)は、モデラーが好適性、パーシモニー、行動的妥当性のバランスをとりながら、複数のモデルを特定して見積もる時間を要するタスクである。
我々は、トランスポート選択データセット間で転送可能な仕様戦略を学ぶマルチタスク強化学習フレームワークであるDelphosを紹介する。
Delphosは、モデル仕様を一連のモデリングアクションを適用し、モデル性能と収束に基づく推定環境からフィードバックを受け取るシーケンシャルな意思決定問題として捉えている。
異なる変数セットを持つデータセット間でモデリング決定を転送するために、Delphosは、DeepSet-Qアーキテクチャを使用してモデリング用語のセットとしてユーティリティ仕様を表現し、共有された仕様ポリシーが複数のデータセット間で学習できるようにする。
9つのトランスポート選択データセットに基づいてトレーニングされたDelphosは、独立にトレーニングされたシングルタスクエージェントを一貫して上回り、モデリングエクスペリエンスの共有が学習効率を改善し、予測試みの失敗を少なくしてモデリング決定の有望なシーケンスを特定するのに役立つことを示唆している。
目に見えないSwissmetroとDecisionsのデータセットにさらなるトレーニングを適用せずに適用した場合、同じエージェントが標準CPU上で20分以内の競合仕様を識別する。
スイスメトロのVNSメタヒューリスティックよりも高いログライクさを実現し、決定に関する専門家モデルによって開発されたMNL仕様に匹敵する性能を実現している。
これらの結果から,Delphosは個別選択モデル仕様のためのインテリジェントアシスタントとして機能することが示唆された。
これは手動による試行錯誤を減らすと同時に、モデル診断、精細化、最終選択の制御をモデラーが維持する。
関連論文リスト
- Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies [50.39041754816285]
本稿では、下流タスクと特定のモデルの両方にデータ選択を併用する多変数重み学習フレームワークを提案する。
提案手法は,GSM8Kのトレーニングサンプルの30%しか使用せず,フルデータセットチューニングに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2026-05-10T17:30:16Z) - AI Model Modulation with Logits Redistribution [24.570627116539512]
AIMはモデル変調パラダイムであり、単一のモデルが特定のエンド要件を満たすための多様な振る舞いを示すことを可能にする。
トレーニングデータに依存しない,再学習のない方法で運用する,ロジット再配布戦略を導入する。
本評価では, 画像分類, セマンティックセグメンテーション, テキスト生成を対象とするAlモデル変調のためのAIMの実用性と汎用性を確認した。
論文 参考訳(メタデータ) (2026-03-13T07:57:23Z) - Delphos: A reinforcement learning framework for assisting discrete choice model specification [0.0]
我々は、個別選択モデル仕様プロセスを支援するための深層強化学習フレームワークであるDelphosを紹介する。
この設定では、エージェントは、モデリングアクションのシーケンスを選択して、良好なパフォーマンスのモデル候補を特定することを学習する。
我々は,モデル空間と報酬関数のサイズを変化させ,シミュレーションと経験的データセットの両方でDelphosを評価した。
論文 参考訳(メタデータ) (2025-06-06T15:40:16Z) - Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning [78.72226641279863]
SMOE(Sparse Mixture of Expert)モデルは、言語モデリングにおける高密度モデルに代わるスケーラブルな代替品として登場した。
本研究は,SMoEアーキテクチャの設計に関する意思決定を行うために,タスク固有のモデルプルーニングについて検討する。
適応型タスク対応プルーニング手法 UNCURL を導入し,MoE 層当たりの専門家数をオフラインで学習する手法を提案する。
論文 参考訳(メタデータ) (2024-09-02T22:35:03Z) - MAP: Low-compute Model Merging with Amortized Pareto Fronts via Quadratic Approximation [80.47072100963017]
Amortized Pareto Front (MAP) を用いた新しい低演算アルゴリズム Model Merging を導入する。
MAPは、複数のモデルをマージするためのスケーリング係数のセットを効率的に識別し、関連するトレードオフを反映する。
また,タスク数が比較的少ないシナリオではベイジアンMAP,タスク数の多い状況ではNested MAPを導入し,計算コストを削減した。
論文 参考訳(メタデータ) (2024-06-11T17:55:25Z) - Building a Winning Team: Selecting Source Model Ensembles using a
Submodular Transferability Estimation Approach [20.86345962679122]
公開されている事前訓練されたモデルの目標タスクへの転送可能性の推定は、伝達学習タスクにとって重要な場所となっている。
本稿では, モデルアンサンブルの下流タスクへの転送可能性を評価するために, 最適なtranSportベースのsuBmOdular tRaNsferability Metrics(OSBORN)を提案する。
論文 参考訳(メタデータ) (2023-09-05T17:57:31Z) - Deep Learning Models for Knowledge Tracing: Review and Empirical
Evaluation [2.423547527175807]
我々は,オープンで広く利用されているデータセットを用いた深層学習知識追跡(DLKT)モデルをレビューし,評価する。
評価されたDLKTモデルは、以前報告した結果の再現性と評価のために再実装されている。
論文 参考訳(メタデータ) (2021-12-30T14:19:27Z) - Evaluating model-based planning and planner amortization for continuous
control [79.49319308600228]
我々は、モデル予測制御(MPC)と学習モデルとモデルフリーポリシー学習を組み合わせたハイブリッドアプローチを採っている。
モデルフリーエージェントは高いDoF制御問題においても強いベースラインであることがわかった。
モデルに基づくプランナを,パフォーマンスを損なうことなく,計画が損なわれるようなポリシーに置き換えることが可能であることを示す。
論文 参考訳(メタデータ) (2021-10-07T12:00:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。