論文の概要: Evaluating Multi-Dimensional Generalization of Large Language Models in Temporal Extraction Tasks
- arxiv url: http://arxiv.org/abs/2610.02549v1
- Date: Thu, 01 Oct 2026 22:35:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:20:54.756514
- Title: Evaluating Multi-Dimensional Generalization of Large Language Models in Temporal Extraction Tasks
- Title(参考訳): 時間的抽出課題における大規模言語モデルの多次元一般化の評価
- Abstract要約: 本研究では,LLMの時間的一般化とイベント表現抽出タスクについて検討する。
高いベースタスク性能は、一般的により良い一般化を予測している。
時間的抽出タスクの一般化は、任意の1次元だけでは予測できないと結論づける。
- 参考スコア(独自算出の注目度): 4.046982081597688
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Time and event expression extraction are fundamental temporal reasoning tasks, but the problem remains difficult due to annotation ambiguity, domain sensitivity, and unstable model behavior. Existing evaluations focus on in-domain performance, offering limited insight into reliability under distribution shifts. We evaluate multiple model configurations across families, architectures, and reasoning strategies over four dimensions of generalization, examining transfer from base performance, cross-dimensional correlations, and the effects of scale, architecture, and prompting. This provides a systematic study of how prompted LLMs generalize in time and event expression extraction tasks. We find that strong base-task performance generally predicts better generalization. However, this relationship weakens under substantial distribution shifts. Inductive prompting performs most consistently across domain shift, adversarial perturbations, compositionality, and length increase, while gains from scale, architecture, and deductive and abductive prompting strategies are uneven and dimension-specific. We conclude that LLM generalization in temporal extraction tasks cannot be predicted from any single dimension alone and cannot be reliably inferred from in-domain or single-dimension evaluations, highlighting the need for reasoning strategies that generalize across dimensions.
- Abstract(参考訳): 時間とイベント表現の抽出は基本的な時間的推論のタスクであるが、アノテーションの曖昧さ、ドメインの感度、不安定なモデル行動のために問題は依然として困難である。
既存の評価はドメイン内のパフォーマンスに重点を置いており、分散シフト下での信頼性に関する限られた洞察を提供する。
一般化の4次元にわたって,家族,建築,理学の複数のモデル構成を評価し,基本性能,相互相関,スケール,アーキテクチャ,プロンプトの影響について検討した。
このことは、LLMが時間およびイベント表現抽出タスクをどのように一般化するかを体系的に研究する。
高いベースタスク性能は、一般的により良い一般化を予測している。
しかし、この関係は実質的な分布シフトによって弱まる。
帰納的プロンプトは、ドメインシフト、対向的摂動、構成性、長さの増加、そしてスケール、アーキテクチャ、帰納的プロンプト戦略から得られる利益は不均一で次元に比例する。
時間的抽出タスクにおけるLCMの一般化は,どの次元からでも予測することはできず,ドメイン内評価や単次元評価から確実に推測することは不可能であり,次元をまたいで一般化する推論戦略の必要性を強調した。
関連論文リスト
- Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection [58.25418970608328]
単一ソースドメイン上でトレーニングされた検出器を複数の未確認領域に転送することを目的としたシングルドメイン一般化オブジェクト検出(Single-DGOD)について検討する。
既存の手法は主に、トレーニング分布を拡大するために、データ拡張やテキストプロンプトといったシミュレーション駆動の戦略に依存している。
本稿では, 未知領域の一般化を多様体回帰問題として定式化する, Visual-Text Dual Chain-of-Thought (MR-DCoT) を用いたマニフォールド回帰を提案する。
論文 参考訳(メタデータ) (2026-07-08T09:27:15Z) - Understanding Generalization and Forgetting in In-Context Continual Learning [20.151689821430043]
コンテキスト内学習により、大規模言語モデルは、プロンプトベースの推論だけで新しいタスクに適応できる。
既存の理論では、ICLをシングルタスク設定で研究しているが、現実世界のプロンプトは、しばしば不均一なタスクのシーケンスを含む。
本稿では,事前学習されたトランスフォーマーが1つのプロンプト内で複数のシーケンシャルタスクをどのように処理するかをモデル化する,コンテキスト内連続学習のための最初の理論的枠組みを提案する。
論文 参考訳(メタデータ) (2026-05-27T16:31:51Z) - On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks [56.98385132295952]
簡単な計画課題において,チェーン・オブ・ソート・アプローチがいかに一般化するかを評価する。
複数のテキスト形式を組み合わせた推論トレースが、最高の(かつ非自明な)OOD一般化をもたらすことが分かりました。
純粋にテキストベースのモデルは、画像ベースの入力を利用するモデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-17T09:51:40Z) - Effective Reasoning Chains Reduce Intrinsic Dimensionality [53.24264007741698]
内在次元は、与えられた精度閾値に達するために必要なモデル次元の最小数の尺度である。
実効的推論戦略はタスクの本質的な次元性を一貫して減少させることを示す。
より少ないパラメータでタスクを圧縮することで,効果的な推論連鎖が学習を促進することが示唆された。
論文 参考訳(メタデータ) (2026-02-09T23:32:12Z) - Generalization Analysis and Method for Domain Generalization for a Family of Recurrent Neural Networks [11.316438734182931]
本稿では,リカレントニューラルネットワーク群(RNN)の解釈可能性とドメイン外一般化(OOD)を解析する手法を提案する。
具体的には、訓練されたRNN状態の進化を、未知の離散時間非線形閉ループフィードバックシステムとしてモデル化する。
OOD一般化誤差を低減し、分散シフトに対するロバスト性を改善するドメイン一般化法を提案する。
論文 参考訳(メタデータ) (2026-01-13T01:27:10Z) - Learning Time-Aware Causal Representation for Model Generalization in Evolving Domains [50.66049136093248]
動的因果要因と因果機構のドリフトを組み込んだ時間認識型構造因果モデル(SCM)を開発した。
本研究では,時間領域毎に最適な因果予測値が得られることを示す。
合成と実世界の両方のデータセットの結果から,SynCは時間的一般化性能に優れることが示された。
論文 参考訳(メタデータ) (2025-06-21T14:05:37Z) - PixelThink: Towards Efficient Chain-of-Pixel Reasoning [70.32510083790069]
PixelThinkは、外部から推定されるタスクの難しさと内部で測定されたモデルの不確実性を統合する、シンプルで効果的なスキームである。
シーンの複雑さと予測信頼度に応じて推論の長さを圧縮することを学ぶ。
実験により,提案手法は推論効率と全体セグメンテーション性能の両方を改善した。
論文 参考訳(メタデータ) (2025-05-29T17:55:49Z) - Continuous Domain Generalization [32.29899595196802]
本稿では,予測モデルを未確認領域に一般化することを目的とした連続領域一般化(CDG)の課題を紹介する。
幾何学的および代数的理論に基礎を置き、領域をまたいだ最適モデルパラメータが低次元多様体上に存在することを示す。
リモートセンシング,科学文書,交通予測などの合成および実世界のデータセット実験により,本手法が一般化精度とロバスト性の両方において既存のベースラインを著しく上回ることを示した。
論文 参考訳(メタデータ) (2025-05-17T12:39:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。