論文の概要: Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents
- arxiv url: http://arxiv.org/abs/2609.35911v1
- Date: Mon, 28 Sep 2026 08:06:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.887501
- Title: Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents
- Title(参考訳): LLMエージェントの事前テストタイム学習
- Abstract要約: StepLearnは、永続的な信頼から即時の使用を分離する非パラメトリックフレームワークである。
情報的な遷移を仮説に変え、次のステップを導く。
GPT-5-miniでの平均成功率は59.9%、84.0%、Qwen3.5-35B-A3Bで57.8%、88.1%である。
- 参考スコア(独自算出の注目度): 55.440058537827134
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting large language model agents during deployment requires not only retaining past experience, but also turning new observations into timely guidance. Many test-time learning methods, however, acquire knowledge from completed episodes. Feedback from an ongoing interaction may therefore not be distilled into knowledge soon enough to help the next decision. Acquiring knowledge at the granularity of individual transitions could reduce this delay, but raises a separate challenge: a rule that is useful within one episode may not be reliable enough to guide future episodes. Waiting for validation can forfeit immediate benefits, whereas unrestricted reuse can propagate accidental or misattributed guidance. We introduce StepLearn, a nonparametric framework that separates immediate use from persistent trust. It turns informative transitions into hypotheses that can guide the next step, while requiring prospective validation before reuse across episodes. Their predicted effects are checked against subsequent observations outside the source episodes, and only sufficiently supported hypotheses become available for persistent guidance. This process updates external knowledge while keeping all model parameters fixed. Over five rounds on WebArena-Lite and ALFWorld, StepLearn achieves average success rates of 59.9% and 84.0% with GPT-5-mini, and 57.8% and 88.1% with Qwen3.5-35B-A3B, respectively. It outperforms EvoTest, the strongest baseline, by 2.2-12.7 percentage points across the four settings. Learning dynamics further shows that these gains are not restricted to the final repetition, with advantages already present on first task attempts in most settings.
- Abstract(参考訳): デプロイメント中に大きな言語モデルエージェントに適応するには、過去の経験を保持するだけでなく、新たな観察をタイムリーなガイダンスに変換する必要がある。
しかし、多くのテストタイム学習手法は、完成したエピソードから知識を得る。
したがって、進行中の相互作用からのフィードバックは、次の決定を助けるのに十分な知識に蒸留されないかもしれない。
個々の移行の粒度で知識を取得することは、この遅延を減少させる可能性があるが、別の課題を生じさせる。
バリデーションを待つことは即時利益を排除しうるが、制限のない再利用は偶発的あるいは不正なガイダンスを広める可能性がある。
StepLearnは、永続的な信頼から即時の使用を分離する非パラメトリックフレームワークです。
次のステップを導くことができる仮説に情報的遷移を変換し、エピソードをまたいで再利用する前に予見的な検証を必要とします。
それらの予測された効果は、元のエピソード以外の観測結果に対してチェックされ、十分な支持された仮説のみが永続的なガイダンスとして利用できるようになる。
このプロセスは、すべてのモデルパラメータを固定しながら、外部の知識を更新します。
WebArena-LiteとALFWorldの5ラウンドで、StepLearnはGPT-5-miniで59.9%、84.0%、Qwen3.5-35B-A3Bで57.8%、88.1%の平均的な成功率を達成した。
最強のベースラインであるEvoTestを2.2-12.7ポイント上回っている。
学習ダイナミクスはさらに、これらのゲインが最終繰り返しに限定されていないことを示しており、ほとんどの設定で最初のタスク試行にすでに利点がある。
関連論文リスト
- Shockingly Simple Self-retrospection Improves Agentic Models Without RL [56.88703385147974]
本研究は,説明のみの訓練がその後の行動に与える影響を分離するために,レトロスペクティブ・オンリー・ファインチューニングについて検討する。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
論文 参考訳(メタデータ) (2026-09-28T17:54:24Z) - DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement [28.796799881538274]
DENSEは、軌道由来の証拠をネストしたショートカットツリーに整理する。
ノイズの多い実行トレースを構造化された再利用可能なタスク解決フィードバックに変換する。
ターミナル・ベンチ2.1の4つのエージェントモデルの中で最も厳格なパスレートを達成している。
論文 参考訳(メタデータ) (2026-09-18T07:36:21Z) - ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding [19.559643217912114]
既存のMultiple-choice question (MCQ)ベンチマークは、質問や候補オプションを通じて、意図的にターゲットイベントをリークする。
本稿では, 対実的発見と説明のための効果的なトレーニングフレームワークであるFADEを紹介する。
FADEは、DualityVidQA-test と IPV-Bench の3つのタスクにまたがる、最先端の厳密なペアスコアを達成し、GPT-5.6を上回った。
論文 参考訳(メタデータ) (2026-08-11T10:22:08Z) - AhaBench: Do Agents Turn Experience into Reusable Insights? A Long-Horizon Benchmark for Continual Learning [6.511310130508893]
AhaBenchは、経験から継続的に学ぶ言語エージェントの能力を評価する。
ベンチマークはエージェントの学習方法に非依存であり、評価されたエージェントは固定モデルウェイトを使用する。
オイラーでは、作業手順はモデル全体で 80.0-100.0% の精度を保留し、質問+回答の教育は 0.0-73.9% の精度を得る。
論文 参考訳(メタデータ) (2026-06-30T04:04:01Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - R-Tuning: Instructing Large Language Models to Say `I Don't Know' [66.11375475253007]
大きな言語モデル(LLM)は、優れたパフォーマンスで多くのドメインに革命をもたらしたが、それでもその課題に直面している。
事前の指導チューニング方法は、モデルが知識を知っているかどうかに関わらず、モデルに文章を完成させるよう強制する。
我々はRefusal-Aware Instruction Tuning (R-Tuning)と呼ばれる新しいアプローチを提案する。
実験の結果、R-Tuningは、既知の質問に答えたり、未知の質問に答えるのを控えるモデルの能力を効果的に改善することを示した。
論文 参考訳(メタデータ) (2023-11-16T08:45:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。