論文の概要: Test-Time Agent Evolution for Long-Horizon Legal Reasoning
- arxiv url: http://arxiv.org/abs/2610.08138v1
- Date: Tue, 06 Oct 2026 10:53:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.945615
- Title: Test-Time Agent Evolution for Long-Horizon Legal Reasoning
- Title(参考訳): 長期法理推論のための試験時間エージェント進化
- Abstract要約: モデルパラメータを更新することなく,事前のケースからの展開時間信号と継続するインタラクションをエージェントが活用する,トレーニングフリーなテストタイムエージェント適応について検討する。
本稿では, 過去の事例から再利用可能な体験を復元し, 現実的, 手続き的コンテキストに適応し, その後の意思決定のために蓄積した経験を集約するために, emphTest-Time Memory Evolutionを提案する。
J1-EVAL と LegalWorld の5つのバックボーンモデルに対する実験は、合理的な相互作用と計算コストによる代表的推論とエージェントベースラインよりも一貫した改善を示している。
- 参考スコア(独自算出の注目度): 44.91642609037956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Legal intelligence aims to support reliable decision-making across long-horizon legal processes involving evolving case states and multiple roles. However, real-world legal deployment exhibits substantial case heterogeneity in facts, evidence, and procedural contexts, exposing the limitations of static agent strategies. Moreover, legal reasoning is inherently interdependent across roles and procedural stages, making global reliability fundamentally different from isolated role competence. To address these challenges, we study training-free test-time agent adaptation, where agents continuously exploit deployment-time signals from preceding cases and ongoing interactions without updating model parameters. We propose \method, which introduces \emph{Test-Time Memory Evolution} to retrieve reusable experience from previous cases, adapt it to the current factual and procedural context, and consolidate accumulated experience for subsequent decision-making. Further, \emph{Rubric-Aligned Collaboration} verifies and revises role-specific actions according to behavioral and procedural requirements, enabling coordinated decision-making across roles and stages. Extensive experiments on J1-EVAL and LegalWorld across five backbone models demonstrate consistent improvements over representative reasoning and agent baselines with reasonable interaction and computational costs. Ablation and case studies further show that the two components provide complementary benefits in experience adaptation and cross-role coordination, improving the reliability and efficiency of long-horizon legal reasoning.
- Abstract(参考訳): 法的なインテリジェンスは、進化するケース状態と複数の役割を含む長期の法的プロセスにおける信頼性の高い意思決定を支援することを目的としている。
しかし、現実の法的な展開は、事実、証拠、手続き的文脈においてかなりのケースの不均一性を示し、静的エージェント戦略の限界を露呈している。
さらに、法的推論は本質的に役割と手続き段階の間で相互依存しており、グローバルな信頼性は独立した役割能力と根本的に異なる。
これらの課題に対処するために,エージェントがモデルパラメータを更新することなく,先行するケースからの展開時間信号や継続するインタラクションを継続的に活用する,トレーニング不要なテストタイムエージェント適応について検討する。
本稿では,従来の事例から再利用可能な経験を回収し,現在の事実および手続き的文脈に適応し,その後の意思決定のために蓄積した経験を統合するために,‘emph{Test-Time Memory Evolution’を導入する。
さらに、emph{Rubric-Aligned Collaboration</a>は、行動的および手続き的要件に従ってロール固有のアクションを検証し、修正し、役割やステージ間で協調的な意思決定を可能にする。
J1-EVAL と LegalWorld の5つのバックボーンモデルに対する大規模な実験は、適切な相互作用と計算コストを伴う代表的推論とエージェントベースラインよりも一貫した改善を示している。
アブレーションおよびケーススタディにより、この2つのコンポーネントは、経験適応とクロスロールコーディネートにおいて相補的な利点をもたらし、長期の法的推論の信頼性と効率を向上させることが示されている。
関連論文リスト
- VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning [80.69185348729495]
我々は,政策の共進化,訓練カリキュラム,審査を通じて検証をスケールする枠組みを導入する。
ポリシー改善ループは、繰り返し発生する障害を診断し、適応的なカリキュラムを構築し、ポリシーを最適化するためにルーリックな判断を使用する。
運転およびロボットナビゲーションタスクの実験は、ポリシーと判断能力の両方において継続的な自己改善を示す。
論文 参考訳(メタデータ) (2026-10-06T17:50:29Z) - LegalOne: A Family of Foundation Models for Reliable Legal Reasoning [54.57434222018289]
我々は、中国の法律ドメインに特化された基礎モデルのファミリーであるLegalOneを紹介します。
LegalOneは、法的推論をマスターするために設計された包括的な3フェーズパイプラインを通じて開発されている。
LegalOneの重み付けとLegalKit評価フレームワークを公開して、Legal AIの分野を前進させます。
論文 参考訳(メタデータ) (2026-01-31T10:18:32Z) - AgenticSimLaw: A Juvenile Courtroom Multi-Agent Debate Simulation for Explainable High-Stakes Tabular Decision Making [0.6218206949753592]
我々はAgenticSimLawを紹介した。これは、透明で制御可能なテストタイム推論を提供するロール構造化マルチエージェントの議論フレームワークである。
ブラックボックスアプローチとは異なり、裁判所スタイルのオーケストレーションでは、エージェントの役割を明確に定義しています。
NLSY97データセットを用いて、この枠組みを若者の復習予測にベンチマークする。
論文 参考訳(メタデータ) (2026-01-29T16:26:10Z) - On Verifiable Legal Reasoning: A Multi-Agent Framework with Formalized Knowledge Representations [0.0]
本稿では,法的な推論を異なる知識獲得と応用段階に分解するモジュール型マルチエージェントフレームワークを提案する。
第一段階では、特殊エージェントは法的概念を抽出し、規則を形式化し、法令の検証可能な中間表現を作成する。
第2段階では、クエリを分析してケース事実をスキーマにマッピングし、論理的に関連する結論を導出するためのシンボリック推論を実行し、最終的な回答を生成するという3つのステップを通じて、この知識を特定のケースに適用する。
論文 参考訳(メタデータ) (2025-08-31T06:03:00Z) - Justified Evidence Collection for Argument-based AI Fairness Assurance [7.65321625950609]
本稿では,2段階の議論に基づく保証に対する動的アプローチを運用するために,ソフトウェアツールがサポートするシステムエンジニアリング駆動フレームワークを提案する。
フレームワークの有効性は、フェアネスに関連する議論を支援することに焦点を当てた、金融における実証的なケーススタディによって実証される。
論文 参考訳(メタデータ) (2025-05-12T21:05:33Z) - Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective [59.61868506896214]
標準的なデータカバレッジの仮定では、強化学習はプロセスの監督よりも統計的に難しいものではない。
任意のポリシーの利点関数が最適なプロセス報酬モデルとして機能することを証明する。
論文 参考訳(メタデータ) (2025-02-14T22:21:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。