論文の概要: EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering
- arxiv url: http://arxiv.org/abs/2609.08435v2
- Date: Wed, 09 Sep 2026 04:21:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.620128
- Title: EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering
- Title(参考訳): EvolveScaler: 実行可能なステートマシンと自然言語レンダリングによる情報進化コンテキストの合成
- Authors: Ziliang Zhao, Zenan Xu, Shuting Wang, Zhao Wang, Bowen Cao, Minda Hu, Lincheng Li, Pluto Zhou, Zhicheng Dou,
- Abstract要約: 我々はEvolveScalerを紹介した。EvolveScalerはコード駆動のフレームワークで、自然言語としてレンダリングする前に情報進化を定義する。
EvolveScalerを117のタスクプロトタイプと159のファイナルクエスト演算子でインスタンス当たり約7~1200のイベントにまたがる5つの難易度でインスタンス化する。
very_longティアでは、最強のモデルが59.3%のavg@5に達し、6つのモデルが10%以下である。
- 参考スコア(独自算出の注目度): 57.87517047585447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In persistent interactions, long contexts may encode an evolving process rather than a fixed record: later events can revise or revoke earlier information, changing what remains valid and what conclusions follow. We call this setting information evolution (IE). Solving IE requires identifying valid records, applying updates in order, and reconstructing the query-relevant state from the event history. Existing text-first synthesis pipelines make such data difficult to verify because state transitions and answer logic remain implicit. We introduce EvolveScaler, a code-driven framework that defines information evolution before rendering it as natural language. Human-authored operational specifications define state transitions, record validity, difficulty controls, and executable answer logic; a strong LLM then synthesizes a self-contained simulator from each specification. Executing validated simulators produces natural-language multi-turn event histories, while deterministic replay computes reference answers and atomic checklists. We instantiate EvolveScaler with 117 task prototypes and 159 final-question operators across five difficulty levels spanning approximately 7 to 1,200 events per instance, yielding about 35,100 training examples and 585 validated evaluation instances. On the very_long tier, the strongest model reaches 59.3% avg@5, while six models score below 10%. Training an internal A3B model on 6,000 EvolveScaler examples improves performance over its base checkpoint on all eight independently constructed out-of-distribution benchmarks, with a 5.25-point average gain. These results show that code-driven IE synthesis provides both challenging evaluation and transferable training supervision.
- Abstract(参考訳): 永続的な相互作用では、長いコンテキストは固定レコードではなく進化過程をエンコードすることがある。
これを設定情報進化(IE)と呼ぶ。
IEを解決するには、有効なレコードを特定し、順番に更新を適用し、イベント履歴からクエリ関連状態を再構築する必要がある。
既存のテキストファースト合成パイプラインは、状態遷移と応答ロジックが暗黙的に残っているため、そのようなデータの検証を困難にしている。
我々はEvolveScalerを紹介した。EvolveScalerはコード駆動のフレームワークで、自然言語としてレンダリングする前に情報進化を定義する。
人間による運用仕様では、状態遷移、レコードの妥当性、難易度制御、実行可能応答論理を定義し、強いLCMは各仕様から自己完結型シミュレータを合成する。
検証されたシミュレータの実行は、自然言語のマルチターンイベント履歴を生成し、決定論的リプレイは参照回答とアトミックチェックリストを計算します。
EvolveScalerを117のタスクプロトタイプと159のファイナルクエスト演算子でインスタンス当たり約7~1200のイベントにまたがる5つの難易度でインスタンス化し、約35,100のトレーニングサンプルと585の検証済み評価インスタンスを生成します。
very_longティアでは、最強のモデルが59.3%のavg@5に達し、6つのモデルが10%以下である。
6,000 EvolveScalerの例で内部のA3Bモデルをトレーニングすると、独立に構築された8つのアウト・オブ・ディストリビューション・ベンチマークのベースチェックポイントよりもパフォーマンスが向上し、平均5.25ポイントのゲインが得られる。
これらの結果は、コード駆動IE合成は、困難な評価と伝達可能なトレーニングの監督の両方を提供することを示している。
関連論文リスト
- EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants [10.510136510866099]
大規模な言語モデルはインタラクティブなWebインターフェースを生成することができるが、ユーザ要求が進化するにつれて、信頼できる生成UIは実行可能なアーティファクトを維持する必要がある。
我々はEvoGenUI-Benchを紹介した。EvoGenUI-Benchは150の5ターンタスクと750のターンを3つのシナリオに分けたマルチターンインタフェースメンテナンスのベンチマークである。
生成されたアーティファクトをブラウザで実行し、スクリーンショット、ソースおよびDOMエビデンス、アクタートレース、実行時ログを使用して評価します。
論文 参考訳(メタデータ) (2026-08-29T17:54:02Z) - VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct [71.22358682581215]
ビジュアルな数学的推論のための強化学習のスケーリングは、難しい質問を生成すること以上のものを必要とします。
これは2つのコンポーネントからなる反復的なフレームワークであるVeriEvolとしてインスタンス化します。
5ベンチマークのビジュアル・マス・スイートでは、10Kから250KサンプルまでのSFTデータのスケーリングが平均精度を35.42から54.73に引き上げている。
論文 参考訳(メタデータ) (2026-06-22T16:17:30Z) - Agentic Insight Generation in VSM Simulations [4.626393563516877]
本稿では,バリューストリームマップシミュレーションのための分離された2段階のエージェントアーキテクチャを提案する。
データ分析からオーケストレーションを分離することで、システムはドメインエキスパートの知識を取り入れた進歩的なデータ発見を活用する。
複数の最先端の大規模言語モデルの成果は、フレームワークの生存可能性を示している。
論文 参考訳(メタデータ) (2026-04-14T08:11:53Z) - Pioneer Agent: Continual Improvement of Small Language Models in Production [6.452260317191361]
小さな言語モデルは、低コスト、高速な推論、特殊化の容易さのために、製品展開にとって魅力的なものだ。
特定のタスクに小さな言語モデルを適用するプロセスを自動化するクローズドループシステムであるPioneer Agentを提案する。
論文 参考訳(メタデータ) (2026-04-10T18:13:09Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios [71.65387146697319]
大規模言語モデル(LLM)は、数学の競争、複雑なコーディング、科学的推論といったタスクのために広く研究されている。
物理シナリオをシミュレートしてLLMを訓練し,評価する最初の体系的な研究であるSimuSceneを提案する。
品質を保証するために、人間の検証とともに、データ収集のための自動パイプラインを構築します。
論文 参考訳(メタデータ) (2026-02-11T13:26:02Z) - Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning [18.75349680577575]
SSLogicは、コントロール可能な困難を伴う継続的家族進化のためのフレームワークである。
SSLogicに進化したデータのトレーニングは、一致したステップでシードベースラインに対して一貫した利得を得る。
論文 参考訳(メタデータ) (2026-01-23T13:26:01Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data [0.6278186810520364]
大規模言語モデル(LLM)は、様々なタスクにおいて顕著なパフォーマンスを示している。
既存の評価ベンチマークは、しばしば静的で、その堅牢性と一般化を十分に評価するのに不十分である。
本稿では,質問応答などのクローズドなタスクのための進化型評価フレームワークであるAutoEvoEvalを提案する。
論文 参考訳(メタデータ) (2025-06-30T11:18:56Z) - Logical Reasoning for Task Oriented Dialogue Systems [57.440956636333325]
本稿では,ロバータやT5などの変圧器モデルに対して,与えられた対話コンテキストにおける事実の集合を推論する新しい手法を提案する。
本手法は,モデルが論理関係を学習するのに役立つ合成データ生成機構を含む。
対話コンテキストが全ての必要な情報を含む場合、変換器に基づくモデルが論理的推論を行い、質問に答えることを示す。
論文 参考訳(メタデータ) (2022-02-08T21:46:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。