論文の概要: CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
- arxiv url: http://arxiv.org/abs/2609.01600v1
- Date: Tue, 01 Sep 2026 17:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.943488
- Title: CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
- Title(参考訳): CordisBench: 動的エージェントのハーネスにおけるコンポーネントライフサイクルについて、言語モデルは理にかなっているのでしょうか?
- Authors: Damien Sileo, Dimitri Kachler,
- Abstract要約: 1200のライフサイクル推論のベンチマークであるCordisBenchを紹介します。
コントロールされたフォーマルな設定と、コンポーネントの依存関係とクリーンアップを管理するランタイムであるCordisに対して実行されるプログラムを組み合わせる。
我々は,2, 4, 8, 16, 24, 32の関連相互作用を用いた3つの効率指向モデルの評価を行った。
- 参考スコア(独自算出の注目度): 2.9458822941489387
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dynamic agent harnesses let language models change the software that shapes their own execution. This flexibility brings a new reasoning burden: a local plugin change can propagate through dependencies and cleanup. We introduce CordisBench, a 1,200-question benchmark of this lifecycle reasoning. It combines a controlled formal setting with programs executed against Cordis, a runtime that manages component dependencies and cleanup, and asks models to identify affected components, predict state after a specified teardown order, determine which conditions hold under all or some orders, and choose reconfigurations that succeed when executed. Across these tasks, we evaluate three efficiency-oriented models at low reasoning effort with 2, 4, 8, 16, 24, or 32 relevant interactions, using deterministic task-specific scoring. Models usually handle small systems well but grow less reliable as more interactions become relevant, especially when predicting final state and when reasoning across teardown orders. Additional inference effort recovers marked gains for some models. The cost is nontrivial: on our 16-interaction subset, GPT-5.6 Luna uses nearly 3,000 reasoning tokens per question at medium effort. For these controlled instances, that cost is avoidable: an independent finite reference semantics agrees with Cordis execution on every observation and action outcome used for scoring across all 528 executable questions.
- Abstract(参考訳): 動的エージェントは言語モデルに自身の実行を形作るソフトウェアを変更させる。
ローカルプラグインの変更は、依存関係とクリーンアップを通じて伝播することができる。
このライフサイクル推論の1200のベンチマークであるCordisBenchを紹介します。
コントロールされたフォーマルな設定と、コンポーネントの依存関係とクリーンアップを管理するランタイムであるCordisに対して実行されたプログラムを組み合わせることで、モデルに影響を受けるコンポーネントを特定し、指定された分解順序の後に状態を予測し、どの条件が全または一部の順序で保持されているかを判断し、実行時に成功する再設定を選択する。
これらの課題に対して,2,4,8,16,24,32の関連性を持った3つの効率指向モデルを,決定論的タスク固有スコアリングを用いて評価した。
モデルは通常、小さなシステムをうまく扱うが、多くの相互作用が関係するにつれて信頼性が低下する。
追加の推論の取り組みは、いくつかのモデルで顕著な利得を回復する。
GPT-5.6 Lunaは16-interactionのサブセットで、1問あたり3000近い推論トークンを中規模で使用しています。
独立した有限参照セマンティクスは、すべての528の実行可能な質問のスコア付けに使用されるすべての観察およびアクション結果に対してCordisの実行と一致します。
関連論文リスト
- From Prompt to Harness: Coderlet from Scratch [0.06768558752130312]
本稿では,コンテキスト形成,モデル決定,環境行動,観測復帰,状態継続による単一要求に従うことで,コンパクトなハーネス設計について検討する。
3つのバウンダリ--モデル、実行、状態--モデルサービス、ツール環境、永続的な状態を接続する一方、要求ライフサイクルはこれらの遷移が起こる順序を決定する。
モデル生成を環境アクションに変換し、実行時のフィードバックを後続の判断に伝達し、要求をまたいで状態が継続できるようにする。
論文 参考訳(メタデータ) (2026-08-10T11:47:26Z) - IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations [86.93902234336393]
IACM-RLは、堅牢なツール呼び出しのための包括的なフレームワークである。
我々は、13のきめ細かいゆらぎシナリオにまたがる軌道を合成するDynamicIntentパイプラインを導入する。
第2に、IACM-RLはBeliefStateベースのセルフ生成コンテキストマネージャをデプロイする。
論文 参考訳(メタデータ) (2026-08-03T12:09:50Z) - Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees [13.145367841870412]
コンピュータ使用エージェントは、関連するウィンドウがクローズされた後にのみ正しいアクションを生成するため、過渡的なGUIイベントで失敗することが多い。
本稿では,モデルを変更することなく,この遅延を解消する適応予測ポリシーツリー(AAPT)を提案する。
ライトウェイトオブザーバは、変更ゲートフレームを準備されたブランチにマッチさせ、新しいテキストを生成することなく、即座に対応するアクションを実行する。
論文 参考訳(メタデータ) (2026-07-30T15:50:10Z) - A Type-and-Effect System for Temporal Dependency Analysis of Render-based Reactive Programs [1.7400522414589747]
Reactにインスパイアされたリアクティブプログラミングの計算であるWilowを紹介します。
Willowは、レンダリングの観点で計算をモデル化する、タイムアウェアなオペレーションセマンティクスを提供する。
Willowは、リアクティブプログラムの時間的正しさを推論するための実践的な基盤を提供する。
論文 参考訳(メタデータ) (2026-07-29T15:59:21Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Programming over Thinking: Efficient and Robust Multi-Constraint Planning [54.77940831026738]
SCOPEは、クエリ固有の推論をジェネリックコード実行から切り離すフレームワークである。
SCOPEは、コストとレイテンシを下げながら最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-14T02:58:07Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - Are Large Reasoning Models Interruptible? [77.53059044071107]
LRM(Large Reasoning Models)は複雑な推論において優れているが、伝統的に静的な「凍った世界」設定で評価されている。
静的な設定で高い精度を達成できる最先端のLEMでさえ、割り込みやコンテキストの変化に晒された場合、予測不能に失敗する可能性があることを示す。
我々の分析ではさらに、漏れの原因、パニック、自己疑念など、いくつかの新しい障害モードを明らかにしている。
論文 参考訳(メタデータ) (2025-10-13T17:59:35Z) - Towards Dynamic Consistency Checking in Goal-directed Predicate Answer
Set Programming [2.3204178451683264]
本稿では,動的一貫性チェック(Dynamic Consistency check)と呼ばれるトップダウン評価戦略のバリエーションを示す。
これにより、リテラルがプログラムのグローバルな制約に関連する否定と互換性がないかどうかを判断できる。
我々は、標準バージョンのs(CASP)の最大90倍のスピードアップを実験的に観察した。
論文 参考訳(メタデータ) (2021-10-22T20:38:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。