論文の概要: From Prompt to Harness: Coderlet from Scratch
- arxiv url: http://arxiv.org/abs/2608.09480v1
- Date: Mon, 10 Aug 2026 11:47:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.240976
- Title: From Prompt to Harness: Coderlet from Scratch
- Title(参考訳): PromptからHarnessへ - CoderletからScratchへ
- Abstract要約: 本稿では,コンテキスト形成,モデル決定,環境行動,観測復帰,状態継続による単一要求に従うことで,コンパクトなハーネス設計について検討する。
3つのバウンダリ--モデル、実行、状態--モデルサービス、ツール環境、永続的な状態を接続する一方、要求ライフサイクルはこれらの遷移が起こる順序を決定する。
モデル生成を環境アクションに変換し、実行時のフィードバックを後続の判断に伝達し、要求をまたいで状態が継続できるようにする。
- 参考スコア(独自算出の注目度): 0.06768558752130312
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A model alone does not determine how a programming agent acts. What the model sees, how actions enter the environment, how feedback returns, and how one run affects the next all depend on how the harness is organized. Minimal examples usually show only the basic interaction between a model and tools, while production systems spread these relationships across complex components and dependencies. This paper studies a compact harness design by following a single request through context formation, model decision, environmental action, observation return, and state continuation. Three boundaries---model, execution, and state---connect the model service, tool environment, and persistent state, while the request lifecycle determines the order in which these transitions occur. Together, they show the harness's core role: turning model generations into environmental actions, carrying runtime feedback into later decisions, and allowing state to continue across requests. On top of this runtime structure, a harness can also be gradually refined across runs through continued bootstrapping. The design is realized in the executable artifact https://github.com/lilinxi/Coderlet.
- Abstract(参考訳): モデルだけでは、プログラミングエージェントがどのように振る舞うかを決定できない。
モデルが見ているもの、アクションが環境に入る方法、フィードバックの返却方法、そして次の実行方法がどう影響するかは、ハーネスがどのように組織化されているかによって異なります。
最小限の例は、通常、モデルとツールの間の基本的な相互作用だけを示し、プロダクションシステムはこれらの関係を複雑なコンポーネントや依存関係に分散させます。
本稿では,コンテキスト形成,モデル決定,環境行動,観測復帰,状態継続による単一要求に従うことで,コンパクトなハーネス設計について検討する。
3つのバウンダリ--モデル、実行、状態--モデルサービス、ツール環境、永続的な状態を接続する一方、要求ライフサイクルはこれらの遷移が起こる順序を決定する。
モデル生成を環境アクションに変換し、実行時のフィードバックを後続の判断に伝達し、要求をまたいで状態が継続できるようにする。
このランタイム構造に加えて、実行中のブートストラップを通じてハーネスを徐々に洗練することもできる。
設計は実行可能なアーティファクト https://github.com/lilinxi/Coderlet で実現されている。
関連論文リスト
- CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses? [2.9458822941489387]
1200のライフサイクル推論のベンチマークであるCordisBenchを紹介します。
コントロールされたフォーマルな設定と、コンポーネントの依存関係とクリーンアップを管理するランタイムであるCordisに対して実行されるプログラムを組み合わせる。
我々は,2, 4, 8, 16, 24, 32の関連相互作用を用いた3つの効率指向モデルの評価を行った。
論文 参考訳(メタデータ) (2026-09-01T17:59:13Z) - HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - Harness Continual Learning: Continual Adaptation Beyond Model Parameters [9.54786133734043]
我々は、凍結基盤モデルを中心にハーネスが進化する新しい連続学習パラダイムを定式化する。
候補者は、現在の改善、履歴保持、有効性を確認した後にのみハーネスをコミットする。
実験では、複数の設定で対応するベースラインに対して、相対的なゲインが10%を超える能力の蓄積と障害回復が示されている。
論文 参考訳(メタデータ) (2026-08-19T15:12:31Z) - From Resource Flow to Executable Tests: Petri-Net-Guided LLM Test Generation for Concurrent Stateful Rust APIs [5.064868362565062]
コンカレントステートフルライブラリAPIは、リソースオーナシップの進化、ライフサイクル状態、競合するインターリーブを通じて、振る舞いを公開する。
大規模な言語モデルは実行可能なRustテストを合成できるが、その出力はAPIの前提条件に違反したり、浅いままだったり、偶然のトレースを減らしたりすることが多い。
本稿では,形式的なシナリオ設計と低コストなテストクリエティゼーションのギャップについて論じる。
論文 参考訳(メタデータ) (2026-07-23T17:15:53Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Bootstrap Your Generator: Unpaired Visual Editing with Flow Matching [79.46676932242569]
本稿では,フローマッチング編集モデルの非ペア化学習のためのフレームワークを提案する。
ByGは、凍結モデルから抽出した命令追従キューと、構造保存のためのサイクル整合性とをペアリングする。
我々は,データスカース画像と映像編集の課題に対する最先端の成果を実証する。
論文 参考訳(メタデータ) (2026-06-02T17:07:08Z) - Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents [4.765206163164323]
モデル重みや評価環境を変化させることなく冷凍LDMエージェントを改善するライフサイクル対応ランタイムハーネスであるLife-Harnessを提案する。
ライフ・ハーネスは、繰り返し発生する相互作用の失敗を、環境契約、手続きスキル、行動実現、軌道規制にまたがる再利用可能な介入に変換することによって、訓練軌道から進化する。
ライフハーネスはモデル116のうち116で改善され、環境設定は18モデルバックボーンで改善され、平均的な相対的改善は88.5%である。
論文 参考訳(メタデータ) (2026-05-21T08:36:49Z) - Are Large Reasoning Models Interruptible? [77.53059044071107]
LRM(Large Reasoning Models)は複雑な推論において優れているが、伝統的に静的な「凍った世界」設定で評価されている。
静的な設定で高い精度を達成できる最先端のLEMでさえ、割り込みやコンテキストの変化に晒された場合、予測不能に失敗する可能性があることを示す。
我々の分析ではさらに、漏れの原因、パニック、自己疑念など、いくつかの新しい障害モードを明らかにしている。
論文 参考訳(メタデータ) (2025-10-13T17:59:35Z) - Online Joint Fine-tuning of Multi-Agent Flows [12.851745991007169]
本稿では,ラーニング・トゥ・サーチフレームワークに触発された全フローのオンライン共同微調整手順について述べる。
このアプローチはシミュレータアクセスを活用して、エピソード全体の好みを減らし、個々のノード出力よりも好みを減らします。
私は、最先端の結果を達成するためのマルチホップQAデータセットMuseicに適用します。
論文 参考訳(メタデータ) (2024-06-06T21:21:03Z) - piHyFlow Operational Semantics [65.268245109828]
piHyFlowは、一連の通信プロセスを使用してハイブリッドモデルを表現するためのフォーマリズムである。
プロセスはpiHyFlowベースモデルにカプセル化され、共有メモリを介して通信する。
piHyFlowは、モデルが入力インターフェースと出力インターフェースでのみ通信できることを強制することによって、モジュラリティを保証することができる。
論文 参考訳(メタデータ) (2023-10-20T17:37:39Z) - Generative Models as a Complex Systems Science: How can we make sense of
large language model behavior? [75.79305790453654]
事前訓練されたモデルから望ましい振る舞いを排除し、望ましくないモデルを避けながら、NLPを再定義した。
言語モデルの振る舞いをタスク間性能を説明するカテゴリに分解する体系的な取り組みについて論じる。
論文 参考訳(メタデータ) (2023-07-31T22:58:41Z) - Faithful Question Answering with Monte-Carlo Planning [78.02429369951363]
本稿では,FAME(Fithful Questioning with Monte-carlo planning)を提案する。
我々は,タスクを離散的な意思決定問題として定式化し,推論環境とコントローラの相互作用によって解決する。
FAMEは標準ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-05-04T05:21:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。