論文の概要: Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity
- arxiv url: http://arxiv.org/abs/2609.26891v2
- Date: Wed, 30 Sep 2026 03:58:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:25.431365
- Title: Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity
- Title(参考訳): Harness as a Language: 最大表現力を備えたミニマリストエージェントフレームワーク
- Abstract要約: invokeは2つの定義プロパティを満たす最も単純なループです。
Letta (MemGPT)は、StuLifeのリコール重部分の半分のコストで8%パフォーマンスが向上する。
継続的自己改善では、JAZ invokeは、AppWorldでより低コストでACEを4%上回ります。
- 参考スコア(独自算出の注目度): 13.79875341957468
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern language-model agents are built around the agent loop: the LLM is placed in an environment exposing a set of tools, and the LLM has full control over the workflow by alternating between tool calls and observing their output. However, certain capabilities such as long-term memory and self-improvement currently require specialized systems beyond the agent loop itself. We built an LLM agent framework, JAZ, to explore the extent to which a minimal harness that is little more than the agent loop itself can accomplish tasks these specialized systems are built for. JAZ exposes a single LLM-based primitive `invoke` and provides a set of built-in hooks that allow the programmer to apply constraints and perform monitoring. Generalizing existing code-mode agent loops, `invoke` is the simplest loop that satisfies two defining properties: (1) the LLM can write arbitrary executable code that can include recursive `invoke`; (2) everything visible to the LLM - all inputs to `invoke` as well as its interaction history with the code environment - are variables in the code environment. We motivate our design from first principles, viewing `invoke` as a language primitive representing a function whose implementation is provided at runtime by an LLM every time it is called. To validate the design of our core `invoke` primitive, we evaluate `invoke` - with only prompting, no manually designed tools, harness, or external systems (e.g., memory or the file system) - on workflows traditionally implemented through specialized harnesses. On long-horizon workflows requiring recall far beyond the context window, JAZ `invoke` outperforms Letta (MemGPT) by 8% at half its cost on the recall-heavy portion of StuLife. On continual self-improvement, JAZ `invoke` outperforms ACE by 4% at a lower cost on AppWorld.
- Abstract(参考訳): 現代の言語モデルエージェントはエージェントループを中心に構築されている: LLMはツールのセットを公開している環境に配置され、LLMはツール呼び出しの交互化とアウトプットの観察によってワークフローを完全に制御する。
しかしながら、長期記憶や自己改善のような特定の能力は、エージェントループ自体以外の特別なシステムを必要とする。
我々は、エージェントループ自体よりも小さな最小限のハーネスが、これらの特殊なシステムが構築されているタスクを達成できる範囲を調査するために、LLMエージェントフレームワークであるJAZを構築しました。
JAZは単一のLLMベースのプリミティブ ‘invoke’ を公開し、プログラマが制約を適用して監視を行うための一連の組み込みフックを提供する。
既存のコードモードエージェントループを一般化すると、‘invoke’は2つの定義プロパティを満たす最も単純なループである。 1) LLMは、再帰的な‘invoke’を含む任意の実行可能なコードを書くことができる。
設計を第一原理から動機付け、呼び出しされるたびに LLM によって実行時に実装が提供される関数を表す言語プリミティブとして ‘invoke’ とみなす。
当社のコアである ‘invoke` プリミティブの設計を検証するために,従来から特殊なハーネスによって実装されていたワークフロー上で,手動で設計したツールやハーネス,あるいは外部システム(メモリやファイルシステムなど)を使わずに,‘invoke’ を評価します。
コンテキストウィンドウを超えてリコールを必要とするロングホライゾンワークフローでは、JAZ `invoke"は、Reta(MemGPT)を8%上回り、StuLifeのリコールの重い部分で半減する。
継続的自己改善では、JAZ `invoke"は、AppWorldでより低コストでACEを4%上回っている。
関連論文リスト
- ESAA-Conversational: An Event-Sourced Memory Layer for Continuity, Handoff, and Curation Across Heterogeneous LLM Coding Agents [0.0]
本稿ではイベントソーシングエージェントアーキテクチャ(ESAA)のドメインであるemphA-contextalを提案する。
異種エージェントが直接エージェント対エージェントチャネルを使わずに共有ログを介して協調できることを示し、一方、公開ディストリビューションはプライベートな会話履歴を除外してプライバシを保存する。
570件の開発-ラブイベントによる自己参照ケーススタディでは、異種エージェントが直接エージェント対エージェントチャネルを使わずに共有ログを通じて協力できる一方で、公開ディストリビューションはプライベートな会話履歴を除外してプライバシを保存する。
論文 参考訳(メタデータ) (2026-06-22T01:02:24Z) - LLM-as-Code: Agentic Programming for Agent Harness [20.350593038902904]
我々はトークンの爆発、制御フローの幻覚、信頼できない完成は実装上のバグではないと主張している。
より良いプロンプトやより強力なモデルは、LLMエージェントの信頼性を保証することはできない。
本稿では,プログラムがすべての制御フローを制御し,LLMがそれの一部であるエージェントプログラミングを提案する。
論文 参考訳(メタデータ) (2026-06-14T15:47:27Z) - LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning [67.39585115936329]
LLMには、微調整なしで長いコンテキストを処理できる固有の能力がある、と我々は主張する。
バイレベルアテンション情報を構築することで,LLMのコンテキストウィンドウを拡張するためのSelfExtendを提案する。
複数のベンチマークで包括的な実験を行い、その結果、既存のLLMのコンテキストウィンドウ長を効果的に拡張できることが示されている。
論文 参考訳(メタデータ) (2024-01-02T18:30:51Z) - L2MAC: Large Language Model Automatic Computer for Extensive Code Generation [52.81694565226513]
トランスフォーマーベースの大規模言語モデル(LLM)は、基盤となるトランスフォーマーアーキテクチャの固定コンテキストウィンドウによって制約される。
本稿では,L2MACを提案する。L2MACは,LLMをベースとした汎用型自動計算機(von Neumann Architecture)フレームワークで,長期的かつ一貫した出力生成を実現する。
論文 参考訳(メタデータ) (2023-10-02T16:55:19Z) - AskIt: Unified Programming Interface for Programming with Large Language
Models [0.0]
大規模言語モデル(LLM)は創発能力として知られるユニークな現象を示し、多くのタスクにまたがって適応性を示す。
本稿では,LLM用に特別に設計されたドメイン固有言語であるAskItを紹介する。
50タスクにわたって、AskItは簡潔なプロンプトを生成し、ベンチマークよりも16.14パーセントのプロンプト長の削減を実現した。
論文 参考訳(メタデータ) (2023-08-29T21:44:27Z) - Low-code LLM: Graphical User Interface over Large Language Models [115.08718239772107]
本稿では,人間-LLMインタラクションフレームワークであるLow-code LLMを紹介する。
より制御可能で安定した応答を実現するために、6種類のシンプルなローコードビジュアルプログラミングインタラクションを組み込んでいる。
ユーザフレンドリなインタラクション,制御可能な生成,広い適用性という,低コード LLM の3つの利点を強調した。
論文 参考訳(メタデータ) (2023-04-17T09:27:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。