論文の概要: String: An Agentic OS Where Every App Is a Markdown File
- arxiv url: http://arxiv.org/abs/2608.28027v1
- Date: Fri, 28 Aug 2026 07:44:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.247923
- Title: String: An Agentic OS Where Every App Is a Markdown File
- Title(参考訳): String:すべてのアプリがマークダウンファイルを持つエージェントOS
- Authors: Jookyung Song, Nojun Kwak, Simyung Chang,
- Abstract要約: LLMエージェントは、ソフトウェアユーザの新しいクラスになったが、それらが処理するすべてのサーフェスは他の誰かのために設計されている。
Stringはオープンソースのランタイムで、ユーザ自身のインターフェースを提供し、そのジョブをオペレーティングシステムの問題として扱います。
- 参考スコア(独自算出の注目度): 33.47077247999211
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents have become a new class of software user, but every surface they work through was designed for someone else. Pages are built for human eyes, which can skim and ignore; tool schemas for programs, which pay nothing to carry definitions they never call. An agent has neither luxury: it re-reads, and pays again for, everything it is shown on every turn. We present String, an open-source runtime that gives this user an interface of its own and treats the job as an operating-systems problem. Tool knowledge moves out of the agent's context and into a common layer that renders it back one view at a time as Markdown. A single SFMD (String-Flavored Markdown) document declares an application's views, typed actions, navigation, and credentials, and the runtime handles discovery, validation, execution, state, and secrets behind two core verbs: /open to see and /act to do. Web and app turn out to be two renderings of one architecture: an SFMD site serves styled HTML to browsers and the raw document to agents, so one grammar reaches apps, files, shells, and the web, even legacy HTML, with no per-site integration. Views stay partial by design, and the staging is causal: disclosing one tier of detail a single turn too early costs up to 23 accuracy points, while proper staging drops wrong-action selection from 28% to 2%. Privilege follows provenance: a remote page may call HTTP but never the shell, and caller-supplied text never expands a stored secret. On an 87-task benchmark that pairs each task with curated skills, operationalizing those procedures as on-demand String apps yields comparable aggregate success across six models from frontier to small (+1.3pp) while using 33.5% fewer tokens among completed episodes, and the resident interface stays a constant 53 tokens at any catalog size. We report the design, the evaluation, and what three months of production use taught us.
- Abstract(参考訳): LLMエージェントは、ソフトウェアユーザの新しいクラスになったが、それらが処理するすべてのサーフェスは他の誰かのために設計されている。
ページは人間の目のために構築され、スキップして無視することができる。プログラムのためのツールスキーマ。
エージェントには豪華さはなく、読み直し、また支払い、すべてのターンに表示される。
Stringはオープンソースのランタイムで、ユーザ自身のインターフェースを提供し、そのジョブをオペレーティングシステムの問題として扱います。
ツール知識はエージェントのコンテキストから移り変わり、Markdownとして一度に1つのビューに戻す共通のレイヤへと移行します。
1つのSFMD(String-Flavored Markdown)ドキュメントは、アプリケーションのビュー、型付けされたアクション、ナビゲーション、資格情報を宣言し、ランタイムは2つの中核動詞の背後にある発見、検証、実行、状態、シークレットを処理する。
SFMDサイトは、ブラウザにスタイル付きHTMLを提供し、エージェントに生文書を提供するので、1つの文法は、アプリケーション、ファイル、シェル、そしてWebに到達します。
ビューは設計によって部分的であり、ステージングは因果関係にある: 1ターンのディテールの1層を開示するには、最大23の精度ポイントが必要であり、適切なステージングは、間違ったアクションの選択を28%から2%に下げる。
リモートページはHTTPを呼び出してもシェルを呼ばないし、呼び出し元が提供するテキストは格納されたシークレットを拡張することはない。
87タスクのベンチマークでは、各タスクをキュレートされたスキルと組み合わせて、オンデマンドの文字列アプリとしてこれらの手順を運用することで、フロンティアから小規模(+1.3pp)までの6つのモデルで、33.5%のトークンを完了したエピソードで使用し、常駐インターフェイスは任意のカタログサイズで53のトークンを保持できる。
設計、評価、そして3ヶ月の製品利用が教えてくれたことを報告します。
関連論文リスト
- Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents [60.97609995940902]
検索エージェントに対して textbfFetch-then-Explore を提案する。
ページ選択とエビデンス抽出を分離し、選択したものを保持する。
これは、すべてのバックボーンでBrowseCompの精度を導き、一般的にWideSearchのベースラインと一致するか、超える。
論文 参考訳(メタデータ) (2026-08-03T11:58:21Z) - Beyond Domains: Reusing Web Skills via Transferable Interaction Patterns [68.0603867264595]
SkillMigratorは再利用可能なWebスキルを学習し、特定の要素参照ではなくレイアウト構造にマッチしてサイト間でそれらを転送する。
WebArenaとMind2Webの両方において、成功軌道上の平均LCM-アクション数を、一致した成功速度で8-10%削減する。
論文 参考訳(メタデータ) (2026-06-16T08:04:35Z) - RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour [0.0]
本稿では,単一誘導仮説に対して設計された自律型WebナビゲーションエージェントSUPERBROWSERを提案する。
ページを読んでいる人間は、見たすべてのピクセルを保持せず、いくつかの候補のターゲットを見て、それを決定し、ゴールを生き残るために必要なものだけを記憶する。
Mind2Web Hardベンチマークでは、SUPERBROWSERは89.47%の成功を達成し、公開/検索のブラウザエージェントベースラインを大きく上回っている。
論文 参考訳(メタデータ) (2026-06-08T12:18:22Z) - Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation [24.920344869492066]
textbfdatanameは11ドメイン、54リーフ、1000キューのWebDevベンチマークで、静的表現とインタラクティブアプリケーションの両方にまたがる。
textbfframenameはフラヴェルのメタ認知モニタリングに基づいており、3段階にわたる判断から証拠の蓄積を分離している。
論文 参考訳(メタデータ) (2026-05-28T14:30:33Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - Skim: Speculative Execution for Fast and Efficient Web Agents [8.47432001892345]
SkimはWebエージェントの投機的実行フレームワークである。
これは、目的を持ったウェブサイトの予測可能な構造を利用する。
Skimは、タスク毎の平均的なコストを1.9倍、レイテンシを33.4%削減する。
論文 参考訳(メタデータ) (2026-05-15T19:12:43Z) - Web Agents Should Adopt the Plan-Then-Execute Paradigm [9.920367562132336]
我々は、WebエージェントがデフォルトでReActではなく plan-then-executeにすべきであると主張している。
信頼できないデータは、事前に定義された実行グラフ内の値やブランチに影響を与える可能性がある。
我々は、Web上でプラン-then-executeを採用する上での主要な障壁を特定します。
論文 参考訳(メタデータ) (2026-05-14T02:48:57Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。