論文の概要: Plans Work in Mysterious Ways: Evaluating a Plan Mode for Spreadsheet Agents
- arxiv url: http://arxiv.org/abs/2607.23670v1
- Date: Sun, 26 Jul 2026 14:07:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.184144
- Title: Plans Work in Mysterious Ways: Evaluating a Plan Mode for Spreadsheet Agents
- Title(参考訳): 謎の方法で動く計画:スプレッドシートエージェントのプランモードの評価
- Abstract要約: Plan Modesはエージェントプログラミングツールの標準機能となっている。
Plan Modesは、タスク実行前に、エージェントと作業することで、透明性とコントロールを得ることができる。
この機能の利点がスプレッドシートのようなエンドユーザのプログラミング環境に翻訳されるかどうかは不明だ。
- 参考スコア(独自算出の注目度): 19.538780220778992
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Plan Modes have become standard features in agentic programming tools, allowing users to gain transparency and control by working with the agent to develop a plan before task execution. However, it remains unclear whether the benefits of this feature translate to end-user programming environments such as spreadsheets. Since spreadsheet programmers tend to work iteratively and care less about technical correctness, upfront planning may not fit into their workflows as easily. In this paper, we build a prototype of a Plan Mode for spreadsheet programming and evaluate it against a non-planning baseline through a within-subjects user study (N=24). We found that despite similar task outcomes with both tools, using Plan Mode led to a reduction in refinement and a better perception of the tool across dimensions of creativity support and human-machine collaboration. We discuss the implications of these results for the future design of Plan Modes, and for the broader role of human-AI planning in end-user programming.
- Abstract(参考訳): Plan Modesはエージェントプログラミングツールの標準機能となり、タスク実行前にエージェントと作業することで透明性とコントロールを得ることができるようになった。
しかし、この機能の利点がスプレッドシートのようなエンドユーザープログラミング環境に翻訳されるかどうかは不明だ。
スプレッドシートプログラマは反復的に作業し、技術的正確さに気を配る傾向があるため、事前計画がワークフローに適さない場合がある。
本稿では,スプレッドシートプログラミングのためのPlan Modeのプロトタイプを作成し,非計画ベースラインに対して,内部オブジェクトユーザスタディ(N=24)を用いて評価する。
両ツールのタスク結果が類似しているにも関わらず、Plan Modeを使用することで、クリエイティビティサポートと人間と機械のコラボレーションの両面において、ツールの洗練度が低下し、より認知度が向上することがわかった。
今後のプランモードの設計や,エンドユーザープログラミングにおけるヒューマンAI計画の役割について論じる。
関連論文リスト
- PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models [52.48858778580074]
計画は大規模言語モデル(LLM)の基本的な機能である
PlanningBenchは、評価とトレーニングの両方のためのスケーラブルで多様な検証可能な計画データを生成するためのフレームワークである。
論文 参考訳(メタデータ) (2026-05-20T08:10:15Z) - From Plan to Action: How Well Do Agents Follow the Plan? [6.54753809716901]
本稿では,プログラムエージェントにおける計画遵守に関する最初の体系的分析について述べる。
SWE-bench Verified と SWE-bench Pro では,SWE-agent からSWE-agent への16,991 トラジェクトリを8種類のプランで検討した。
サブプランは、計画が全くない以上にパフォーマンスを損なう。
論文 参考訳(メタデータ) (2026-04-13T23:54:55Z) - TodoEvolve: Learning to Architect Agent Planning Systems [68.48983335970901]
TodoEvolveは、タスク固有の計画を自律的に合成し、動的に修正するメタプランニングパラダイムである。
PlanFactoryは異種計画パターンの共通インターフェースを提供する。
TodoEvolveは、経済的なAPIコストとランタイムオーバーヘッドを維持しながら、慎重に設計された計画モジュールを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-08T06:37:01Z) - Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks [36.63527489464188]
Plan-and-Actは、大規模言語モデル(LLM)に明示的なプランニングを組み込んだフレームワークである。
Plan-and-Actは、ユーザ目標を達成するための構造化された高レベルのプランを生成するPlannerモデルと、これらのプランを環境固有のアクションに変換するExecutorモデルで構成される。
We present a state-of-the-art 57.58% success rate on the WebArena-Lite benchmark and a text-only state-of-the-art 81.36% success rate on WebVoyager。
論文 参考訳(メタデータ) (2025-03-12T17:40:52Z) - Plan-over-Graph: Towards Parallelable LLM Agent Schedule [53.834646147919436]
大規模言語モデル(LLM)はタスク計画の推論において例外的な能力を示した。
本稿では,まず実生活のテキストタスクを実行可能なサブタスクに分解し,抽象的なタスクグラフを構築する,新しいパラダイムであるプランオーバーグラフを提案する。
モデルはこのタスクグラフを入力として理解し、並列実行計画を生成する。
論文 参考訳(メタデータ) (2025-02-20T13:47:51Z) - Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following [62.10809033451526]
本研究は,Large Language Models (LLM) を用いた Embodied Instruction following (EIF) タスクプランナの構築に焦点をあてる。
我々は,このタスクを部分観測可能なマルコフ決定プロセス (POMDP) として構成し,数発の仮定で頑健なプランナーの開発を目指す。
ALFREDデータセットに対する我々の実験は、プランナーが数ショットの仮定で競争性能を達成することを示す。
論文 参考訳(メタデータ) (2024-12-27T10:05:45Z) - Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos [48.15438373870542]
VidAssistは、インストラクショナルビデオにおけるゼロ/フェーショット目標指向の計画のために設計された統合フレームワークである。
最適な計画生成のための幅優先探索アルゴリズムを採用している。
実験によると、VidAssistは異なる目標指向の計画設定のための統一されたフレームワークを提供する。
論文 参考訳(メタデータ) (2024-09-30T17:57:28Z) - Ask-before-Plan: Proactive Language Agents for Real-World Planning [68.08024918064503]
プロアクティブエージェントプランニングでは、ユーザエージェントの会話とエージェント環境のインタラクションに基づいて、言語エージェントが明確化のニーズを予測する必要がある。
本稿では,明確化,実行,計画の3つのエージェントからなる新しいマルチエージェントフレームワーク,Clarification-Execution-Planning(textttCEP)を提案する。
論文 参考訳(メタデータ) (2024-06-18T14:07:28Z) - The Case for Developing a Foundation Model for Planning-like Tasks from Scratch [5.745039200420619]
ファンデーションモデル(FM)は、自動計画とスケジューリング(APS)を含む多くのコンピューティング分野に革命をもたらした。
本稿では,PLタスクをスクラッチから包括的に行うためのFMの必要性について論じ,設計上の考慮事項について考察する。
論文 参考訳(メタデータ) (2024-04-06T07:44:40Z) - Planning as In-Painting: A Diffusion-Based Embodied Task Planning
Framework for Environments under Uncertainty [56.30846158280031]
具体的AIのためのタスクプランニングは、最も難しい問題の1つだ。
In-paintingとしての計画」というタスク非依存の手法を提案する。
提案するフレームワークは,様々な具体的AIタスクにおいて,有望なパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-12-02T10:07:17Z) - Iterative Planning with Plan-Space Explanations: A Tool and User Study [5.779503104475269]
計画空間の説明を含む,ヒューマンガイドによる反復計画のためのツールを実装した。
このツールは標準のWebブラウザで動作し、開発者とユーザの両方にシンプルなユーザーインターフェイスを提供する。
本研究は,反復計画における計画固有依存性説明の有用性を示す最初のユーザスタディである。
論文 参考訳(メタデータ) (2020-11-19T08:15:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。