論文の概要: Beyond Task Completion: Measuring Interaction Cost in Terminal User Interfaces
- arxiv url: http://arxiv.org/abs/2610.05047v1
- Date: Sun, 04 Oct 2026 08:30:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 06:42:15.78718
- Title: Beyond Task Completion: Measuring Interaction Cost in Terminal User Interfaces
- Title(参考訳): タスク完了を超えて:ターミナルユーザインタフェースにおけるインタラクションコストを測定する
- Abstract要約: 大規模言語モデル (LLM) は、ターミナルユーザインタフェース (TUI) を通じてますます使われている。
本稿では,LLMエージェントをユーザロールに配置する評価パラダイムであるAgent-as-a-Userを提案する。
6人の被験者と5人の観察・評価者構成を持つ15の現実世界のTUIに対して84のタスクを探索し、3つの主要スタックから生成された45のTUIを評価した。
- 参考スコア(独自算出の注目度): 9.989643815447625
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly used through terminal user interfaces (TUIs), yet task completion alone does not capture how difficult an interface is to understand and operate. Existing human assessments and LLM-generated ratings or reports do not provide repeatable measurements of interaction effort grounded in verified task execution. We propose Agent-as-a-User, an evaluation paradigm that places an LLM agent in the user role. Agent-KLM separates agent-side interpretation and operation costs and relates them structurally to human interaction. TUINaut operationalizes the paradigm by recording interaction trajectories and verifying outcomes with actor-independent oracles. Using TUINaut-Bench, we study 84 tasks across 15 real-world TUIs with six human participants and five observation-evaluator configurations, and evaluate 45 TUIs generated by three leading stacks. Similar aggregate success rates mask differences in which tasks humans and agents complete, whereas interpretation and operation costs follow correlated task rankings, especially for operation. This pattern persists across configurations. Generated TUIs can implement correct functionality while still requiring usability improvements. These results position Agent-as-a-User as a repeatable, execution-grounded paradigm for measuring task-based usability.
- Abstract(参考訳): 大規模言語モデル (LLM) は、ターミナルユーザインタフェース (TUI) を通じてますます使われるようになっているが、タスク補完だけでは、インターフェイスが理解し操作することがいかに困難であるかを捉えていない。
既存の人間の評価やLCMによる評価や報告は、検証されたタスク実行に根ざした相互作用の繰り返しの測定を提供していない。
本稿では,LLMエージェントをユーザロールに配置する評価パラダイムであるAgent-as-a-Userを提案する。
Agent-KLMはエージェント側の解釈と運用コストを分離し、それらを人間の相互作用と構造的に関連付ける。
TUINautは、インタラクションの軌跡を記録し、アクター非依存のオラクルによる結果を検証することで、パラダイムを運用する。
TUINaut-Benchを用いて、6人の被験者と5人の観察・評価者構成を持つ15の現実世界のTUIに対して84のタスクを探索し、3つの主要なスタックによって生成された45のTUIを評価する。
同様の成功率は、人間とエージェントが完成するタスクの差を隠蔽するが、解釈と運用コストは、特に運用において、相関したタスクランキングに従う。
このパターンは構成にまたがって持続する。
生成したTUIは、ユーザビリティを改善しながら、正しい機能を実装することができる。
これらの結果は、Agent-as-a-Userをタスクベースのユーザビリティを測定するための、繰り返し実行可能な実行基盤パラダイムとして位置付ける。
関連論文リスト
- The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge [37.21080040024616]
KNOWSは、これらの機能を共同で評価する、オープンで複雑なブラウザベースのタスクのベンチマークである。
タスクを書くためには,タスクが要求を満たすことを保証するためのタスク設計とプロトコルを開発する。
我々は、フロンティアコンピュータ利用エージェントとブラウザベースのハーネスを評価し、分析する。
論文 参考訳(メタデータ) (2026-09-24T22:36:10Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - MobileAgent: enhancing mobile control via human-machine interaction and
SOP integration [0.0]
大規模言語モデル(LLM)は、ユーザのためのモバイルデバイス操作を自動化できるようになった。
パーソナライズされたユーザデータに関するプライバシー上の懸念は、モバイル操作中に発生し、ユーザ確認が必要になる。
エージェントと人間間の対話的なタスクを設計し、機密情報を識別し、パーソナライズされたユーザニーズに合わせる。
提案手法は,複数ステップのタスクにまたがる30Kのユニークな命令を含む新しいデバイス制御ベンチマークであるAitWで評価される。
論文 参考訳(メタデータ) (2024-01-04T03:44:42Z) - TaskBench: Benchmarking Large Language Models for Task Automation [82.2932794189585]
タスク自動化における大規模言語モデル(LLM)の機能を評価するためのフレームワークであるTaskBenchを紹介する。
具体的には、タスクの分解、ツールの選択、パラメータ予測を評価する。
提案手法は, 自動構築と厳密な人的検証を組み合わせることで, 人的評価との整合性を確保する。
論文 参考訳(メタデータ) (2023-11-30T18:02:44Z) - MUG: Interactive Multimodal Grounding on User Interfaces [12.035123646959669]
本稿では,ユーザとエージェントがインタフェース画面上で協調作業を行うマルチモーダルグラウンドのための対話型タスクMUGを提案する。
ユーザがコマンドを与え、エージェントがコマンドに応答する。MUGはエージェントの応答を見る際に、エージェントがそのアクションを洗練または修正するための追加コマンドを与えるように、複数のラウンドのインタラクションを可能にする。
論文 参考訳(メタデータ) (2022-09-29T21:08:18Z) - Distribution Matching for Heterogeneous Multi-Task Learning: a
Large-scale Face Study [75.42182503265056]
マルチタスク学習は、共有学習アルゴリズムによって複数のタスクを共同で学習する方法論として登場した。
我々は異種mtlに対処し,検出,分類,回帰問題を同時に解決する。
大規模な顔分析のための最初のフレームワークであるFaceBehaviorNetを構築し、すべての顔行動タスクを共同で学習する。
論文 参考訳(メタデータ) (2021-05-08T22:26:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。