論文の概要: Assistant or Actor? Student Trust, Control, and Delegation Regret When Using a General-Purpose AI Agent
- arxiv url: http://arxiv.org/abs/2607.18257v1
- Date: Thu, 14 May 2026 21:42:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.091907
- Title: Assistant or Actor? Student Trust, Control, and Delegation Regret When Using a General-Purpose AI Agent
- Title(参考訳): アシスタント・アクター : 汎用AIエージェントを用いた学生信頼・統制・委任規則
- Authors: Shiva Pochampally, Shengwei An, Yan Chen,
- Abstract要約: 我々は,アクション空間が十分に予測できないシステムに何を委譲するかを決めると,ユーザが問題に直面していることを示す。
私たちは、結果として生じた不満代表団の後悔を、エージェントが怒ったのではなく、彼らが承認したであろうことを超えて行動したことを後悔するパターンと呼びます。
本稿では,アクション境界を公開するエージェント設計,タスクごとの自律ポリシーのサポート,エージェント実行からのアドバイザリアウトプットの分離などについて論じる。
- 参考スコア(独自算出の注目度): 10.633573668629486
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When AI agents shift from answering questions to taking actions, users face a new problem: deciding what to delegate, to a system whose action space they cannot fully anticipate. We call the resulting dissatisfaction delegation regret, a pattern in which users regret not that the agent erred, but that it acted beyond what they would have authorized. In a controlled study, 20 university students completed five common daily tasks using OpenClaw, a general-purpose AI agent, across tasks chosen to vary in privacy, stakes, and reversibility. For each task we measured trust, perceived control, transparency, supervision burden, and approval preference on 5-point Likert scales, and collected free-text reflections analyzed through thematic coding. Three findings emerged. First, participants calibrated trust per task rather than per agent: they granted wide autonomy for advisory and low-stakes tasks but demanded confirmation for irreversible, externally visible actions. Second, irreversibility combined with external visibility, rather than stakes alone, appeared to drive trust withdrawal: the moderate-stakes email task triggered the sharpest drop in trust (M = 3.10) and the highest demand for approval (M = 4.65), whereas a high-stakes but verifiable task did not produce the same response. Third, delegation regret appeared consistently when the agent executed actions without preview, even when the output was rated as successful. We discuss implications for agent designs that expose action boundaries, support per-task autonomy policies, and separate advisory output from agentic execution.
- Abstract(参考訳): AIエージェントが質問に答えることから行動を取ることに移行すると、ユーザーは新しい問題に直面します。
私たちは、結果として生じた不満代表団の後悔を、エージェントが怒ったのではなく、彼らが承認したであろうことを超えて行動したことを後悔するパターンと呼びます。
コントロールされた調査では、20人の大学生が、プライバシー、利害、可逆性の異なるタスクの中から選択された、汎用AIエージェントであるOpenClawを使用して、毎日の5つの共通タスクを完了した。
各タスクに対して,5点のLikert尺度における信頼,コントロール,透明性,監督負担,承認優先度を測定し,テーマコーディングを通じて分析した自由テキストのリフレクションを収集した。
3つの発見がある。
まず、参加者はエージェントごとではなく、タスクごとの信頼を調整し、アドバイザリと低レベルのタスクに対して広範囲の自主性を認めたが、不可逆で外部から見える行動に対する確認を要求した。
適度なメールタスクは信頼の急激な低下(M = 3.10)と承認の最も高い要求(M = 4.65)を引き起こした。
第三に、エージェントがプレビューなしでアクションを実行したとき、たとえアウトプットが成功と評価されたとしても、代表団の後悔は一貫して現れていた。
本稿では,アクション境界を公開するエージェント設計,タスクごとの自律ポリシーのサポート,エージェント実行からのアドバイザリアウトプットの分離などについて論じる。
関連論文リスト
- AgentAbstain: Do LLM Agents Know When Not to Act? [19.223843408018997]
既存の評価は、エージェントがいつ禁じるべきかを知るのではなく、タスクの成功に焦点を当てている。
エージェント禁忌のための最初の体系的評価枠組みとして,ツールを用いたLDMエージェントの動作を検知するキャリブレーション能力について述べる。
AgentAbstainは、エージェントネイティブな分類に基づくペアタスクのベンチマークである。
論文 参考訳(メタデータ) (2026-07-11T00:57:36Z) - Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority [7.392721604463545]
制限はエージェントの実行アーキテクチャの不変として保証できることを示す。
学習量やスキル獲得量、自己引き起こされるガバナンスの抽象化がエージェントの許可された権限を広げることはできないことを証明します。
論文 参考訳(メタデータ) (2026-07-06T02:42:06Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - Auditing and Controlling AI Agent Actions in Spreadsheets [9.249091427192786]
AIエージェントは、開始から終了まで自律的に洗練された多段階の知識ワークを実行することができる。
ユーザがアウトプットを受け取るまでには、すべての基本的な決定は、その関与なしにすでに行われています。
我々は、監査可能な制御可能なアクションに実行を分解するスプレッドシートAIエージェントであるPistaを紹介する。
論文 参考訳(メタデータ) (2026-04-22T00:32:35Z) - SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents [45.71333459905404]
SmartSnapは、受動的でポストホックな検証から、エージェント自身による積極的な自己検証へのパラダイムシフトである。
両ミッションで設計された新しいタイプのエージェントである「自己検証エージェント」を導入し、タスクを完了し、検証された証拠でその達成を証明した。
モデルファミリとスケールにわたるモバイルタスクの実験は、SmartSnapパラダイムによって、スケーラブルなLLM駆動エージェントのトレーニングが可能になることを実証しています。
論文 参考訳(メタデータ) (2025-12-26T14:51:39Z) - Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation [42.38513187601995]
強化学習と検証可能な報酬で訓練された大規模言語モデル(LLM)は、複雑な推論タスクにおいて大きな成果を上げている。
最近の研究は、メタ思考エージェントが計画を提案し、進捗を監視し、推論エージェントが逐次的な会話のターンを通じてサブタスクを実行するというマルチエージェント設定にまで拡張されている。
1つのエージェントが支配的であり、もう1つのエージェントがほとんど貢献せず、コラボレーションが損なわれ、セットアップが非効率なシングルエージェントに崩壊する。
我々は、推論エージェントがノイズのある出力を破棄し、指示を集約し、推論プロセスを再起動させることで、議論を促す検証可能な報酬機構を提案する。
論文 参考訳(メタデータ) (2025-11-04T06:37:31Z) - Dark Patterns Meet GUI Agents: LLM Agent Susceptibility to Manipulative Interfaces and the Role of Human Oversight [51.53020962098759]
本研究では,エージェント,ヒト参加者,ヒトAIチームが,さまざまなシナリオにまたがる16種類の暗黒パターンにどのように反応するかを検討する。
フェーズ1では、エージェントが暗黒パターンを認識するのに失敗することが多く、たとえ認識されたとしても、保護行動よりもタスク完了を優先することが強調される。
第2段階では、認知的ショートカットと習慣的コンプライアンスにより、人間はしゃがみ込み、エージェントは手続き的な盲点から遠ざかる。
論文 参考訳(メタデータ) (2025-09-12T22:26:31Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。