論文の概要: HAAS Studio: A Tool for Simulating, Benchmarking, and Governing Human-AI Work Allocation
- arxiv url: http://arxiv.org/abs/2606.20596v1
- Date: Mon, 18 May 2026 22:07:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 19:15:44.526063
- Title: HAAS Studio: A Tool for Simulating, Benchmarking, and Governing Human-AI Work Allocation
- Title(参考訳): HAAS Studio:人間とAIの作業割り当てをシミュレート、ベンチマーク、管理するためのツール
- Authors: Vicente Pelechano,
- Abstract要約: HAAS Studioは、人間とAIシステム間のポリシー対応タスク割り当てのためのシミュレーションおよび意思決定支援ツールである。
ソフトウェアエンジニアリング、製造、医療の3つのドメインパックが含まれている。
リリースには16の企業プロファイルと6つのガバナンスベンチマークスイートが含まれている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present HAAS Studio, a simulation and decision-support tool for policy-aware adaptive task allocation between humans and AI systems. HAAS Studio turns the HAAS framework into an interactive environment for asking a practical deployment question: before introducing AI into a workflow, how can a team compare allocation strategies, inspect governance tradeoffs, and derive a defensible task-level operating model? The tool combines a five-dimensional cognitive representation of subtasks, a five-mode collaboration spectrum, adaptive allocation with multi-armed bandits (UCB1, Discounted UCB, LinUCB, and Thompson Sampling), oracle counterfactual regret analysis, contract-based governance with four independent guards, and a multi-criteria decision-support layer that separates efficient strategies from deployable options. It also models human-AI coevolution across six layers, monitors deskilling risk through sliding-window exposure metrics and benchmark runners, and supports persistent worker modeling through Live Twin and Planning modules. Three domain packs are included: software engineering, manufacturing, and healthcare. Each provides a task catalog, worker profiles, and KPI vocabulary, while the architecture allows new domains to be added without modifying the simulation core. The release includes 16 company profiles and six governance benchmark suites. This paper focuses on the tool, including its modeling assumptions, layered architecture, interaction workflow, built-in evidence assets, task-oriented recipes, case-study protocols, and a compact reproducible demonstration snapshot. A decision-guidance layer translates benchmark outputs into deployment decisions through structured patterns, heuristics, and a decision matrix.
- Abstract(参考訳): 本稿では,人間とAIシステム間のポリシー対応タスクアロケーションのためのシミュレーションおよび意思決定支援ツールであるHAAS Studioを紹介する。
HAAS StudioはHAASフレームワークをインタラクティブな環境に変えて、実践的なデプロイメント問題に問いかける。AIをワークフローに導入する前に、チームはアロケーション戦略を比較し、ガバナンスのトレードオフを検査し、防御可能なタスクレベルの運用モデルを導き出すにはどうすればよいのか?
このツールは,5次元のサブタスクの認知表現,5モードの協調スペクトル,マルチアームバンディットによる適応的アロケーション(UCB1, Discounted UCB, LinUCB, Thompson Sampling),オラクルの反事実的後悔分析,4つの独立したガードによる契約ベースのガバナンス,デプロイ可能な選択肢から効率的な戦略を分離するマルチ基準決定サポートレイヤを組み合わせたものだ。
また、6つのレイヤにまたがる人間とAIの共進化をモデル化し、スライドウインドウ露光メトリクスとベンチマークランナーを通じてリスクを監視し、Live TwinとPlanningモジュールによる永続的なワーカーモデリングをサポートする。
ソフトウェアエンジニアリング、製造、医療の3つのドメインパックが含まれている。
それぞれがタスクカタログ、ワーカープロファイル、KPI語彙を提供し、一方アーキテクチャでは、シミュレーションコアを変更することなく、新しいドメインを追加することができる。
リリースには16の企業プロファイルと6つのガバナンスベンチマークスイートが含まれている。
本稿では,モデリングの前提,階層アーキテクチャ,インタラクションワークフロー,組み込みエビデンスアセット,タスク指向のレシピ,ケーススタディプロトコル,コンパクトな再現可能なデモスナップショットなどのツールに焦点を当てる。
決定誘導層は、構造化パターン、ヒューリスティック、決定行列を通じて、ベンチマーク出力をデプロイメント決定に変換する。
関連論文リスト
- From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition [61.291733522717415]
Agent-as-Toolは並列オーケストレーションのパラダイムであり、エージェントとツールの両方を標準化された学習可能なアクション空間に緩和する。
ParaManagerは、サブタスク解決から計画決定を分離し、ステート対応の並列サブタスク分解、デリゲート、非同期実行を可能にする。
実験により、ParaManagerは複数のベンチマークで高い性能を示し、目に見えないモデルプールの下で堅牢な一般化を示す。
論文 参考訳(メタデータ) (2026-04-18T14:41:27Z) - RoboAgent: Chaining Basic Capabilities for Embodied Task Planning [46.248451288196435]
本稿では,エージェントが環境から視覚的観察を取得し,与えられたタスクを達成するためのアトミックアクションを実行する,具体的タスク計画に焦点を当てる。
本稿では,機能駆動型計画パイプラインであるRoboAgentを提案する。
我々は,(1)専門家プランによる行動クローニング,(2)モデルで収集した軌跡を用いたDAggerトレーニング,(3)専門家ポリシーによる強化学習からなる多段階的パラダイムを用いている。
論文 参考訳(メタデータ) (2026-04-09T04:01:27Z) - The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration [58.61149924275458]
ツールの使用により、大きな言語モデルが外部情報にアクセスし、ソフトウェアシステムを実行し、モデルパラメータだけで解決できるもの以外のデジタル環境で動作することができる。
エージェントシステムが進化するにつれて、中央の問題は、中途半端な状態、実行フィードバック、環境の変化、安全性、コスト、検証可能性といった実践的な制約によって、孤立呼び出しからマルチツールオーケストレーションへと移行した。
推論時の計画と実行、トレーニングと軌道構築、安全と制御、リソース制約下での効率性、オープン環境における能力の完全性、およびベンチマーク設計と評価の6つの分野に関する文献を整理する。
論文 参考訳(メタデータ) (2026-03-24T07:05:05Z) - Agyn: A Multi-Agent System for Team-Based Autonomous Software Engineering [0.09046463333989574]
現実世界のソフトウェア開発は、共有方法論に従ってチームが共同で行う活動として組織されます。
ソフトウェア工学を組織プロセスとして明示的にモデル化する,完全に自動化されたマルチエージェントシステムを提案する。
我々の結果は、チーム構造、方法論、コミュニケーションの複製が、自律的なソフトウェアエンジニアリングの強力なパラダイムであることを示唆している。
論文 参考訳(メタデータ) (2026-02-01T22:17:19Z) - Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome [17.912331507214052]
エージェントは目標を理解し、アクションを計画し、シミュレーション環境でタスクを実行する必要がある。
本稿では,Embodied Agent Interface (EAI) フレームワークを用いたVirtualHomeベンチマークにおいて,Large Language Models (LLM) の総合評価を行う。
論文 参考訳(メタデータ) (2026-01-31T08:56:43Z) - Agentic Workflow for Education: Concepts and Applications [7.875055566698523]
本研究では,自己回帰,ツールの実行,タスク計画,マルチエージェント協調からなる4成分モデルであるエージェント・フォー・教育(AWE)を紹介した。
AWEは、教師の作業量を削減し、教育の質を高め、より広範な教育革新を可能にする、有望な道を提供する。
論文 参考訳(メタデータ) (2025-09-01T14:39:48Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - HEAS: Hierarchical Evolutionary Agent Simulation Framework for Cross-Scale Modeling and Multi-Objective Search [4.807104001943257]
階層シミュレーションエージェント(Hierarchical Simulation Agent, HEAS)は、階層化されたエージェントベースのモデリングを進化的最適化とトーナメント評価で統合するPythonフレームワークである。
HEASは、共有コンテキストを読み書きする決定論的レイヤにスケジュールされた軽量プロセス(ストリーム)の階層としてモデルを表現する。
compact APIとCLIは、シングルオブジェクトとマルチオブジェクトの進化をシミュレートし、最適化し、評価します。
論文 参考訳(メタデータ) (2025-08-21T13:35:46Z) - Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark [72.46357004059661]
Generalist Virtual Agents (GVA) は自律的なタスク実行において大きな可能性を示している。
これらの課題に対処するため,ステップワイズ多次元ジェネラリスト・リワードモデルを提案する。
同様に、エージェントトレーニング用のきめ細かい信号を提供し、推論時間スケーリングのためのより良いアクションを選択することができる。
論文 参考訳(メタデータ) (2025-03-24T13:30:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。