論文の概要: HugAgent: Evaluating LLMs in Simulating Individual-Level Human Reasoning on Open-Ended Tasks
- arxiv url: http://arxiv.org/abs/2510.15144v2
- Date: Fri, 24 Oct 2025 14:23:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-27 15:45:42.322337
- Title: HugAgent: Evaluating LLMs in Simulating Individual-Level Human Reasoning on Open-Ended Tasks
- Title(参考訳): HugAgent: オープンエンドタスクにおける各レベル人間推論のシミュレーションにおけるLLMの評価
- Abstract要約: HugAgentは、平均的個人的推論適応のためのベンチマークである。
タスクは、特定の人がどのように推論し、新しいシナリオにおける信念を更新するかを予測することである。
HugAgentは、スケールとシステマティックなストレステストのための合成トラックと、有効な"アウトルード"推論データのための人間のトラックというデュアルトラックデザインを採用している。
- 参考スコア(独自算出の注目度): 27.80877165363182
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Simulating human reasoning in open-ended tasks has been a long-standing aspiration in AI and cognitive science. While large language models now approximate human responses at scale, they remain tuned to population-level consensus, often erasing the individuality of reasoning styles and belief trajectories. To advance the vision of more human-like reasoning in machines, we introduce HugAgent (Human-Grounded Agent Benchmark), a benchmark for average-to-individual reasoning adaptation. The task is to predict how a specific person would reason and update their beliefs in novel scenarios, given partial evidence of their past views. HugAgent adopts a dual-track design: a synthetic track for scale and systematic stress tests, and a human track for ecologically valid, "out-loud" reasoning data. This design enables scalable, reproducible evaluation of intra-agent fidelity: whether models can capture not just what people believe, but how their reasoning evolves. Experiments with state-of-the-art LLMs reveal persistent adaptation gaps, positioning HugAgent as the first extensible benchmark for aligning machine reasoning with the individuality of human thought. Our benchmark and chatbot are open-sourced as HugAgent (https://anonymous.4open.science/r/HugAgent) and TraceYourThinking (https://anonymous.4open.science/r/trace-your-thinking).
- Abstract(参考訳): オープンエンドタスクにおける人間の推論のシミュレーションは、AIと認知科学における長年の志望であった。
大規模な言語モデルは現在では人間の反応を近似しているが、人口レベルでのコンセンサスに調整され続けており、しばしば推論スタイルや信念の軌跡の個性を取り除いている。
機械におけるより人間的な推論のビジョンを推し進めるため,HugAgent (Human-Grounded Agent Benchmark) を導入する。
その課題は、ある人物が、過去の見解の一部的な証拠から、新しいシナリオにおける信念をどのように推論し、更新するかを予測することである。
HugAgentは、スケールとシステマティックなストレステストのための合成トラックと、生態学的に有効な「アウトルード」推論データのための人間のトラックというデュアルトラックデザインを採用している。
この設計は、モデルが人々の信じるものだけでなく、彼らの推論がどのように進化するかをキャプチャできるかどうかという、スケーラブルで再現可能な、エージェント内の忠実さの評価を可能にする。
最先端のLLMを用いた実験では、HugAgentが機械推論と人間の思考の個性との整合性を示す最初の拡張可能なベンチマークとして位置づけられ、永続的な適応ギャップが明らかになっている。
私たちのベンチマークとチャットボットはHugAgent(https://anonymous.4open.science/r/HugAgent)とTraceYourThinking(https://anonymous.4open.science/r/trace-yourthinking)としてオープンソース化されています。
関連論文リスト
- Networked Intelligence: Active Shared Context Graphs for Human-AI Team Science [0.8754288080101668]
私たちは、研究者とAIエージェントを自動的に接続するアクティブな共有ワークスペースであるMyceliumを紹介します。
人間のユーザーとエージェントが働くと、システムは重要な観察と仮説を捉え、チームの進化する知識モデルとの関連性を追跡する。
本稿では,分散科学的文脈上でのスパース条件計算としてネットワークインテリジェンスを記述する。
論文 参考訳(メタデータ) (2026-07-14T19:29:16Z) - Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization [40.016387553294685]
エージェントが人間中心のエコシステムで生き残るためには、彼らは人間化能力を進化させなければならない、と我々は主張する。
この作業は、エージェントがタスクを実行できるかどうかから、人間中心のエコシステム内でそれを実行する方法へとパラダイムをシフトさせる。
論文 参考訳(メタデータ) (2026-02-24T04:29:42Z) - HumanLLM: Towards Personalized Understanding and Simulation of Human Nature [72.55730315685837]
HumanLLMは個人のパーソナライズされた理解とシミュレーションのために設計された基礎モデルである。
私たちはまず、Reddit、Twitter、Blogger、Amazonといったプラットフォーム上で、現実世界のユーザデータをキュレートした大規模なコーパスであるCognitive Genomeを構築しました。
次に、多様な学習タスクを定式化し、教師付き微調整を行い、モデルの幅広い個人化された人間の行動、思考、経験を予測する。
論文 参考訳(メタデータ) (2026-01-22T09:27:27Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - Large language models replicate and predict human cooperation across experiments in game theory [0.8166364251367626]
大きな言語モデルが実際の人間の意思決定をいかに反映しているかは、いまだに理解されていない。
我々は,ゲーム理論実験のディジタルツインを開発し,機械行動評価のためのシステマティック・プロンプトと探索の枠組みを導入する。
Llamaは人間の協調パターンを高い忠実度で再現し、合理的選択理論から人間の偏差を捉える。
論文 参考訳(メタデータ) (2025-11-06T16:21:27Z) - Reconstructing Close Human Interaction with Appearance and Proxemics Reasoning [50.76723760768117]
既存の人間のポーズ推定手法では、既存の映像からもっともらしい密接な相互作用を回復できない。
人間の外見は、これらの障害に対処するための簡単な手がかりとなる。
本研究では,人間の外見,社会的プロキシ,物理法則に制約された身体接触により,正確な対話動作を再構築するための2分岐最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-03T12:19:26Z) - The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind [8.341160422849969]
Decryptoはマルチエージェント推論とToMのためのゲームベースのベンチマークである。
インタラクティブなToM実験を設計するための最初のプラットフォームである。
LLMのゲームプレイ能力は人間より遅れており,簡単な単語埋め込みが可能である。
論文 参考訳(メタデータ) (2025-06-25T17:55:27Z) - Empirically evaluating commonsense intelligence in large language models with large-scale human judgments [4.212429064310439]
本稿では,人工知能における常識評価手法を提案する。
モデルの判断と人口の対応を計測する。
私たちのフレームワークは、異なる、しばしば互換性のない、知識の社会的備蓄を持つ人間の集合体にAIモデルを適用することの要求に寄与します。
論文 参考訳(メタデータ) (2025-05-15T13:55:27Z) - Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models [75.85319609088354]
SAGE(Sentient Agent as a Judge)は、大規模言語モデルの評価フレームワークである。
SAGEは人間のような感情の変化や内的思考をシミュレートするSentient Agentをインスタンス化する。
SAGEは、真に共感的で社会的に適応的な言語エージェントへの進捗を追跡するための、原則付き、スケーラブルで解釈可能なツールを提供する。
論文 参考訳(メタデータ) (2025-05-01T19:06:10Z) - EgoAgent: A Joint Predictive Agent Model in Egocentric Worlds [119.02266432167085]
EgoAgentは単一変換器内での表現、予測、動作を同時に学習する統合エージェントモデルである。
EgoAgentは、タスクをインターリーブされた状態とアクションのシーケンスとして定式化することで、これらの能力間の因果的および時間的依存関係を明示的にモデル化する。
EgoAgentの画像分類,エゴセントリックな将来の状態予測,3次元人間の動作予測といった代表的課題に対する総合的な評価は,本手法の優位性を示している。
論文 参考訳(メタデータ) (2025-02-09T11:28:57Z) - Closely Interactive Human Reconstruction with Proxemics and Physics-Guided Adaption [64.07607726562841]
既存の人間再建アプローチは主に、正確なポーズの回復や侵入を避けることに焦点を当てている。
本研究では,モノクロ映像から密に対話的な人間を再構築する作業に取り組む。
本稿では,視覚情報の欠如を補うために,確率的行動や物理からの知識を活用することを提案する。
論文 参考訳(メタデータ) (2024-04-17T11:55:45Z) - Theory of Mind abilities of Large Language Models in Human-Robot
Interaction : An Illusion? [18.770522926093786]
大規模言語モデルは、様々な自然言語や生成タスクにおいて例外的な生成能力を示している。
高い利害関係とおそらく不可逆的な結果を持つToM能力の特殊応用について検討する。
本研究では,ロボットがLarge Language Model(LLM)を用いてロボットの動作を人間の観察者と同様の方法で評価する,知覚的行動認識の課題に焦点を当てる。
論文 参考訳(メタデータ) (2024-01-10T18:09:36Z) - Neural Amortized Inference for Nested Multi-agent Reasoning [54.39127942041582]
本研究では,人間のような推論能力と計算限界のギャップを埋める新しい手法を提案する。
提案手法を2つの挑戦的マルチエージェント相互作用領域で評価する。
論文 参考訳(メタデータ) (2023-08-21T22:40:36Z) - AGENT: A Benchmark for Core Psychological Reasoning [60.35621718321559]
直観心理学は、観察可能な行動を駆動する隠された精神変数を推論する能力です。
他のエージェントを推論する機械エージェントに対する近年の関心にもかかわらず、そのようなエージェントが人間の推論を駆動するコア心理学の原則を学ぶか保持するかは明らかではない。
本稿では,プロシージャが生成する3dアニメーション,エージェントを4つのシナリオで構成したベンチマークを提案する。
論文 参考訳(メタデータ) (2021-02-24T14:58:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。