論文の概要: Cognitive Twins: Investigating Personalized Thinking Model Building and Its Performance Enhancement with Human-in-the-Loop
- arxiv url: http://arxiv.org/abs/2605.04761v1
- Date: Wed, 06 May 2026 11:08:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.788267
- Title: Cognitive Twins: Investigating Personalized Thinking Model Building and Its Performance Enhancement with Human-in-the-Loop
- Title(参考訳): 認知双生児:パーソナライズド・シンキング・モデルの構築とその人間-イン・ザ・ループによる性能向上に関する研究
- Abstract要約: パーソナライズド・シンキング・モデル(Personalized Thinking Model, PTM)は、AI支援教育用に設計された階層的で解釈可能な学習者表現である。
PTMは、学習者誌からの証拠を、行動事例、行動パターン、認知ルーチン、メタ認知傾向、自己システム価値を含む5層構造に整理する。
本研究は7週間の被験者40名を対象に, PTM の忠実度を3つの手法で評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper presents the Personalized Thinking Model (PTM), a hierarchical and interpretable learner representation designed for AI supported education. PTM organizes evidence from learner journals into a five-layer structure covering behavioral instances, behavioral patterns, cognitive routines, metacognitive tendencies, and self-system values. PTM is grounded in Marzano's New Taxonomy of Educational Objectives and tries to clone learner's thinking model and build cognitive twin. It was constructed using a pipeline that combines large language model inference (Gemini 2.5 Pro), sentence embeddings, dimensionality reduction, and consensus clustering. This paper evaluates PTM fidelity through three methods applied to 40 participants in a seven-week study. First, automatic evaluation using atomic information point matching yielded an overall F1 score of 74.57% before human-in-the-loop (HITL) refinement and 75.48% after refinement. Second, user evaluation using a Likert scale produced mean ratings of 4.26 and 4.30 on a five-point scale for pre and post-HITL conditions respectively. Third, semantic alignment verification showed that topic coherence increased from 0.436 at the behavioral layer to 0.626 at the core value layer, while lexical overlap with journal vocabulary decreased from 0.114 to 0.007 across those same layers. These results suggest that the PTM produces outputs with acceptable fidelity, was generally perceived by users as reflecting their thinking, and showed a pattern consistent with semantic abstraction across layers.
- Abstract(参考訳): 本稿では、AI支援教育用に設計された階層的かつ解釈可能な学習者表現であるパーソナライズド・シンキング・モデル(PTM)を提案する。
PTMは、学習者誌からの証拠を、行動事例、行動パターン、認知ルーチン、メタ認知傾向、自己システム価値を含む5層構造に整理する。
PTMはマルザーノの新しい教育目的分類に基礎を置いており、学習者の思考モデルをクローンし、認知双生児を作ろうとしている。
大規模な言語モデル推論(Gemini 2.5 Pro)、文の埋め込み、次元削減、コンセンサスクラスタリングを組み合わせたパイプラインを使用して構築された。
本研究は7週間の被験者40名を対象に, PTM の忠実度を3つの手法で評価した。
第一に、原子情報点マッチングを用いた自動評価は、ヒト・イン・ザ・ループ(HITL)の改良前のF1スコアが74.57%、精製後の75.48%であった。
第2に、Likertスケールを用いたユーザ評価は、それぞれ5ポイントスケールで4.26と4.30の平均評価を、HITL前後の条件で生成した。
第3に、セマンティックアライメントの検証では、行動層では0.436からコア値層では0.626へとトピックコヒーレンスが増加し、ジャーナル語彙との語彙重なりは、それらと同じ層で0.114から0.007に減少した。
以上の結果から, PTMは, 利用者の思考を反映していると認識され, 階層間のセマンティック・抽象化と整合したパターンを示すことが示唆された。
関連論文リスト
- Simulating Disengaged Students to Evaluate LLM-based Tutors [0.40105987447353786]
Disengagement-Aware Students Simulators (DAS2) は、エンゲージメント、ゲーム、ホイールスピン、オフタスク、ミックスの5つの学習状態のモデルである。
DAS2は、AIチューターがデプロイ前にさまざまな学習者入力状態にどのように反応するかを評価するための事前デプロイフレームワークを提供する。
論文 参考訳(メタデータ) (2026-09-11T01:28:48Z) - Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions [6.2431177303574295]
文学的品質を評価するには、文化的表現、感情的な深さ、哲学的洗練などの解釈的な側面を評価する必要がある。
本稿では,文学的品質を分かりやすい解釈次元に分解する階層的評価フレームワークであるSAGEを紹介する。
論文 参考訳(メタデータ) (2026-05-08T01:30:02Z) - Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models [0.0]
GPT-4.1、Gemini 2.5 Flash、Claude Sonnet 4.6は、20回の臨床シナリオで処方薬を作成した。
GPT-4.1 (0.955), Gemini 2.5 Flash (0.950), Claude Sonnet 4.6 (0.903)
GPT-4.1は完全にユニークな出力(100%)を安定なセマンティックコンテンツで生成し、Gemini 2.5 Flashは顕著な出力繰り返し(27.5%のユニークな出力)を示した。
論文 参考訳(メタデータ) (2026-04-21T15:51:46Z) - GIANTS: Generative Insight Anticipation from Scientific Literature [84.95947892931142]
本稿では、下流紙のコアインサイトを基礎となる親論文から予測する世代課題であるインサイト予測を導入する。
実測値と実測値の類似性を評価するLM判定器を用いてモデル評価を行い,これらの類似性スコアが有能な人間の評価値と相関していることを示す。
GIANTS-4Bは、強化学習(RL)を用いて訓練されたLMで、これらの類似度スコアをプロキシ報酬として用いた洞察予測を最適化する。
論文 参考訳(メタデータ) (2026-04-10T18:13:55Z) - Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures [0.6091702876917279]
Kumihoは、形式的信念修正セマンティクスに基づくグラフネイティブな認知記憶アーキテクチャである。
アーキテクチャは、二重ストアモデル(Redisワーキングメモリ、Neo4j長期グラフ)を実装し、ハイブリッドフルテキストとベクトル検索を備える。
論文 参考訳(メタデータ) (2026-03-18T00:59:49Z) - HUMANLLM: Benchmarking and Reinforcing LLM Anthropomorphism via Human Cognitive Patterns [59.17423586203706]
本稿では,心理的パターンを因果力の相互作用として扱うフレームワークであるHUMANLLMを提案する。
12,000の学術論文から244のパターンを構築し、2-5のパターンが相互に強化、衝突、変調されるシナリオ11,359を合成する。
我々の二重レベルチェックリストは、個々のパターンの忠実度と創発的なマルチパターンのダイナミクスを評価し、強い人間のアライメントを達成する。
論文 参考訳(メタデータ) (2026-01-15T08:56:53Z) - Toward Automated Cognitive Assessment in Parkinson's Disease Using Pretrained Language Models [7.799870915134572]
本研究では,カテゴリを自動的に識別する自然言語処理(NLP)モデルを開発し,評価した。
The three model family, a Bio_ClinicalBERT-based span categorization model for nested entity recognition and a fine-tuned Meta-Llama-3-8B-Instruct model。
微調整されたMeta-Llama-3-8B-Instructは、F1スコア全体(0.74マイクロ平均と0.59マクロ平均)を最高に達成し、特に思考や社会的相互作用といった文脈依存のカテゴリで優れている。
論文 参考訳(メタデータ) (2025-11-11T22:21:36Z) - Order from Chaos: Comparative Study of Ten Leading LLMs on Unstructured Data Categorization [0.0]
本研究では,非構造化テキスト分類に適用された10種類の最先端大規模言語モデル(LLM)の比較評価を行った。
この分析では、8,660人の注釈付きサンプルと同一のゼロショットプロンプトの統一データセットを使用して、すべてのモデルにおける方法論的一貫性を確保した。
その結果,現代LLMは,平均スコアが34%,精度が42%,リコールが45%,F1スコアが41%であった。
論文 参考訳(メタデータ) (2025-10-14T02:15:01Z) - Measuring How LLMs Internalize Human Psychological Concepts: A preliminary analysis [0.0]
本研究では,大規模言語モデルと人間の心理的次元間の概念整合性を評価する枠組みを開発する。
GPT-4モデルは優れた分類精度(66.2%)を獲得し、GPT-3.5(55.9%)とBERT(48.1%)を大きく上回った。
以上の結果から,現代のLLMは人間の心理的構造を計測可能な精度で近似できることが示された。
論文 参考訳(メタデータ) (2025-06-29T01:56:56Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z) - Is GPT-4 a reliable rater? Evaluating Consistency in GPT-4 Text Ratings [63.35165397320137]
本研究では,OpenAI の GPT-4 によるフィードバック評価の整合性について検討した。
このモデルは、マクロ経済学の上級教育分野における課題に対する回答を、内容とスタイルの観点から評価した。
論文 参考訳(メタデータ) (2023-08-03T12:47:17Z) - Text Classification via Large Language Models [63.1874290788797]
テキスト分類に関わる複雑な言語現象に対処するために、Clue And Reasoning Prompting (CARP)を導入する。
注目すべきは、CARPが5つの広く使用されているテキスト分類ベンチマークのうち4つで新しいSOTAパフォーマンスを得ることだ。
さらに重要なのは、CARPが低リソースとドメイン適応のセットアップで素晴らしい能力を提供します。
論文 参考訳(メタデータ) (2023-05-15T06:24:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。