論文の概要: Bridging Network Psychometrics and Artificial Intelligence: An Ising-Potts Model with LLM-Derived Weights
- arxiv url: http://arxiv.org/abs/2609.08797v2
- Date: Mon, 14 Sep 2026 15:37:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.683459
- Title: Bridging Network Psychometrics and Artificial Intelligence: An Ising-Potts Model with LLM-Derived Weights
- Title(参考訳): ブリッジングネットワークの心理学と人工知能: LLM-Derived Weightsを用いたIsing-Pottsモデル
- Abstract要約: レーティングとカテゴリーラベルの合意指標を用いたラターイジングポッツモデルを提案する。
我々は,K=14,466の短い回答を3段階のルーブリックと2つのAERAエッセイのコーパスに散らばった3つの構成応答データセットについて,約1,200-1,400の応答を4点のルーブリックに提案した。
- 参考スコア(独自算出の注目度): 0.40611352512781873
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The Potts model extends the Ising model to multinomial data. We introduce a Rater Ising-Potts model that uses agreement indicators between pairs of ratings and category labels, with weights derived from LLM embeddings. The model does not presuppose ordered category thresholds or equidistant scoring; instead, it focuses on pairwise agreement among ratings and assigns category-specific positive weights, making it suited for multi-category scoring reliability. We evaluate the model on three constructed-response datasets spanning a corpus of K=14,466 short answers on a three-level rubric and two AERA essay prompts of roughly 1,200-1,400 responses on four-point rubrics. We compare three strategies for sharpening the similarity signal: top-K pruning, min-max normalization with a power transformation, and ColBERT late-interaction similarities. Top-K pruning, which replaces the dense similarity graph with a sparse local network of strongest semantic neighbors, consistently yields the highest accuracy and Cohen's kappa, and the selected neighborhoods are always a small fraction of the corpus. Power tuning consistently ranks second, while ColBERT is competitive on longer essay prompts and adds little on short answers. Across all settings, most misclassifications occur between adjacent score levels, confirming that the model preserves the ordinal structure of scoring rubrics without imposing rigid assumptions. These findings suggest that LLM-derived similarities, combined with a parsimonious Potts formulation and a sparse local graph, offer a robust and interpretable framework for reliability auditing in educational assessment. We discuss extensions to multiple raters and hierarchical rating designs.
- Abstract(参考訳): PottsモデルはIsingモデルを拡張し、マルチノードデータに拡張する。
LLM埋め込みから導かれる重み付きレーティングとカテゴリラベルの一致指標を用いたラターイジングポッツモデルを提案する。
このモデルは、順序付けられたカテゴリー閾値や等距離スコアを前提とせず、評価間のペアの一致に焦点を当て、カテゴリー固有の正の重みを割り当て、マルチカテゴリスコアリングの信頼性に適している。
我々は,K=14,466の短い回答を3段階のルーブリックと2つのAERAエッセイのコーパスに散らばった3つの構成応答データセットについて,約1,200-1,400の応答を4点のルーブリックに提案した。
我々は、トップKプルーニング(top-K pruning)、パワー変換によるmin-max正規化(min-max normalization)、ColBERT遅延相互作用類似性( late-interaction similarities)の3つの手法を比較した。
密接な類似性グラフを最強のセマンティックな隣人の疎密な局所ネットワークに置き換えるTop-Kプルーニングは、常にコーエンのカッパと高い精度を得られ、選択された地区は常にコーパスのごく一部である。
パワーチューニングは一貫して第2位にランクされ、コルバートは長いエッセイのプロンプトで競い合っており、短い答えにはほとんど触れない。
すべての設定において、ほとんどの誤分類は隣接するスコアレベルの間で発生し、モデルが厳密な仮定を課すことなく、スコアリングルーブリックの順序構造を保存することを確認する。
これらの結果から, LLM由来の類似性と, 擬似ポッツ定式化と疎局所グラフの併用が, 教育評価における信頼性監査のための堅牢かつ解釈可能な枠組みを提供する可能性が示唆された。
複数レーダの拡張と階層的評価設計について論じる。
関連論文リスト
- Mapping and Measuring the Behavioral Evolution of Large Language Models [28.603443859513153]
ベンチマークのリーダーボードは、言語モデルのパフォーマンスを概説するが、その振る舞いが他のモデルとどのように関係しているか、世代によって異なる。
1万のプロンプトの共有バンクに対する応答を用いて、6つのファミリーから32モデルの出力挙動を特徴付ける。
論文 参考訳(メタデータ) (2026-08-11T15:07:28Z) - Reference-Induced Consensus for Selective Posed-Reference Visual Localization [11.166886974945806]
RIC-Locは、シーントレーニングなしのポーズ参照ローカライザである。
主推定器では、SfM-point-map-freeである。
論文 参考訳(メタデータ) (2026-07-06T06:48:34Z) - Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts [47.02978329409663]
そこで本研究では,Q手法に基づく対称型人間-LLM評価フレームワークを提案する。
私たちのプロトコルでは、人間とモデルは同一の140項目の道徳的ステートメントを、共有された9カラムの強制分布に分類します。
240個の複製されたQ-sortを2つの温度設定で4つのモデルファミリーにまたがる12個のLLMを評価した。
論文 参考訳(メタデータ) (2026-06-20T08:15:41Z) - Measuring the sensitivity of LLM-based structured extraction to prompt, model, and schema choices in clinical discharge summaries [0.0]
大規模言語モデルは、臨床自由テキストノートからの構造化抽出にますます利用されている。
本研究は、抽出タスクを固定し、一度に1つの選択を変更させることにより、人間に注釈を付さない感度を測定する。
クロスプロンプト合意は、ICD成層部分集合上のコーエンのカッパによって測定された。
論文 参考訳(メタデータ) (2026-06-04T10:14:12Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Symmetric Aggregation of Conformity Scores for Efficient Uncertainty Sets [6.673032375204486]
複数の予測器から非整合性スコアを集約する新しい手法であるSACP(Symmetric Aggregated Conformal Prediction)を提案する。
SACP はこれらのスコアを e-値に変換し、任意の対称アグリゲーション関数を用いてそれらを結合する。
我々はSACPが効率を継続的に改善し、しばしば最先端のモデルアグリゲーションベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2025-12-07T17:54:07Z) - RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions [0.0]
大規模言語モデル(LLM)は、パラフレーズ付き質問に答えるときに矛盾する振る舞いを示すことが多い。
クローズドブック多重選択QAにおけるクロスパラフレーズ一貫性を評価するベンチマークであるRoParQを紹介する。
また、モデルのロバスト性を定量化する新しい評価指標XParaConを提案する。
論文 参考訳(メタデータ) (2025-11-26T16:40:53Z) - LLM Routing with Dueling Feedback [49.67815163970033]
ユーザの満足度,モデルの専門性,推論コストのバランスを保ちながら,クエリ毎に最適なモデルを選択するという課題について検討する。
絶対的なスコアではなく、ペアの選好フィードバックから学習することで、ルーティングをコンテキストデュエルの帯域として定式化する。
分類的重み付けを用いた対照的な微調整を用いて,オフラインデータからモデル埋め込みを導出する表現学習手法であるカテゴリーキャリブレーション・ファインタニング(CCFT)を導入する。
論文 参考訳(メタデータ) (2025-10-01T12:52:25Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - CPC-CMS: Cognitive Pairwise Comparison Classification Model Selection Framework for Document-level Sentiment Analysis [0.0]
本研究では,文書レベルの感情分析のための認知的ペアワイズ分類モデル選択(CPC-CMS)フレームワークを提案する。
CPCは、専門家の知識判断に基づいて、精度、精度、リコール、F1スコア、特異性、マシューズ相関係数(MCC)、コーエンのカッパ(カッパ)などの評価基準の重みを計算するために使用される。
ソーシャルメディアの3つのオープンデータセットを用いて,提案したCPC-CMSの実現可能性を示す。
論文 参考訳(メタデータ) (2025-07-18T15:41:53Z) - Multivariate Conformal Prediction using Optimal Transport [19.644272536912286]
コンフォーマル予測(CP)は、機械学習モデルの不確実性を定量化する。
多次元設定において共形予測集合を構成するための原理的枠組みを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:56:41Z) - Rethinking Few-shot 3D Point Cloud Semantic Segmentation [62.80639841429669]
本稿では,FS-PCSによる3Dポイント・クラウドセマンティックセマンティックセグメンテーションについて再検討する。
我々は、最先端の2つの重要な問題、前景の漏洩とスパースポイントの分布に焦点をあてる。
これらの問題に対処するために、新しいベンチマークを構築するための標準化されたFS-PCS設定を導入する。
論文 参考訳(メタデータ) (2024-03-01T15:14:47Z) - Anchor Points: Benchmarking Models with Much Fewer Examples [88.02417913161356]
6つの人気のある言語分類ベンチマークでは、多数の点の正しいクラスに対するモデル信頼度はモデル間で強く相関している。
Anchor Point Selectionは,データセット全体にわたるモデル動作をキャプチャする,データセットの小さなサブセットを選択する手法である。
平均絶対誤差が低いデータセットの他のすべての点について、クラスごとの予測モデルを推定するために、いくつかのアンカーポイントを使用することができる。
論文 参考訳(メタデータ) (2023-09-14T17:45:51Z) - Balanced Classification: A Unified Framework for Long-Tailed Object
Detection [74.94216414011326]
従来の検出器は、分類バイアスによる長期データを扱う際の性能劣化に悩まされる。
本稿では,カテゴリ分布の格差に起因する不平等の適応的是正を可能にする,BAlanced CLassification (BACL) と呼ばれる統一フレームワークを提案する。
BACLは、さまざまなバックボーンとアーキテクチャを持つさまざまなデータセット間で、一貫してパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2023-08-04T09:11:07Z) - Variational Classification [51.2541371924591]
我々は,変分オートエンコーダの訓練に用いるエビデンスローバウンド(ELBO)に類似した,モデルの訓練を目的とした変分目的を導出する。
軟質マックス層への入力を潜伏変数のサンプルとして扱うことで, 抽象化された視点から, 潜在的な矛盾が明らかとなった。
我々は、標準ソフトマックス層に見られる暗黙の仮定の代わりに、選択された潜在分布を誘導する。
論文 参考訳(メタデータ) (2023-05-17T17:47:19Z) - Aggregating Pairwise Semantic Differences for Few-Shot Claim Veracity
Classification [21.842139093124512]
本稿では,新しいベクトルベース手法であるSEEDを導入する。
クラス内のクレーム-エビデンス対の平均意味的差異を捉えるクラス代表ベクトルをシミュレートできるという仮説に基づいて構築する。
FEVERとSCIFACTデータセットで実施された実験では、数ショット設定で競合するベースラインよりも一貫した改善が見られた。
論文 参考訳(メタデータ) (2022-05-11T17:23:37Z) - Conceptually Diverse Base Model Selection for Meta-Learners in Concept
Drifting Data Streams [3.0938904602244355]
本稿では,基礎となる部分空間間の主アングル(PA)を用いて計算したベースモデルの概念的類似性を推定するための新しいアプローチを提案する。
オンライン・トランスファー・ラーニング(TL)の文脈における共通アンサンブル・プルーニング・メトリクス、すなわち予測性能と相互情報(MI)を用いた閾値付けに対するこれらの手法の評価を行った。
その結果、概念的類似度閾値は計算オーバーヘッドを低減し、予測性能とMIを用いて閾値に匹敵する予測性能が得られることがわかった。
論文 参考訳(メタデータ) (2021-11-29T13:18:53Z) - Active Learning++: Incorporating Annotator's Rationale using Local Model
Explanation [84.10721065676913]
アノテーションは、与えられたクエリの重要性に基づいて入力特徴をランク付けすることで、ラベルを選択するための根拠を提供することができる。
すべての委員会モデルを等しく重み付けして次の事例を選択する代わりに、アノテータのランクにより高い一致で委員会モデルにより高い重みを割り当てます。
このアプローチは、LIMEのような局所的な説明を生成するためにモデルに依存しない手法を用いて、任意の種類のMLモデルに適用できる。
論文 参考訳(メタデータ) (2020-09-06T08:07:33Z) - Fine-Grained Visual Classification with Efficient End-to-end
Localization [49.9887676289364]
本稿では,エンド・ツー・エンドの設定において,分類ネットワークと融合可能な効率的なローカライゼーションモジュールを提案する。
我々は,CUB200-2011,Stanford Cars,FGVC-Aircraftの3つのベンチマークデータセット上で,新しいモデルを評価する。
論文 参考訳(メタデータ) (2020-05-11T14:07:06Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。