論文の概要: LLMbench: A Comparative Close Reading Workbench for Large Language Models
- arxiv url: http://arxiv.org/abs/2604.15508v1
- Date: Thu, 16 Apr 2026 20:32:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.646676
- Title: LLMbench: A Comparative Close Reading Workbench for Large Language Models
- Title(参考訳): LLMbench: 大規模言語モデルのための、比較可能なクローズドなワークベンチ
- Authors: David M. Berry,
- Abstract要約: LLMbenchは、大規模言語モデル(LLM)の出力を比較検討するためのブラウザベースのワークベンチである。
本稿では、ツールのアーキテクチャ、その6つのモード、その設計の根拠を説明し、現在人文科学やAIの社会科学的読解に不足しているログ確率データが、生成型AIモデルの重要な研究のための重要なリソースである、と論じる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMbench is a browser-based workbench for the comparative close reading of large language model (LLM) outputs. Where existing tools for LLM comparison, such as Google PAIR's LLM Comparator are engineered for quantitative evaluation and user-rating metrics, LLMbench is oriented towards the hermeneutic practices of the digital humanities. Two model responses to the same prompt are side by side in annotatable panels with four analytical overlays (Probabilities for token-level log-probability inspection, Differences for word-level diff across the two panels, Tone for Hyland-style metadiscourse analysis, and Structure for sentence-level parsing with discourse connective highlighting), alongside five analytical modes, Stochastic Variation, Temperature Gradient, Prompt Sensitivity, Token Probabilities, and Cross-Model Divergence, that make the probabilistic structure of generated text legible at the token level. The tool treats the generated text as a research object in its own right from a probability distribution, a text that could have been otherwise, and provides visualisations including continuous heatmaps, entropy sparklines, pixel maps, and three-dimensional probability terrains, that show the counterfactual history from which each word emerged. This paper describes the tool's architecture, its six modes, and its design rationale, and argues that log-probability data, currently underused in humanistic and social-scientific readings of AI, is an important resource for a critical studies of generative AI models.
- Abstract(参考訳): LLMbenchは、大規模言語モデル(LLM)の出力を比較検討するためのブラウザベースのワークベンチである。
Google PAIR の LLM Comparator のような LLM 比較のための既存のツールが定量的評価とユーザレーティングのメトリクスのために設計されているのに対して,LLMbench はデジタルヒューマニティのハーモニックなプラクティスを指向している。
同じプロンプトに対する2つのモデル応答は、4つの分析オーバーレイを持つ注釈可能なパネル(トークンレベルの対数確率検査の確率、単語レベルの差分、ハイランドスタイルのメタディスコース分析のトーン、談話連結ハイライトの文レベルの解析のための構造)に並んでおり、5つの分析モード、確率的変動、温度勾配、プロンプト感度、トークン確率、およびクロスモデルダイバージェンスがあり、トークンレベルで生成したテキストの確率的構造を正当化している。
このツールは、生成したテキストを確率分布から独自の研究対象として扱い、連続したヒートマップ、エントロピーのスパークライン、ピクセルマップ、および3次元の確率地形などの可視化を提供し、各単語が出現した反実的な歴史を示す。
本稿では、ツールのアーキテクチャ、その6つのモード、および設計の理論的根拠を説明し、現在AIの人文的、社会的科学的読解に不足しているログ確率データが、生成的AIモデルの重要な研究のための重要なリソースである、と論じる。
関連論文リスト
- Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models [67.09110757873142]
本研究では,LLMが自然言語から分布的知識を推測する能力を評価するための読解的ベンチマークであるText2DistBenchを紹介する。
映画と音楽のエンティティに関する実際のYouTubeコメントから構築されたこのベンチマークは、エンティティメタデータと関連するコメントを含むモデルを提供する。
信頼性と長期的な評価をサポートするため、Text2DistBenchの構築パイプラインは完全に自動化され、継続的に更新され、新たに登場したエンティティが組み込まれる。
論文 参考訳(メタデータ) (2026-03-13T19:26:08Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - LLM-based feature generation from text for interpretable machine learning [0.0]
埋め込みやback-of-wordsのような既存のテキスト表現は、その高次元性や欠落、あるいは疑わしい特徴レベルの解釈性のため、ルール学習には適さない。
本稿では,テキストから少数の解釈可能な特徴を抽出することにより,大規模言語モデル(LLM)がこの問題に対処できるかどうかを考察する。
論文 参考訳(メタデータ) (2024-09-11T09:29:28Z) - Towards Next-Generation Steganalysis: LLMs Unleash the Power of Detecting Steganography [18.7168443402118]
言語ステガノグラフィーは、特にAI生成技術の出現と共に、メッセージを隠蔽するための便利な実装を提供する。
既存の手法は、記号統計学の側面から、ステガノグラフテキストと正規テキストの分布差を見つけることに限定されている。
本稿では,大規模言語モデル(LLM)のヒューマンライクなテキスト処理機能を用いて,人間の知覚との違いを実現することを提案する。
論文 参考訳(メタデータ) (2024-05-15T04:52:09Z) - A Simple yet Efficient Ensemble Approach for AI-generated Text Detection [0.5840089113969194]
大規模言語モデル(LLM)は、人間の文章によく似たテキストを生成する際、顕著な能力を示した。
人工的に生成されたテキストと人間が作成したテキストを区別できる自動化アプローチを構築することが不可欠である。
本稿では,複数の構成 LLM からの予測をまとめて,シンプルで効率的な解を提案する。
論文 参考訳(メタデータ) (2023-11-06T13:11:02Z) - Large Language Models can Contrastively Refine their Generation for Better Sentence Representation Learning [57.74233319453229]
大規模言語モデル(LLM)は画期的な技術として登場し、それらの非並列テキスト生成能力は、基本的な文表現学習タスクへの関心を喚起している。
コーパスを生成するためにLLMの処理を分解するマルチレベルコントラスト文表現学習フレームワークであるMultiCSRを提案する。
実験の結果,MultiCSRはより高度なLCMをChatGPTの性能を超えつつ,ChatGPTに適用することで最先端の成果を得られることがわかった。
論文 参考訳(メタデータ) (2023-10-17T03:21:43Z) - The Languini Kitchen: Enabling Language Modelling Research at Different
Scales of Compute [66.84421705029624]
本稿では,アクセル時間で測定された等価計算に基づくモデル比較を可能にする実験的プロトコルを提案する。
私たちは、既存の学術的ベンチマークを上回り、品質、多様性、文書の長さで上回る、大規模で多様で高品質な書籍データセットを前処理します。
この研究は、GPT-2アーキテクチャから派生したフィードフォワードモデルと、10倍のスループットを持つ新しいLSTMの形式でのリカレントモデルという2つのベースラインモデルも提供する。
論文 参考訳(メタデータ) (2023-09-20T10:31:17Z) - Interpretable Multi-dataset Evaluation for Named Entity Recognition [110.64368106131062]
本稿では,名前付きエンティティ認識(NER)タスクに対する一般的な評価手法を提案する。
提案手法は,モデルとデータセットの違いと,それらの間の相互作用を解釈することを可能にする。
分析ツールを利用可能にすることで、将来の研究者が同様の分析を実行し、この分野の進歩を促進することができる。
論文 参考訳(メタデータ) (2020-11-13T10:53:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。