論文の概要: Do Reasoning Representations Help Humans Evaluate LLM Outputs?
- arxiv url: http://arxiv.org/abs/2609.09038v1
- Date: Tue, 08 Sep 2026 17:03:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.700285
- Title: Do Reasoning Representations Help Humans Evaluate LLM Outputs?
- Title(参考訳): 推論表現はLLMの成果を評価するのに役立つか?
- Abstract要約: モデル推論能力のためのプロキシではなく,ヒューマンインタフェースとしての推論表現について検討する。
複雑度の異なるタスクにまたがる6つの推論形式について、制御された人間による研究を行う。
本研究は, 知覚的嗜好と人的評価支援のミスマッチを示す。
- 参考スコア(独自算出の注目度): 7.900903824992017
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning representations are increasingly used as explanations for large language model outputs. Yet they are typically evaluated with model-centric criteria, such as answer accuracy and faithfulness, leaving it unclear whether they help people evaluate model responses. In this work, we study reasoning representations as human-facing interfaces rather than proxies for model reasoning ability. We conduct a controlled human study of six reasoning formats across tasks of varying complexity, supported by a web-based framework that randomizes task domains, problem instances, and representation order. The study collects fine-grained judgments of structural understanding, error detection and localization, and trust calibration. Our study shows a mismatch between perceived preference and support for human evaluation. Participants prefer planning- and decomposition-based representations, but simpler chain-of-thought traces better support verification, trust, and interpretability. Preferred representations also introduce calibration risks, with more false alarms on correct traces and high trust despite low willingness to verify.
- Abstract(参考訳): 推論表現は、大きな言語モデル出力の説明として、ますます使われています。
しかし、それらは典型的には、答えの正確さや忠実さなどのモデル中心の基準で評価され、人々がモデル応答を評価するのに役立つかどうかがはっきりしないままである。
本研究では,モデル推論能力のためのプロキシではなく,ヒューマンインタフェースとしての推論表現について検討する。
我々は、タスクドメイン、問題インスタンス、表現順序をランダム化するWebベースのフレームワークによって支援され、複雑さの異なるタスク間での6つの推論フォーマットの制御された人間による研究を行う。
この研究は、構造的理解、エラー検出、局所化、信頼の校正に関するきめ細かい判断を収集する。
本研究は, 知覚的嗜好と人的評価支援のミスマッチを示す。
参加者は計画と分解に基づく表現を好むが、より単純な連鎖は、検証、信頼、解釈可能性を改善する。
優先度の高い表現は校正リスクも導入し、検証の意欲が低いにもかかわらず、正確なトレースと高い信頼に関する誤った警告がより多く発生する。
関連論文リスト
- Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations [1.8772057593980798]
大規模言語モデル(LLM)は、言語化された自己説明を生成することができる。
我々は,人間とLLMの審査員が,偽のフォローアップ質問に対するモデルの回答をどの程度予測できるかを評価する。
論文 参考訳(メタデータ) (2026-01-07T10:13:26Z) - TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models [9.607579442309639]
本稿では,トランスペアレント推論と一貫性評価のためのフレームワークであるTRACEを紹介する。
TRACEleverages Auxiliary Reasoning Setsは複雑な問題を分解する。
実験の結果, ARS間の整合性は最終回答の正しさと相関していることがわかった。
TRACEは信頼できない推論パスと信頼できない推論パスを区別する信頼領域を定義する。
論文 参考訳(メタデータ) (2025-12-05T18:40:18Z) - A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models [58.32070787537946]
思考の連鎖(CoT)推論は、大きな言語モデルの性能を高める。
大規模視覚言語モデルにおけるCoT忠実度に関する最初の総合的研究について述べる。
論文 参考訳(メタデータ) (2025-05-29T18:55:05Z) - The Third Pillar of Causal Analysis? A Measurement Perspective on Causal Representations [23.129188507631284]
因果推論と発見は、実世界のデータの複雑さ、ノイズ、高次元性のためにしばしば困難に直面する。
学習した表現を因果的下流タスクに役立てるものと、それらをどのように評価するかは、まだよく理解されていない。
論文 参考訳(メタデータ) (2025-05-23T10:25:17Z) - On The Role of Reasoning in the Identification of Subtle Stereotypes in Natural Language [0.03749861135832073]
大規模言語モデル(LLM)は、有害なステレオタイプを補強する様々な形式のバイアスと言語強化を含む膨大な未計算データセットに基づいて訓練される。
言語モデルにおけるバイアスを調べ、対処することが不可欠であり、それらのモデルが社会的バイアスを持続させないように、公平さを開発に組み込むことが不可欠である。
この研究は、自動ステレオタイプ検出における重要な要素としての推論を確立し、LSMのためのより強力なステレオタイプ緩和パイプラインに向けた第一歩である。
論文 参考訳(メタデータ) (2023-07-24T15:12:13Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z) - Odd-One-Out Representation Learning [1.6822770693792826]
ランダム・ワン・アウト観測に基づく下流の弱教師付きタスクがモデル選択に適していることを示す。
また,この課題を高度に遂行する,目覚しいメトリック学習型VAEモデルが,他の標準の教師なしおよび弱教師付きアンタングルメントモデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2020-12-14T22:01:15Z) - Are Visual Explanations Useful? A Case Study in Model-in-the-Loop
Prediction [49.254162397086006]
画像に基づく年齢予測課題における視覚的満足度に基づく説明について検討する。
モデル予測の提示により,人間の精度が向上することが判明した。
しかし、様々な種類の説明は、人間の正確さやモデルの信頼を著しく変えることができない。
論文 参考訳(メタデータ) (2020-07-23T20:39:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。