論文の概要: Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models
- arxiv url: http://arxiv.org/abs/2503.22165v1
- Date: Fri, 28 Mar 2025 06:09:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-03-31 15:28:42.677458
- Title: Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models
- Title(参考訳): 思考のランドスケープ:大規模言語モデルの推論過程を可視化する
- Authors: Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han,
- Abstract要約: 思考のランドスケープ(英: Landscape of thoughts)は、複数の選択データセットにおいて、思考の連鎖の推論パスを検査するツールである。
強いモデルと弱いモデル、正解と誤解、そして異なる推論タスクを区別する。
また、低い一貫性や高い不確実性など、望ましくない推論パターンを明らかにする。
- 参考スコア(独自算出の注目度): 42.407188124841234
- License:
- Abstract: Numerous applications of large language models (LLMs) rely on their ability to perform step-by-step reasoning. However, the reasoning behavior of LLMs remains poorly understood, posing challenges to research, development, and safety. To address this gap, we introduce landscape of thoughts-the first visualization tool for users to inspect the reasoning paths of chain-of-thought and its derivatives on any multi-choice dataset. Specifically, we represent the states in a reasoning path as feature vectors that quantify their distances to all answer choices. These features are then visualized in two-dimensional plots using t-SNE. Qualitative and quantitative analysis with the landscape of thoughts effectively distinguishes between strong and weak models, correct and incorrect answers, as well as different reasoning tasks. It also uncovers undesirable reasoning patterns, such as low consistency and high uncertainty. Additionally, users can adapt our tool to a model that predicts the property they observe. We showcase this advantage by adapting our tool to a lightweight verifier that evaluates the correctness of reasoning paths. The code is publicly available at: https://github.com/tmlr-group/landscape-of-thoughts.
- Abstract(参考訳): 大規模言語モデル(LLM)の多くの応用は、ステップバイステップ推論を行う能力に依存している。
しかし、LLMの推論行動はいまだに理解されておらず、研究、開発、安全性に課題を提起している。
このギャップに対処するために、我々は思考のランドスケープを導入し、ユーザーが複数の選択データセット上でチェーン・オブ・ソートとその導関数の推論経路を検査する最初の可視化ツールを紹介した。
具体的には、全ての解選択に対する距離を定量化する特徴ベクトルとして、推論経路における状態を表す。
これらの特徴は t-SNE を用いて二次元プロットで可視化される。
思考の風景による質的かつ定量的な分析は、強いモデルと弱いモデル、正解と誤答、および異なる推論タスクを効果的に区別する。
また、低い一貫性や高い不確実性など、望ましくない推論パターンを明らかにする。
さらに、ユーザはツールを観察するプロパティを予測するモデルに適応することができる。
推論経路の正しさを評価する軽量な検証器にツールを適用することで、この利点を実証する。
コードは、https://github.com/tmlr-group/landscape-of- Thoughtsで公開されている。
関連論文リスト
- DRIVINGVQA: Analyzing Visual Chain-of-Thought Reasoning of Vision Language Models in Real-World Scenarios with Driving Theory Tests [69.00444996464662]
本稿では、複雑な実世界のシナリオにおける視覚的連鎖推論を評価するために、駆動理論テストから得られた新しいベンチマークであるDrivingVQAを提案する。
実験の結果,オープンソースおよびプロプライエタリなLVLMは,ゼロショット設定下での視覚的連鎖推論に苦慮していることがわかった。
視覚的推論を改善するために関連エンティティを活用するトレーニング戦略について検討する。
論文 参考訳(メタデータ) (2025-01-08T18:31:16Z) - MageBench: Bridging Large Multimodal Models to Agents [90.59091431806793]
LMMは印象的な視覚的理解能力を示しており、エージェントに適用される可能性がある。
既存のベンチマークは、主に言語部分における推論能力を評価する。
MageBenchは推論機能指向のマルチモーダルエージェントベンチマークである。
論文 参考訳(メタデータ) (2024-12-05T17:08:19Z) - Take A Step Back: Rethinking the Two Stages in Visual Reasoning [57.16394309170051]
本稿では2段階の視点で視覚的推論を再考する。
共有アナライザを使用しながら、異なるデータドメイン用の分離エンコーダによるシンボル化を実装する方が効率的である。
提案する2段階のフレームワークは,様々な視覚的推論タスクにおいて,印象的な一般化を実現する。
論文 参考訳(メタデータ) (2024-07-29T02:56:19Z) - Chain of Images for Intuitively Reasoning [23.692458865558486]
本稿では,複雑な言語推論問題を単純なパターン認識に変換するために,画像の連鎖(CoI)アプローチを提案する。
我々は、画像が直感的に問題解決を支援する15の異なる領域を含むCoI評価データセットを開発した。
CoI推論を支援するために,言語命令に基づいて厳密に画像を生成するシンボリック・マルチモーダル・大規模言語モデル(SyMLLM)を導入する。
論文 参考訳(メタデータ) (2023-11-09T11:14:51Z) - Minding Language Models' (Lack of) Theory of Mind: A Plug-and-Play
Multi-Character Belief Tracker [72.09076317574238]
ToMは,読解における文字の信念状態を調べるためのプラグアンドプレイ方式である。
ToMは、教師付きベースラインと比較して、配電性能が堅牢でありながら、ゼロオーダー設定でのオフ・ザ・シェルフニューラルネットワーク理論の考え方を強化する。
論文 参考訳(メタデータ) (2023-06-01T17:24:35Z) - Faithful Reasoning Using Large Language Models [12.132449274592668]
因果構造が問題の根底にある論理構造を反映するプロセスを通じて、LMを忠実な多段階推論を行う方法を示す。
我々の手法は、各ステップが2つの微調整されたLMへの呼び出しから得られる推論ステップをチェーンすることで機能する。
我々は,多段階論理推論と科学的質問応答におけるモデルの有効性を実証し,最終的な解答精度のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-08-30T13:44:41Z) - Weakly Supervised Relative Spatial Reasoning for Visual Question
Answering [38.05223339919346]
我々は,V&Lモデルの忠実度をこのような幾何学的理解に向けて評価する。
我々は、市販の深度推定器から弱い監督でV&Lを訓練する。
これにより、"GQA"視覚的質問応答チャレンジの精度が大幅に向上する。
論文 参考訳(メタデータ) (2021-09-04T21:29:06Z) - Object-Centric Diagnosis of Visual Reasoning [118.36750454795428]
本稿では,地平とロバスト性に基づく視覚的推論の体系的対象中心の診断について述べる。
我々は,グラフ推論機械という診断モデルを開発した。
本モデルは、純粋に象徴的な視覚的表現を確率的シーングラフに置き換え、教師の強制訓練をビジュアル推論モジュールに適用する。
論文 参考訳(メタデータ) (2020-12-21T18:59:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。