論文の概要: Investigating Human--AI Discrepancies via Multiple-Solution Problems
- arxiv url: http://arxiv.org/abs/2609.34258v1
- Date: Mon, 28 Sep 2026 04:03:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 22:28:34.64713
- Title: Investigating Human--AI Discrepancies via Multiple-Solution Problems
- Title(参考訳): 複数解問題による人間-AI格差の調査
- Abstract要約: 人間の推論とモデル推論が、有効な解よりも異なる分布をもたらすかどうかを問う。
私たちのテストベッドは、5つのパズルファミリーにわたる270の推論パズルで構成されています。
結果は、人間とAIの問題解決プロセスの間に大きな違いがあることを示している。
- 参考スコア(独自算出の注目度): 25.66375733249981
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frontier artificial intelligence (AI) models are benchmarked on whether they reach a correct answer. Yet many problems admit several correct answers and repeated attempts, by different people or by the same model resampled, trace out a distribution over them. In this work, we ask whether human and model reasoning lead to different distributions over valid solutions. Our testbed comprises 270 reasoning puzzles across five puzzle families. These multiple-solution puzzles each have 3 to 8 valid solutions and are simple enough that humans and models can solve them reliably. The resulting distributions differ markedly: models differ from one another, yet resemble each other far more than they resemble humans. Model distributions are, moreover, within every puzzle family, less diverse than human ones. We compare these discrepancies across puzzle categories, and trace how they respond to reasoning-effort settings, to prompting, and to perturbations of the puzzle that leave its solutions unchanged. Together, these results point at significant differences between human and AI problem-solving processes, and their choice among equally defensible solutions. As progressive deployment of AI systems in society comes into focus, evaluating such differences (beyond one-dimensional accuracy metrics) is increasingly important. Data and code are available at https://hai-discrepancies.github.io/
- Abstract(参考訳): 最前線人工知能(AI)モデルは、正しい答えに達するかどうかをベンチマークする。
しかし、多くの問題は、いくつかの正しい答えと、異なる人々による、あるいは同じモデルによる繰り返しの試みを認め、それらの上の分布をトレースする。
本研究では、人間とモデル推論が有効な解に対して異なる分布をもたらすかどうかを問う。
私たちのテストベッドは、5つのパズルファミリーにわたる270の推論パズルで構成されています。
これらの多重解解パズルはそれぞれ3から8の有効な解を持ち、人間やモデルはそれらを確実に解けるほど単純である。
モデルは互いに異なるが、人間に似ているよりもはるかに似ている。
モデル分布は、すべてのパズルファミリーの中で、人間よりも多様性が低い。
これらの相違点をパズルのカテゴリで比較し、推論・エフォートの設定にどう反応するか、プロンプトにどう反応するか、そして解法をそのまま残すパズルの摂動について追跡する。
これらの結果は、人間とAIの問題解決プロセスと、等しく防御可能なソリューションの選択の間に大きな違いを示している。
社会におけるAIシステムの進歩的な展開が注目されるにつれて、そのような違い(一次元の精度メトリクス以外にも)を評価することがますます重要である。
データとコードはhttps://hai-discrepancies.github.io/で公開されている。
関連論文リスト
- Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models [78.68818219506313]
本稿では,複数解に対する分布推論を行うための多解補足学習手法について述べる。
質問応答, 診断, コーディングベンチマークを通じて, 単一回答学習ベースラインと比較して, 多様性, カバレッジ, 設定レベルの校正スコアが向上した。
論文 参考訳(メタデータ) (2026-03-25T22:20:25Z) - The Majority is not always right: RL training for solution aggregation [53.1050856072799]
我々はアグリゲータモデルをトレーニングし、最終的な正解をレビューし、精査し、合成する。
重要な要素は、簡単なトレーニング例と厳しいトレーニング例のバランスを取ることだ。
我々の手法であるAggLMは、強いルールベースと報酬モデルベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2025-09-08T16:39:38Z) - PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts [47.92619068073141]
我々は、ステップバイステップ、オープンエンド、クリエイティブマルチモーダル推論を評価するために設計された667のパズルハントスタイルの大規模ベンチマークであるPuzzleWorldを紹介した。
ほとんどの最先端モデルでは最終解の精度は1-2%に過ぎず、最高のモデルではパズルの14%しか解けず、ステップワイズ精度は40%に達する。
誤り解析により,現在のモデルは筋力的推論を示し,言語に基づく推論の限界に悩まされ,視覚的および空間的推論に不可欠なスケッチ能力が欠如していることが判明した。
論文 参考訳(メタデータ) (2025-06-06T16:17:09Z) - Some things to know about achieving artificial general intelligence [0.0]
現時点および予見可能なGenAIモデルは、人為的負債に悩まされているため、人工知能を達成できない。
十分に構造化された問題やアーキテクチャ、トレーニングデータを提供するには、人間の入力に大きく依存する。
彼らは全ての問題を言語パターン学習の問題とみなし、人工知能を実現するために必要な自律性は持っていない。
論文 参考訳(メタデータ) (2025-02-10T20:10:26Z) - Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths [69.39559168050923]
本稿では,多様な経路から学習の推論と探索を可能にするReasoning Paths Optimization (RPO)を紹介する。
提案手法は,各推論ステップにおいて好意的な分岐を奨励し,好ましくない分岐を罰し,モデル全体の問題解決性能を高める。
我々は,数語問題や理科ベースの試験問題など,多段階の推論タスクに焦点をあてる。
論文 参考訳(メタデータ) (2024-10-07T06:37:25Z) - Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious
Challenges in Multimodal Reasoning [24.386388107656334]
本稿では,視覚的質問応答の文脈内での多モーダルパズル解決の新たな課題を紹介する。
本稿では,アルゴリズムパズルの解法におけるマルチモーダル言語モデルの能力に挑戦し,評価するための新しいデータセットAlgoVQAを提案する。
論文 参考訳(メタデータ) (2024-03-06T17:15:04Z) - iSNEAK: Partial Ordering as Heuristics for Model-Based Reasoning in Software Engineering [11.166755101891402]
iSNEAKは、インクリメンタルなAI問題解決ツールである。
情報過負荷問題を解決するため,iSNEAKのような部分順序付けやツールを提案する。
論文 参考訳(メタデータ) (2023-10-29T19:21:37Z) - On Explainability in AI-Solutions: A Cross-Domain Survey [4.394025678691688]
システムモデルを自動的に導出する際、AIアルゴリズムは人間には検出できないデータで関係を学習する。
モデルが複雑になればなるほど、人間が意思決定の理由を理解するのが難しくなる。
この研究は、この話題に関する広範な文献調査を提供し、その大部分は、他の調査から成っている。
論文 参考訳(メタデータ) (2022-10-11T06:21:47Z) - Towards Explainable Metaheuristic: Mining Surrogate Fitness Models for
Importance of Variables [69.02115180674885]
4つのベンチマーク問題を用いて代理モデルを訓練し、代理モデルによる探索空間の学習について検討する。
代々の人口データに基づいて学習した結果,サロゲートモデルが問題の鍵となる特徴を抽出できることが示唆された。
論文 参考訳(メタデータ) (2022-05-31T09:16:18Z) - A Mutual Information Maximization Approach for the Spurious Solution
Problem in Weakly Supervised Question Answering [60.768146126094955]
弱々しい教師付き質問応答は通常、最終的な答えのみを監督信号として持つ。
偶然に正解を導出する刺激的な解が多数存在するかもしれないが、そのような解の訓練はモデルの性能を損なう可能性がある。
本稿では,質問応答対と予測解間の相互情報の最大化により,このような意味的相関を明示的に活用することを提案する。
論文 参考訳(メタデータ) (2021-06-14T05:47:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。