論文の概要: XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition
- arxiv url: http://arxiv.org/abs/2605.14754v1
- Date: Thu, 14 May 2026 12:19:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.814555
- Title: XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition
- Title(参考訳): XDomainBench:高次元科学的知識構成における推論崩壊の診断
- Authors: Gong Zhiren, Tiantong Wu, Jiaming Zhang, Fuyao Zhang, Che Wang, Yurong Hao, Yikun Hou, Foo Ping, Yilei Zhao, Fei Huang, Chau Yuen, Wei Yang Bryan Lim,
- Abstract要約: XDomainBenchは、インタラクティブな学際的科学的推論のための診断ベンチマークである。
合成順序と混合構造を定式化し, 単科目から学際間への系統的ストレステストを可能にする。
LLMの大規模評価は、組成の順序が増加するにつれて、体系的な推論の崩壊が明らかになる。
- 参考スコア(独自算出の注目度): 55.07589952126153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed for knowledge synthesis, yet their capacity for compositional generalization in scientific knowledge remains under-characterized. Existing benchmarks primarily focus on single-turn restricted scenarios, failing to capture the capability boundaries exposed by real-world interactive scientific workflows. To address this, we introduce XDomainBench, a diagnostic benchmark for interactive interdisciplinary scientific reasoning. We formalize the composition order and mixture structure to enable systematic stress-testing from single-discipline to inter-disciplinary, comprising 8,598 interactive sessions across 20 domains and 4 task categories, with 8 realistic trajectory patterns covering difficulty and domain-mixture dynamics, simulating real AI4S scenarios. Large-scale evaluation of LLMs reveals a systematic reasoning collapse as composition order increases, stemming from two root causes: (i) direct difficulty increases induced by domain composition, and (ii) indirect interaction-amplified failures where trajectory patterns trigger error accumulation, reasoning breaks, and domain confusion, ultimately leading to session collapse.
- Abstract(参考訳): 大規模言語モデル (LLM) は知識合成のためにますます展開されているが、科学知識における構成的一般化の能力は未熟である。
既存のベンチマークは、主にシングルターン制限されたシナリオに焦点を当てており、現実のインタラクティブな科学ワークフローによって公開されている能力境界をキャプチャできない。
そこで本研究では,対話型学際科学的推論のための診断ベンチマークであるXDomainBenchを紹介する。
合成順序と混合構造を定式化し,20のドメインと4のタスクカテゴリにまたがる8,598の対話的なセッションと,難易度とドメイン混在のダイナミクスをカバーする8つの現実的な軌跡パターンと,実際のAI4Sシナリオをシミュレートした。
LLMの大規模評価は,2つの根本原因から生じる組成順の増加に伴う系統的推論崩壊を明らかにする。
一 ドメイン構成による直接難易度の増加、及び
(ii) トラジェクトリパターンがエラーの蓄積、推論の中断、ドメインの混乱を引き起こし、最終的にセッションが崩壊する間接的なインタラクション増幅障害。
関連論文リスト
- LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models [0.0]
対話型エージェントとしての大規模言語モデル(LLM)の展開は、用語学が適切に特徴付けるのに失敗する行動的失敗のカテゴリを明らかにしている。
本稿では, 精神障害と機能的類似を示すモデル認知の病態分解のための構造的理論的枠組みとして, LLM精神病を紹介した。
論文 参考訳(メタデータ) (2026-04-07T09:44:15Z) - OrchMAS: Orchestrated Reasoning with Multi Collaborative Heterogeneous Scientific Expert Structured Agents [40.6404203725551]
本稿では,科学的ドメイン指向の対話型2層マルチモデルオーケストレーションフレームワークを提案する。
専用のオーケストレーションモデルは各タスクを分析し、ドメインを意識した推論パイプラインを動的に構築し、カスタマイズされたプロンプトで専門の専門家エージェントをインスタンス化する。
オーケストレータは、中間フィードバックに基づいてパイプラインを反復的に更新し、動的リプランニング、ロール再配置、マルチターンインタラクション間の即時改善を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:57:43Z) - Region-aware Spatiotemporal Modeling with Collaborative Domain Generalization for Cross-Subject EEG Emotion Recognition [15.65302580686776]
物体間変動が強いため、物体間脳波に基づく感情認識は困難である。
本研究では、感情認識のための協調的ドメイン一般化を用いた地域対応時空間モデリングフレームワークを提案する。
RSM-CoDGは機能的脳領域分割から派生した先行を組み込んで領域レベルの空間表現を構築する。
また、感情誘発神経活動の動的進化を特徴付けるために、マルチスケールの時間モデルも採用している。
論文 参考訳(メタデータ) (2026-01-22T03:35:40Z) - CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs [53.199517625701475]
CoGはDual-Process Theoryにインスパイアされたトレーニング不要のフレームワークで、直観と熟考の相互作用を模倣している。
CoGは精度と効率の両方において最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-16T07:27:40Z) - ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning [118.46980291324148]
ATLASは、約800のオリジナルの問題からなる大規模で、高精度で、学際横断的な評価スイートである。
主な特徴は次のとおりである。 テストデータの漏洩を防ぐために新しく作成されたり、実質的に適応されたすべての質問を含む、高いオリジン性と汚染抵抗。
先行モデルに関する予備的な結果は、ATLASが先進的な科学的推論能力の差別化に有効であることを証明している。
論文 参考訳(メタデータ) (2025-11-18T11:13:06Z) - Causal-Copilot: An Autonomous Causal Analysis Agent [25.5944359329613]
Causal-Copilotは、専門家レベルの因果分析を運用する自律エージェントである。
自然言語によるインタラクティブな洗練をサポートし、非専門主義者の障壁を低くする。
私たちのシステムは、ドメインエキスパートのための高度な因果的手法へのアクセスを拡大する、活発なサイクルを育みます。
論文 参考訳(メタデータ) (2025-04-17T18:05:39Z) - A Survey on Post-training of Large Language Models [185.51013463503946]
大規模言語モデル(LLM)は、自然言語処理を根本的に変革し、会話システムから科学的探索まで、さまざまな領域で欠かせないものにしている。
これらの課題は、制限された推論能力、倫理的不確実性、最適なドメイン固有のパフォーマンスといった欠点に対処するために、先進的な訓練後言語モデル(PoLM)を必要とする。
本稿では,タスク固有の精度を向上するファインチューニング,倫理的コヒーレンスと人間の嗜好との整合性を保証するアライメント,報酬設計の課題によらず多段階の推論を進める推論,統合と適応の5つのパラダイムを体系的に追跡したPoLMの総合的な調査について述べる。
論文 参考訳(メタデータ) (2025-03-08T05:41:42Z) - Failure Modes of LLMs for Causal Reasoning on Narratives [51.19592551510628]
世界の知識と論理的推論の相互作用について検討する。
最先端の大規模言語モデル(LLM)は、しばしば表面的な一般化に依存している。
タスクの単純な再構成により、より堅牢な推論行動が引き起こされることを示す。
論文 参考訳(メタデータ) (2024-10-31T12:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。