論文の概要: Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- arxiv url: http://arxiv.org/abs/2607.08403v1
- Date: Thu, 09 Jul 2026 12:28:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.526532
- Title: Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- Title(参考訳): ゲーム理論駆動型マルチエージェントフレームワークは言語モデル幻覚を緩和する
- Abstract要約: 本稿では,ベイジアンとチームゲーム原理を統合した適応型マルチエージェントフレームワークであるG-Frameが,高品質なデータ合成とモデルトレーニングのための自動クローズループを確立していることを示す。
ドメイン制約の内部化を構造化推論により強制することにより,363,045個の鎖と199,589個の問合せ対からなる特別なコーパスを合成した。
結果の7BモデルであるOmniChemは、カスタムベンチマークのGPT 4o miniとChemBenchのパフォーマンスを同等にし、ベースアーキテクチャに対する幻覚の79.46%の減少を示した。
- 参考スコア(独自算出の注目度): 17.86707751994118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The application of lightweight Large Language Models in rule-based scientific domains remains severely limited by their tendency to mimic linguistic patterns rather than reproduce axiomatic reasoning, causing frequent hallucinations. Here, we show that G-Frame, an adaptive multi-agent framework integrating Bayesian and team game principles, establishes an automated closed-loop for high-quality data synthesis and model training. By forcing the internalization of domain constraints through structured reasoning, we synthesized a specialized corpus of 363,045 chains-of-thought and 199,589 question-answer pairs. The resulting 7B model OmniChem achieves performance parity with GPT 4o mini on custom benchmarks and ChemBench while exhibiting a 79.46% reduction in hallucinations relative to its base architecture. We further demonstrate the advanced capabilities of OmniChem in molecular design and synthesis planning. This work establishes a scalable paradigm utilizing adaptive multi-agents to overcome inherent reasoning deficiencies, offering a feasible pathway for accelerating knowledge discovery in specialized scientific fields.
- Abstract(参考訳): 規則に基づく科学領域における軽量な大規模言語モデルの適用は、公理的推論を再現するよりも言語パターンを模倣する傾向が強く制限されており、幻覚が頻発している。
本稿では,ベイジアンとチームゲーム原理を統合した適応型マルチエージェントフレームワークであるG-Frameが,高品質なデータ合成とモデルトレーニングのための自動クローズループを確立していることを示す。
ドメイン制約の内部化を構造化推論により強制することにより,363,045個の鎖と199,589個の問合せ対からなる特別なコーパスを合成した。
結果の7BモデルであるOmniChemは、カスタムベンチマークのGPT 4o miniとChemBenchのパフォーマンスを同等にし、ベースアーキテクチャに対する幻覚の79.46%の減少を示した。
我々は、分子設計と合成計画におけるOmniChemの高度な能力をさらに実証する。
この研究は、適応的マルチエージェントを利用したスケーラブルなパラダイムを確立し、固有の推論欠陥を克服し、専門的な科学分野における知識発見を加速するための実現可能な経路を提供する。
関連論文リスト
- ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding [56.94419746470799]
大規模言語モデル (LLM) は、科学的なテキスト処理に革命をもたらしたが、化学反応図を解釈する際には、大きな能力ギャップが現れる。
本稿では,視覚アンカー機構を用いたケミカルビジュアルアクティベーション(ChemVA)フレームワークを提案する。
我々は,高密度な視覚・セマンティックな文脈を特徴とする新たに構築されたデータセットであるOCRD-Benchに対するアプローチを評価する。
論文 参考訳(メタデータ) (2026-05-17T01:12:50Z) - OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning [51.33849811496781]
大規模言語モデル (LLM) は例外的な論理的推論能力を示しているが、部分微分方程式 (PDE) による連続力学としばしば競合する。
OMNIFLOWは, 領域固有のパラメータ更新を必要とせず, 基本物理法則で凍結LDMを基底として設計したマルチモーダルシンボリックアーキテクチャである。
我々は, 微視的乱流, 理論的ナビエ・ストークス, マクロ的世界天気予報のベンチマークでこれを評価した。
論文 参考訳(メタデータ) (2026-03-16T18:29:01Z) - Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis [51.83339196548892]
ChemCraftは、知識ストレージから化学推論を分離する新しいフレームワークである。
ChemCraftは最小の推論コストで優れたパフォーマンスを実現する。
この研究は、AI支援化学のコスト効率とプライバシ保護のパラダイムを確立する。
論文 参考訳(メタデータ) (2026-01-25T04:23:34Z) - ChemNavigator: Agentic AI Discovery of Design Rules for Organic Photocatalysts [0.0]
ChemNavigatorは、自律的に構造-プロパティ関係を導出するエージェントAIシステムである。
ケムナビゲーターは、フロンティア軌道エネルギーを管理する6つの統計的に重要な設計規則を自律的に特定した。
論文 参考訳(メタデータ) (2026-01-23T07:44:28Z) - Bridging the Plausibility-Validity Gap by Fine-Tuning a Reasoning-Enhanced LLM for Chemical Synthesis and Discovery [0.0]
大規模言語モデルは、科学的に合理的に見えるが基本的な原則に反する出力をしばしば生成する。
本稿では、推論中心のモデルアーキテクチャと低ランク適応微調整を組み合わせた体系的なアプローチを提案する。
微調整されたシステムは96.3%の形式順守、97.4%の化学的妥当性、74.4%の合成可能性を達成する。
論文 参考訳(メタデータ) (2025-07-09T23:05:23Z) - GENERator: A Long-Context Generative Genomic Foundation Model [66.46537421135996]
本稿では,98k塩基対 (bp) と1.2Bパラメータからなるゲノム基盤モデル GENERator を提案する。
DNAの386Bbpからなる拡張データセットに基づいて、GENERatorは、確立されたベンチマークと新しく提案されたベンチマークの両方で最先端のパフォーマンスを実証する。
また、特に特定のアクティビティプロファイルを持つエンハンサーシーケンスを即応的に生成することで、シーケンス最適化において大きな可能性を秘めている。
論文 参考訳(メタデータ) (2025-02-11T05:39:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。