論文の概要: Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses
- arxiv url: http://arxiv.org/abs/2608.19206v1
- Date: Thu, 11 Jun 2026 21:33:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.263729
- Title: Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses
- Title(参考訳): 欠陥ではなく特徴としての幻覚:投機的言語モデル出力を検証可能な科学的仮説に変換するためのマルチエージェントアーキテクチャの評価
- Abstract要約: ナラティブ・ナドレミングとエグゼクティブ・コントロールの対比を機能的アナロジーとして用いた,Rustベースのマルチエージェントオーケストレーションを提案する。
最初の実験では、身体科学と社会科学の領域で多種多様な生存可能性評価仮説が生み出された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contemporary Large Language Models (LLMs) are increasingly aligned to suppress hallucinations, prioritizing factual retrieval over combinatorial creativity. While crucial for mitigating misinformation, this alignment may also restrict speculative Research and Development (R&D) by encouraging what this work operationally treats as semantic overfitting and diversity collapse. In this paper, we propose a Rust-based multi-agent orchestration that uses the contrast between narrative daydreaming and executive control as a functional analogy, not as a neurocognitive claim. The system instigates an Epistemological Friction loop between a high-entropy generating agent and a web-grounded evaluating agent, mediated by a low-entropy semantic bottleneck intended to reduce noise and repetition. Initial experiments generated diverse, viability-rated hypotheses across physical and social-science domains. We additionally report an exploratory paired baseline and ablation study comparing the full system against direct prompting, self-reflection, removal of the semantic filter, removal of search grounding, and removal of lateral lenses. The results place direct prompting among the weakest conditions across most observed metrics, but they do not show a general superiority of the full system over simple self-reflection. Instead, they suggest that each architecture shifts the balance between originality, feasibility, diversity, and empirical grounding in different ways, and that the full system provides its main advantages when hypotheses must survive strong physical, empirical, or institutional constraints. These findings do not show that hallucination is useful in isolation; they suggest that speculative generation gains value only when constrained by architecture, empirical grounding, and explicit evaluation.
- Abstract(参考訳): 現代大規模言語モデル (LLMs) は幻覚を抑え、組合せ的創造性よりも事実検索を優先する傾向にある。
このアライメントは、誤情報の緩和には不可欠だが、この作業が意味的な過剰適合と多様性の崩壊として運用的に扱うものを奨励することによって、投機的研究開発(R&D)を制限する可能性がある。
本稿では,ナラティブ・ナドレミングとエグゼクティブ・コントロールの対比を,神経認知的クレームではなく機能的アナロジーとして利用する,Rustベースのマルチエージェントオーケストレーションを提案する。
本システムは、高エントロピー発生剤とWebグラウンド評価剤との間のエピストロジー摩擦ループを、ノイズと繰り返しの低減を目的とした低エントロピーセマンティックボトルネックに介在させる。
最初の実験では、身体科学と社会科学の領域で多種多様な生存可能性評価仮説が生み出された。
さらに, 直接的プロンプト, 自己反射, 意味フィルタの除去, 検索グラウンドの除去, 側方レンズの除去について, 全システムと比較した探索的ペアベースラインおよびアブレーションスタディを報告する。
結果は、観測されたほとんどの指標の中で最も弱い条件の中で直接的に引き起こされるが、単純な自己回帰よりも完全なシステムの一般的な優位性を示すものではない。
その代わりに、各アーキテクチャは、独創性、実現性、多様性、経験的基盤のバランスを異なる方法でシフトし、仮説が強い物理的、経験的、または制度的な制約に耐える必要がある場合に、完全なシステムが主な利点を提供することを示唆している。
これらの知見は、幻覚は孤立において有用であることを示すものではなく、投機的生成は、アーキテクチャ、経験的基礎、明示的な評価によって制約された場合にのみ、価値が得られることを示唆している。
関連論文リスト
- Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation [0.0]
AIと科学哲学の最近の議論は、真の仮説生成には物理世界と連続的に結合するエージェントが必要であるというものである。
私たちは、より狭い主張を守ります。あらゆる誘拐的な科学的行為には、オンラインの実施は必要ないのです。
独立に開発された2つの構造が、明示的な対応の下で1つの対象であるという推測である。
論文 参考訳(メタデータ) (2026-08-03T17:05:31Z) - HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models [70.67112531913669]
視覚言語モデルにおける幻覚は、一般的に意味的誤りとして扱われる。
それまでの研究は主に、世代ごとの幻覚の検出や抑制に重点を置いていた。
幻覚的意味論がモデルの推論コンテキストに入る段階である PHR (Post Hallucination Reasoning) について検討する。
論文 参考訳(メタデータ) (2026-07-08T15:02:11Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents [51.56484100374058]
また,本論文では,本論文の関心事に役立てるために必要な文書密度が,意味論的に類似したマイノリティの検索地区を幾何的に超過することができることを示した。
本稿では,このような高密度検索における目標衝突が基本的性能限界をいかに引き起こすかを分析するための公式な枠組みを提案する。
このような目的が,過半数の利害にのみ貢献する状態に自己組織する上で,システムを促進することを実証する。
論文 参考訳(メタデータ) (2026-06-01T20:40:30Z) - Reducing Hallucination in Vision-Language Models via Stage-wise Preference Optimization under Distribution Shift [0.0]
幻覚は視覚言語モデル(VLM)における根本的な課題である。
目的とするマルチモーダル構成による幻覚低減のためのステージワイドな選好最適化フレームワークを提案する。
オープンソースのベンチマークと実世界のマルチモーダル評価シナリオの実験では、接地一貫性の改善、幻覚の低減、より情報的な接地応答が示されている。
論文 参考訳(メタデータ) (2026-05-13T15:37:51Z) - Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs [68.58207076756237]
本稿では,結果評価からメカニズム診断へ移行する摂動に基づく評価プロトコルProCauEvalを紹介する。
因果推論において,ビデオコンテンツは体系的に過小評価されている。
教師のネガティブなアライメントに基づく強化学習フレームワークであるADPOを提案する。
論文 参考訳(メタデータ) (2026-05-10T08:48:58Z) - From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data [0.0]
本稿では,複合故障システムを構成する3つのアーキテクチャ決定の構造的帰結として幻覚を解析する。
自己認識の共起学習は、意味論的意味の統計的近接を代用し、実体的混乱を生み出す。
露光バイアス下での自己回帰復号の永続的な左から右へのコミットは、1つの間違ったトークンカスケードがリビジョンなしで出力シーケンス全体を通して前方に進むことを保証します。
論文 参考訳(メタデータ) (2026-04-29T11:34:09Z) - Aligned Agents, Biased Swarm: Measuring Bias Amplification in Multi-Agent Systems [27.694287638709643]
現実世界のマルチエージェントシステムは、完全に分析するには複雑すぎる。
基礎的なMASトポロジとフィードバックループが偏見に与える影響について,基礎的研究を行った。
高度な複雑性を排除して、Swarmのダイナミクスを研究することで、構造的複雑性は倫理的堅牢性を保証するものではない、重要なベースラインを確立します。
論文 参考訳(メタデータ) (2026-04-10T05:06:38Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。