論文の概要: Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study
- arxiv url: http://arxiv.org/abs/2608.01995v1
- Date: Mon, 03 Aug 2026 09:56:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.479188
- Title: Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study
- Title(参考訳): 言語モデルエージェントを用いた長期自律型建築研究--行動ケーススタディ
- Abstract要約: 我々は,1つの汎用大規模言語モデルが,長期的ニューラルアーキテクチャ設計問題において唯一の研究者として機能する場合に何が起こるかを研究する。
この研究は3つのフェーズから構成され、人間の宣言された遷移によって分離され、エージェントのツール表面や問題スケールを徐々に拡大する。
本研究は, ワークフロー設計がエージェント能力に匹敵する影響力があることを結論し, 多様な探索, 予算付きムーンショット仮説, 明示的なフォーク, ルール対応の再検証を提案する。
- 参考スコア(独自算出の注目度): 0.3683202928838613
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study what happens when a single general-purpose large language model acts as the sole researcher on a long-horizon neural architecture design problem. The agent receives a scientific question, an initial hypothesis and motivation, a compute budget, and research affordances (source and experiment management, experiment tracking, literature access, and persistent memory), then autonomously proposes, implements, evaluates, and records experiments over an extended period. The study comprises three phases, separated by human-declared transitions, that progressively expand the agent's tool surface or problem scale. Across approximately 100 sequential experiments, the agent improves a non-standard Vision Transformer from a weak baseline to a stronger, efficient model on small benchmarks and a usable but sub-SOTA model on ImageNet-1K, while producing a dense behavioural trace. We report four findings.(i)Productivity exhibits a clear phase structure: rapid early gains, a multi-dozen-hypothesis saturation wall, and recovery, with recovery triggered by expanding the action surface rather than changing the underlying model.(ii)A single early hypothesis contributes more to accuracy gain, with later improvements long-tailed.(iii)The preference for greedy, incremental hypotheses is largely workflow-induced: a commit-or-discard evaluation rule is isomorphic to greedy hill-climbing; the remainder reflects risk aversion after bold failures and anchoring on familiar literature. (iv)The agent independently rediscovers established results and, in the unfamiliar regime of pure channel attention, overturns a standard design choice. We conclude that workflow design was at least as influential as agent capability in this study and propose diversified search, budgeted moonshot hypotheses, explicit forks, and regime-aware re-validation as testable directions for future autonomous research.
- Abstract(参考訳): 我々は,1つの汎用大規模言語モデルが,長期的ニューラルアーキテクチャ設計問題において唯一の研究者として機能する場合に何が起こるかを研究する。
エージェントは、科学的疑問、初期仮説と動機、計算予算、研究能力(ソースと実験管理、実験追跡、文学アクセス、永続記憶)を受け取り、その後、長期にわたる実験を自律的に提案し、実施し、評価し、記録する。
この研究は3つのフェーズから構成され、人間の宣言された遷移によって分離され、エージェントのツール表面や問題スケールを徐々に拡大する。
約100回の連続実験で、エージェントは非標準ビジョントランスフォーマーを弱いベースラインから、小さなベンチマーク上でより強力で効率的なモデル、ImageNet-1K上で使用可能なサブSOTAモデルに改良し、高密度な挙動トレースを生成する。
我々は4つの発見を報告した。
(i)プロダクティビティは, 高速早期ゲイン, マルチドアゼン・ハイポテーシス飽和壁, リカバリなどの明確な相構造を示し, 基礎モデルを変更するのではなく, 作用面を拡大して回復する。
(ii) 1つの早期仮説は、精度の向上に寄与し、後の改善は長期化される。
3) 積極的, 漸進的仮説は, 概ねワークフローに起因している: コミット・オア・デカード評価規則は, 積極的ヒルクライミングと同型であり, 残りは大胆な失敗の後にリスク回避を反映し, 慣れ親しんだ文献に定着する。
四 エージェントは、独立して結果を確定し、純チャネル注意の慣れない体制において、標準設計選択を覆す。
本研究におけるワークフロー設計は,少なくともエージェント能力に匹敵する影響力があることを結論し,将来の自律研究の実証可能な方向として,多種多様な探索,予算化されたムーンショット仮説,明示的なフォーク,レジーム対応の再検証を提案する。
関連論文リスト
- AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era [55.37558486468993]
AgentIdeaBenchは、静的観測とアクティブ探索という2つの一致した条件下で科学的思考を評価するベンチマークである。
5つの分野にまたがる40の高密度サブフィールドにおける33個のLDMの静的アクティブ評価を一致させた。
アクティブな探索により、ヘッドルームの能力は大幅に向上し、ヘッドルームはモデル間で不均一に分散される。
論文 参考訳(メタデータ) (2026-09-07T15:19:13Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - Plan Before Search: Search Agents Need Plan [66.42962362539934]
サブスキル間の依存構造と蒸留が能力獲得への唯一の道ではない可能性について検討する。
本研究では,任意のターゲットモデルにおいてPlanを活性化するフィルタトラジェクトリを小型のシードモデルで生成する自己ブートストラッピングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-27T11:54:15Z) - Separable Pathways for Causal Reasoning: How Architectural Scaffolding Enables Hypothesis-Space Restructuring in LLM Agents [0.0]
我々は,ブレケット検出器のパラダイムを発達科学から,仮説空間再構成をターゲットとしたアーキテクチャ的な足場を備えたAIエージェントのテスト能力まで拡張する。
コンポジションアーキテクチャには、型付き状態マシンとして構造探索を行うコンテキストグラフと、現在の仮説空間が不十分である証拠を監視し、実行時に拡張する動的挙動の2つの独立したコンポーネントがある。
論文 参考訳(メタデータ) (2026-04-21T22:49:17Z) - Agentic Discovery with Active Hypothesis Exploration for Visual Recognition [22.895961870906405]
hypoExploreは、仮説駆動の科学的調査として視覚認識のためのニューラルネットワーク発見を定式化している。
新しい仮説は、二重戦略によって導かれる、構築する親仮説を選択することで、大きな言語モデルを用いて作成される。
仮説の信頼性スコアは証拠が蓄積するにつれてますます予測的になり、学習された原理が独立した進化の系統間で伝達されることを示す。
論文 参考訳(メタデータ) (2026-04-14T17:34:05Z) - Observationally Informed Adaptive Causal Experimental Design [55.998153710215654]
本稿では,観測モデルを基礎的先行として活用する新たなパラダイムであるアクティブ残留学習を提案する。
このアプローチは、実験的な焦点を、目標因果量の学習から、観察バイアスの補正に必要な残差を効率的に推定するへとシフトさせる。
合成および半合成ベンチマークの実験は、R-Designがベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-03-04T06:52:37Z) - SELF-REDRAFT: Eliciting Intrinsic Exploration-Exploitation Balance in Test-Time Scaling for Code Generation [12.241337921137259]
インタプリタのフィードバックなしにテスト時のスケーリングは、現実のコード生成シナリオに不可欠である。
SELF-REDRAFTはSelf-Refine上に構築されたフレームワークで、根本的な欠陥のあるソリューションのための新しいドラフトの提案を促進する。
論文 参考訳(メタデータ) (2025-10-31T06:30:47Z) - Learning from Emergence: A Study on Proactively Inhibiting the Monosemantic Neurons of Artificial Neural Networks [10.390475063385756]
オンライン計算の効率性を保証するため,ニューロンのモノセマンティリティを測定するための新しい指標を提案する。
モノセマンティリティが異なるモデルスケールで性能変化をもたらすという予想を検証する。
論文 参考訳(メタデータ) (2023-12-17T14:42:46Z) - Understanding, Predicting and Better Resolving Q-Value Divergence in
Offline-RL [86.0987896274354]
まず、オフラインRLにおけるQ値推定のばらつきの主な原因として、基本パターン、自己励起を同定する。
そこで本研究では,Q-network の学習における進化特性を測定するために,SEEM(Self-Excite Eigen Value Measure)尺度を提案する。
われわれの理論では、訓練が早期に発散するかどうかを確実に決定できる。
論文 参考訳(メタデータ) (2023-10-06T17:57:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。