論文の概要: One Run Is Not an Idea: The Implementation Lottery in Automated Research
- arxiv url: http://arxiv.org/abs/2607.26587v1
- Date: Wed, 29 Jul 2026 08:06:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.577458
- Title: One Run Is Not an Idea: The Implementation Lottery in Automated Research
- Title(参考訳): One Runはアイデアではない - 自動化された研究における実装損失
- Abstract要約: 自動研究システムは、アーティファクトの提供と、どのアイデアを保持、転送、追跡するかを決定するために、実験的なスコアを使用する。
1ランはアイデアの1つの実装をスコアする。しかし、1ランはアイデアの1つの実装をスコアする。
メカニズムに関する信念を更新するたびに、ミスマッチは構造的になります。
emphIdea Reliability Auditは、候補カードの検証と凍結、新しいセッション実装のサンプリング、結果のブラインドフィデリティラベルの使用、保存されたアーティファクトの再実行によって、インフィリアの信頼性を測定する。
- 参考スコア(独自算出の注目度): 27.31956713090655
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated research systems use experimental scores both to deliver artifacts and to decide which ideas to retain, transfer, and pursue. Yet one run scores one implementation of an idea. Crediting that realization-level score as evidence about the parent mechanism creates the \emph{implementation lottery}, in which an idea-level conclusion depends on which plausible implementation was sampled. The mismatch is structural whenever one run updates beliefs about a mechanism. We estimate its magnitude. The \emph{Idea Reliability Audit} measures \emph{idea reliability} by validating and freezing candidate cards, sampling fresh-session implementations, using outcome-blind fidelity labels, and rerunning saved artifacts. It reports idea ICC and leave-one-implementation-out (LOO) winner reversal. Prior work generally repeats the task; we repeat the idea. Across 312 assignments on 13 tabular tasks and two coding-agent setups, implementation variance was more than five and ten times same-artifact rerun variance, respectively, and the winner from one implementation draw differed from the winner under the other-two mean in 25.6\% and 43.6\% of decisions. Reversal survives card-level filtering under two outcome-blind review rules. An exploratory diagnostic on three materials-regression workflows with a deterministic evaluator also finds implementation variation dominating the decomposition. These findings distinguish idea reliability from best-of-$N$ artifact utility. Before a score guides idea-level branching, transfer, or research memory, evidence should cover multiple implementations.
- Abstract(参考訳): 自動研究システムは、アーティファクトの提供と、どのアイデアを保持、転送、追跡するかを決定するために、実験的なスコアを使用する。
しかし、あるアイデアの1つの実装を1回実行します。
親機構に関する証拠として実現レベルスコアを信用すると、アイデアレベルの結論がどの実装がサンプリング可能かに依存する「emph{implementation lottery}」が生成される。
メカニズムに関する信念を更新するたびに、ミスマッチは構造的になります。
私たちはその大きさを見積もる。
emph{Idea Reliability Audit}は、候補カードの検証と凍結、新しいセッション実装のサンプリング、結果のブラインドフィデリティラベルの使用、保存されたアーティファクトの再実行によって、 \emph{idea Trust} を測定する。
ICCとLOO(Leave-one-implementation-out)の勝者が逆転したことを報告している。
以前の作業は一般的にタスクを繰り返します。
13の表のタスクと2つのコーディングエージェントのセットアップに関する312の割り当てにおいて、実装のばらつきはそれぞれ5倍と10倍の同じアーティファクトの再実行分散であり、一方の実装の勝者は25.6\%と43.6\%で他の2つの平均で勝者と異なる。
Reversalは2つの結果盲検レビュールールの下でカードレベルのフィルタリングを継続する。
決定論的評価器を用いた3つの材料回帰ワークフローの探索的診断も、分解を支配する実装のばらつきを見出した。
これらの結果は、アイデアの信頼性と$N$のアーティファクトユーティリティを区別する。
スコアがアイデアレベルの分岐、転送、研究メモリを導く前に、エビデンスは複数の実装をカバーするべきである。
関連論文リスト
- Calibrating Interpretability Instruments Before Trusting Their Verdicts [1.0829694003408499]
Causal氏は、大きな言語モデル(LLM)の内部は測定にかかっていると主張している。
これらの測定は、エラーではなく可算数を返す特定の診断可能な方法で失敗する。
このノートは、拒絶と道徳的表現に関する因果的解釈可能性プログラムの6つの失敗を文書化している。
論文 参考訳(メタデータ) (2026-09-13T19:37:02Z) - From Experiments to Decisions: Reusing Evidence in Autonomous Coding Research [0.0]
我々は400タスクのNeuroGolfキャンペーンでエビデンスをどのように再利用するかを再構築する。
数値的な反例は、オーバーブロード排除を公開する。
他のエピソードでは、失敗、不完全、そして修正されたプログラムが次に行うことを正当化する。
論文 参考訳(メタデータ) (2026-09-10T03:48:31Z) - Split the Labor: Separating Evidence Interpretation from Decision Aggregation [0.0]
言語モデルに多くの情報源から結論に達するよう要求するシステムは通常、それらを1つのプロンプトに分割する。
提案する4分野のエビデンス(仮説,信頼性バケット,合理性,証明)は,両半減期を決定することを示す。
この修正はアーキテクチャよりも算術的であり、言語モデル以外のルールのクラスに適用される。
論文 参考訳(メタデータ) (2026-08-14T17:24:55Z) - When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide [0.0]
5つのデータセットと2つの既知のエフェクトスイープにまたがる6つの推定器をベンチマークし、非シミュレートされたペア参照に対してそのメカニズムを検証する。
ターゲット自身のスコアからロガーをシャープすると、テスト対象範囲をわずかにオーバーラップし、アクションレベルの不一致が崩壊する。
結果のニュアンスのみを適合させることは、再利用バイアスをその場に残し、それを悪化させます。
論文 参考訳(メタデータ) (2026-08-12T18:10:10Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation? [4.120238673372104]
半教師付き学習は、アノテーションのコストを削減する主要なパラダイムとなっている。
現在の進歩は2倍の過信問題によって曇っていると我々は主張する。
本稿では,二軸信頼性評価エンジン上に構築した三空間原理分割フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T08:16:40Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search [62.1546099504045]
本稿では、推論を計画と実行に分離する二相テストタイムスケーリングフレームワークを提案する。
具体的には、推論軌跡を分解し、各フェーズの報酬モデルを構築し、探索者が個別に計画と実行を探索、実行できるようにする。
数学的推論とコード生成ベンチマークの両方の実験により、我々の手法は計算の冗長性を低減しつつ、常に精度を向上することを示した。
論文 参考訳(メタデータ) (2025-09-29T19:27:23Z) - Traversal Verification for Speculative Tree Decoding [15.720388162422978]
投機的復号化は、大きな言語モデルを加速するための有望なアプローチである。
本稿では,新しい投機的復号化アルゴリズムであるトラバーサル検証を紹介する。
提案手法は,既存手法よりも受け入れ長とスループットを継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-05-18T12:51:55Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - Forging the Forger: An Attempt to Improve Authorship Verification via Data Augmentation [52.72682366640554]
著者検証(英語: Authorship Verification, AV)とは、ある特定の著者によって書かれたか、別の人物によって書かれたのかを推測するテキスト分類タスクである。
多くのAVシステムは敵の攻撃に弱いことが示されており、悪意のある著者は、その書体スタイルを隠蔽するか、あるいは他の著者の書体を模倣することによって、積極的に分類者を騙そうとしている。
論文 参考訳(メタデータ) (2024-03-17T16:36:26Z) - Counterfactual Prediction Under Selective Confounding [3.6860485638625673]
この研究は、全ての共同創設者が知られていない場合、バイナリ処理とその結果の間の因果推論を行うという課題に対処する。
我々は、希望する処置の下ですべての共同創設者を知るという要求を緩和し、選択的共起(Selective Confounding)と呼ぶ。
提案手法の有効性に関する理論的誤差境界と実証的証拠の両方を,実世界と実世界の子配置データを用いて提示する。
論文 参考訳(メタデータ) (2023-10-21T16:54:59Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z) - L2R2: Leveraging Ranking for Abductive Reasoning [65.40375542988416]
学習システムの帰納的推論能力を評価するために,帰納的自然言語推論タスク(alpha$NLI)を提案する。
新たな$L2R2$アプローチは、Learning-to-rankフレームワークの下で提案されている。
ARTデータセットの実験は、公開リーダボードの最先端に到達します。
論文 参考訳(メタデータ) (2020-05-22T15:01:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。