論文の概要: Agora: Git as Shared Memory for Collective AutoResearch
- arxiv url: http://arxiv.org/abs/2609.18094v1
- Date: Wed, 16 Sep 2026 04:00:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.629373
- Title: Agora: Git as Shared Memory for Collective AutoResearch
- Title(参考訳): Agora: 集合的自動検索のための共有メモリとしてのGit
- Abstract要約: Agoraは、自律的な研究ループのための共有メモリである。
研究は追加専用非巡回グラフとして記録されている。
多様性を意識した選択ルールは、コミュニティがひとつのリーダに崩壊しないようにします。
- 参考スコア(独自算出の注目度): 54.31992252587096
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous research loops such as AutoResearch show that one coding agent can improve a training setup unattended. Run several of them and each session starts from scratch, so more agents tend to mean more duplicated search rather than more discovery. Agora is a shared memory for such agents: research is recorded as an append-only directed acyclic graph (DAG) stored in Git, so that every claim is a commit anyone can check out and rerun. Each result, insight, hypothesis, verification, and report is an immutable commit whose parent edges say what it builds on; a derived index exposes the frontier, the neglected branches, and the verification status of each claim, and a diversity-aware selection rule keeps the community from collapsing onto one leader. We describe the system and report its first sustained use: a run of nearly 12 days in which 13 language-model workers, with no assigned tasks and no central planner, worked on a weight-transfer problem. Given 141 pretrained donor models and a frozen 119.6M-parameter attention-SSM hybrid whose dimensions match no donor, the workers had to initialize the target without training data or gradient updates. They published 1,703 contributions and drove the evaluator from 3.39 to 1.899 bits per byte, closing 62% of the gap to a trained GPT-2 124M. The winning recipe compresses donor next-token statistics into the target's embedding and output head, then adds a short-range context signal through sparse edits to attention, feed-forward, and state-space blocks. Its 145-commit ancestry spans 15 accounts, and 165 independent reproductions were posted, none of which failed. We describe the single mid-run human intervention that pulled the community out of a monoculture, what the trace does and does not establish, and the controlled comparison that would settle whether shared research state improves discovery per unit of compute.
- Abstract(参考訳): AutoResearchのような自律的な研究ループは、あるコーディングエージェントが意図しないトレーニング設定を改善することができることを示している。
いくつかのセッションを実行し、各セッションはゼロから始まるので、多くのエージェントは発見よりも重複した検索を意味する傾向がある。
Agoraはそのようなエージェントの共有メモリである。研究はGitに格納された追加専用非循環グラフ(DAG)として記録され、すべてのクレームがチェックアウトして再実行可能である。
それぞれの結果、洞察、仮説、検証、レポートは不変コミットであり、親のエッジが、その上に構築したものを言う。派生インデックスは、フロンティア、無視されたブランチ、および各クレームの検証ステータスを公開し、多様性に配慮した選択ルールは、コミュニティが1つのリーダーに崩壊しないようにする。
約12日間にわたり、13人の言語モデル労働者が、割り当てられたタスクを伴わず、中心的なプランナーを伴わず、重み移動問題に取り組んでいたことを報告した。
141の事前訓練ドナーモデルと119.6Mパラメーター・アテンション-SSMハイブリッドがドナーと一致しないため、労働者は訓練データや勾配更新なしで目標を初期化しなければならなかった。
彼らは1,703のコントリビューションを発表し、評価器を1バイトあたり3.39ビットから1.899ビットに推し進め、ギャップの62%をGPT-2 124Mに短縮した。
当選レシピは、ドナーの次点統計データを目標の埋め込みおよび出力ヘッドに圧縮し、注意、フィードフォワード、状態空間ブロックへのスパース編集を通じて短距離コンテキスト信号を追加する。
145人の出自は15のアカウントがあり、165の独立した複製が投稿されたが、いずれも失敗した。
本研究では,モノカルチャーからコミュニティを駆逐した中途半端な人間の介入,トレースが確立していないこと,共有研究状態が計算単位当たりの発見を改善するか否かを判断する制御された比較について述べる。
関連論文リスト
- Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach [0.0]
大規模言語モデル(LLM)は、単一のオペレータではなく、多くのオペレータによって、共有インフラストラクチャに並行してデプロイされるようになっている。
これにより、シングルエージェントのセーフガードが逃避する集団レベルのリスクが生じる。
我々は,クロスラン相互情報推定,置換試験,分布シフト統計,タイミングとツールコール側チャネルを組み合わせたブラックボックスステガナリシス検出器を構築した。
論文 参考訳(メタデータ) (2026-08-03T13:00:25Z) - CUADebug: Diagnosing and Repairing Computer-Use Agent Failures [65.56066380320107]
コンピュータ利用エージェント(CUA)は、スクリーンショット、マウスとキーボードのアクション、ステートフルなUIフィードバックを通じて、実際のデスクトップとWebインターフェースを操作する。
テキストのみのエージェントとは異なり、CUAの失敗は、視覚知覚、接地、低レベル相互作用、タスク推論、環境ダイナミクスの複合から生じる。
CUA障害の診断と修復のためのフレームワークであるCUA Debugを紹介する。
論文 参考訳(メタデータ) (2026-07-31T13:59:45Z) - Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data [4.191965713559235]
コーディングエージェントは、スコアに対してソフトウェアを改善するために、単独で残すことができます。
このパターンでは、エージェントはデータセット、評価スクリプト、編集可能な1つのファイルを受け取り、監督なしで反復する。
このループを実際の生産タスクで実行し、ノイズの多い音声認識書面にどのクラニック詩が現れるかを決定しました。
論文 参考訳(メタデータ) (2026-07-20T15:32:09Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories [2.36052383261568]
ジェネレーティブAIコーディングエージェントが、オープンソースのサプライチェーンに参入している。
構成ファイルスキャン,コミットメッセージ解析,著者同一性マッチング,ボット署名検索を統合した多層検出フレームワークを提案する。
1つのメソッドがほんの少しのアクティビティをキャプチャすることはありません。
論文 参考訳(メタデータ) (2026-06-23T11:05:42Z) - Before the Pull Request: Mining Multi-Agent Coordination [0.0]
我々は、並行エージェントが共有作業に対して主張し、分割し、衝突する方法において、欠けている信号がPRの前に存在すると主張している。
我々はこのプロセスを,中央サーバを必要としないオープンソースのコーディネート基板であるgriteを通じて研究し,そのレコードをgit自体に格納する。
i) この共有基板は, 重複と矛盾する作業のオーバーヘッドを低減し, (ii) 各エージェントのログのコピーは, 書き込みを無音に落とさずに同じ状態に収束し, (iii) ログは, コンクリート破壊モードが自動的に回復可能な, 採掘可能な人工物であることを示す。
論文 参考訳(メタデータ) (2026-06-17T21:47:53Z) - Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study [4.512751676075442]
本稿では,統合フレームワークによる言語モデルに基づくVFC検出の包括的評価を行う。
コードの変更だけで、モデルが転送可能なセキュリティ関連コードを理解する証拠は見つからない。
グループ階層評価は、ランダムスプリットに比べて約17%のパフォーマンス低下を露呈する。
論文 参考訳(メタデータ) (2026-05-13T08:05:14Z) - GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives [48.545980031973556]
GAMBITは、インポスタ検出器を評価するための3つの評価モードと2つの独立したスコアを持つベンチマークである。
ベンチマークには、240の共進化型インポスタ戦略にまたがる27,804のラベル付きインスタンスのデータセットが付属している。
論文 参考訳(メタデータ) (2026-05-09T16:07:23Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。