論文の概要: Agora: Git as Shared Memory for Collective AutoResearch
- arxiv url: http://arxiv.org/abs/2609.18094v2
- Date: Fri, 18 Sep 2026 19:37:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.920979
- Title: Agora: Git as Shared Memory for Collective AutoResearch
- Title(参考訳): Agora: 集合的自動検索のための共有メモリとしてのGit
- Abstract要約: 別々のセッションで作業する調査エージェントは、他の人が試したことと、構築可能な結果を知る必要がある。
各コミットは結果、洞察、仮説、検証、報告を記録し、それを以前の作業とリンクする。
約12日間に渡り,13人の言語モデル労働者がアゴラを重み移動問題の解決に利用したことを報告した。
- 参考スコア(独自算出の注目度): 54.31992252587096
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Research agents working in separate sessions need to know what others have tried and which results they can build on. Agora stores their contributions as an append-only directed acyclic graph (DAG) in Git. Each commit records a result, insight, hypothesis, verification, or report and links it to prior work. Searchable views show leading results, neglected branches, and verification status; diversity-aware recommendations suggest experiments beyond the current leaders. We report a run of nearly 12 days in which 13 language-model workers, with no assigned tasks or central planner, used Agora to solve a weight-transfer problem. Given 141 pretrained donor models and a frozen 119.6M-parameter attention-SSM hybrid whose dimensions match no donor, the workers had to initialize the target without training data or gradient updates. They published 1,703 contributions and reduced the development evaluator score from 3.39 to 1.899 bits per byte, closing 62% of the gap to a trained GPT-2 124M. The best method compresses donor next-token statistics into the target's embedding and output head, then adds short-range context through sparse edits to attention, feed-forward, and state-space blocks. Its 145-commit ancestry spans 15 accounts. Participants also posted 165 independent reproductions across 95 targets, with no reported failures. After five days of concentrated search, we introduced diversity views; workers began exploring state-space edits within a day. The run documents how agents reused and verified shared work. Measuring the effect on discovery per unit of compute requires a matched comparison.
- Abstract(参考訳): 別々のセッションで作業する調査エージェントは、他の人が試したことと、構築可能な結果を知る必要がある。
Agoraは、そのコントリビューションをGitに、追加のみの非循環グラフ(DAG)として格納する。
各コミットは結果、洞察、仮説、検証、報告を記録し、それを以前の作業とリンクする。
検索可能なビューは、主要な結果、無視されたブランチ、検証ステータスを示し、多様性を意識したレコメンデーションは、現在のリーダを越えて実験を推奨する。
約12日間に渡り,13人の言語モデル労働者がアゴラを重み移動問題の解決に利用したことを報告した。
141の事前訓練ドナーモデルと119.6Mパラメーター・アテンション-SSMハイブリッドがドナーと一致しないため、労働者は訓練データや勾配更新なしで目標を初期化しなければならなかった。
彼らは1,703のコントリビューションを発表し、開発評価のスコアを3.39ビットから1.899ビットに下げ、ギャップの62%をGPT-2 124Mに短縮した。
最良の方法は、ドナーの次点統計データをターゲットの埋め込みおよび出力ヘッドに圧縮し、注意、フィードフォワード、状態空間ブロックへのスパース編集を通じて短距離コンテキストを追加する。
145人の出自は15のアカウントがある。
参加者は95の目標に対して165個の独立した複製を投稿したが、失敗は報告されなかった。
5日間の集中検索の後、ダイバーシティビューを導入し、労働者は1日以内に国家空間の編集を探求し始めた。
この実行では、エージェントが共有作業の再利用と検証を行う方法が文書化されている。
計算単位当たりの発見への影響を測定するには、一致した比較が必要である。
関連論文リスト
- Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach [0.0]
大規模言語モデル(LLM)は、単一のオペレータではなく、多くのオペレータによって、共有インフラストラクチャに並行してデプロイされるようになっている。
これにより、シングルエージェントのセーフガードが逃避する集団レベルのリスクが生じる。
我々は,クロスラン相互情報推定,置換試験,分布シフト統計,タイミングとツールコール側チャネルを組み合わせたブラックボックスステガナリシス検出器を構築した。
論文 参考訳(メタデータ) (2026-08-03T13:00:25Z) - CUADebug: Diagnosing and Repairing Computer-Use Agent Failures [65.56066380320107]
コンピュータ利用エージェント(CUA)は、スクリーンショット、マウスとキーボードのアクション、ステートフルなUIフィードバックを通じて、実際のデスクトップとWebインターフェースを操作する。
テキストのみのエージェントとは異なり、CUAの失敗は、視覚知覚、接地、低レベル相互作用、タスク推論、環境ダイナミクスの複合から生じる。
CUA障害の診断と修復のためのフレームワークであるCUA Debugを紹介する。
論文 参考訳(メタデータ) (2026-07-31T13:59:45Z) - Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data [4.191965713559235]
コーディングエージェントは、スコアに対してソフトウェアを改善するために、単独で残すことができます。
このパターンでは、エージェントはデータセット、評価スクリプト、編集可能な1つのファイルを受け取り、監督なしで反復する。
このループを実際の生産タスクで実行し、ノイズの多い音声認識書面にどのクラニック詩が現れるかを決定しました。
論文 参考訳(メタデータ) (2026-07-20T15:32:09Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories [2.36052383261568]
ジェネレーティブAIコーディングエージェントが、オープンソースのサプライチェーンに参入している。
構成ファイルスキャン,コミットメッセージ解析,著者同一性マッチング,ボット署名検索を統合した多層検出フレームワークを提案する。
1つのメソッドがほんの少しのアクティビティをキャプチャすることはありません。
論文 参考訳(メタデータ) (2026-06-23T11:05:42Z) - Before the Pull Request: Mining Multi-Agent Coordination [0.0]
我々は、並行エージェントが共有作業に対して主張し、分割し、衝突する方法において、欠けている信号がPRの前に存在すると主張している。
我々はこのプロセスを,中央サーバを必要としないオープンソースのコーディネート基板であるgriteを通じて研究し,そのレコードをgit自体に格納する。
i) この共有基板は, 重複と矛盾する作業のオーバーヘッドを低減し, (ii) 各エージェントのログのコピーは, 書き込みを無音に落とさずに同じ状態に収束し, (iii) ログは, コンクリート破壊モードが自動的に回復可能な, 採掘可能な人工物であることを示す。
論文 参考訳(メタデータ) (2026-06-17T21:47:53Z) - Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study [4.512751676075442]
本稿では,統合フレームワークによる言語モデルに基づくVFC検出の包括的評価を行う。
コードの変更だけで、モデルが転送可能なセキュリティ関連コードを理解する証拠は見つからない。
グループ階層評価は、ランダムスプリットに比べて約17%のパフォーマンス低下を露呈する。
論文 参考訳(メタデータ) (2026-05-13T08:05:14Z) - GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives [48.545980031973556]
GAMBITは、インポスタ検出器を評価するための3つの評価モードと2つの独立したスコアを持つベンチマークである。
ベンチマークには、240の共進化型インポスタ戦略にまたがる27,804のラベル付きインスタンスのデータセットが付属している。
論文 参考訳(メタデータ) (2026-05-09T16:07:23Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。