論文の概要: A Global Author-Identity Map for the World of Code:62.7M Developer Identities from 106.8M Author Strings over 5.87B Commits
- arxiv url: http://arxiv.org/abs/2607.06183v1
- Date: Tue, 07 Jul 2026 12:09:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.507624
- Title: A Global Author-Identity Map for the World of Code:62.7M Developer Identities from 106.8M Author Strings over 5.87B Commits
- Title(参考訳): コードの世界におけるグローバルなオーサリング・アイデンティティマップ:62.7M Developer Identities from 106.8M Author Strings over 5.87B Commits
- Abstract要約: We release a curated author-identity map for World of Code (WoC) version V2604 cover all 5,866,595,698 commits。
マップはメガクラスタフリーで、最大のクラスタ6,910 id(1つのGitHubノプリーID)であり、60億のコミットの73.5%をマルチIDに解決している。
我々は, 誤差ファミリー, 分割, クランプの双方を報告し, グローバル・スケール・ユニオン・マップが主張する高精度の精度が, 膨らんだ領域を決して計測しない人工物であることを示す。
- 参考スコア(独自算出の注目度): 2.788646205877688
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mining software repositories at global scale founders on author identity: the same developer commits under many name/email strings, and the same string is reused by many developers. We release a curated author-identity map for World of Code (WoC) version V2604, covering all 5,866,595,698 commits. It ships four co-versioned artifacts: a global alias map (a2AFullSUG) folding 106,826,059 raw author/committer strings into canonical identities; a per-identity classification (A2clsFull) tagging each id good, bad-by-attribute, local, bot, or partial; a within-project table (P2aAFull) recovering low-quality ids inside the one project where their reuse is unambiguous; and a commit-to-identity table (c2AFull) tagging every commit with its resolution provenance. The map is mega-cluster free, its largest cluster 6,910 ids (one GitHub noreply identity), and it resolves 73.5% of six billion commits into multi-id identities, raising human-id commit coverage to 98.17%. The design problem is clumping, not recall: a naive transitive union over shared-attribute edges welds three million unrelated people into one cluster, an over-merge that recall-only benchmarks price at zero. We report both error families, splitting and clumping, and show the high precision claimed by global-scale union maps can be an artifact of never measuring the conflated region. Against the ALFAA human-rated gold set the map scores recall 0.70 / precision 0.88, where the prior WoC map's apparent 0.95 precision collapses to 0.52 once its 3,006,318-id mega-cluster is counted. A canonical software-author identity is also a cross-corpus join key to scholarly author graphs, where clumping is again the binding constraint. All artifacts ship with the WoC V2604 release and a self-contained replication package.
- Abstract(参考訳): グローバルスケールでソフトウェアリポジトリをマイニングする 著者のアイデンティティ - 同じ開発者が多くの名前/メール文字列の下でコミットし、同じ文字列は多くの開発者が再利用している。
We release a curated author-identity map for World of Code (WoC) version V2604, including all five866,595,698 commits。
グローバルエイリアスマップ (a2AFullSUG) 折りたたみ106,826,059 の生の作者/コミッタ文字列を標準のIDに分解する、ID毎にタグ付けする(A2clsFull)、各IDが良い、悪い、悪い、貢献する、ローカル、ボット、または部分的なタグ付けする(P2aAFull)、再利用が不明瞭なプロジェクト内の低品質のIDを回収する(P2aAFull)、コミット対同一性テーブル (c2AFull) の4つの共変換アーティファクトを提供する。
マップはメガクラスタフリーで、最大のクラスタ6,910 id(1つのGitHubノプリーID)で、60億のコミットの73.5%をマルチIDに解決し、ヒューマンIDのコミットカバレッジを98.17%に引き上げている。
シェア・アトリビュート・エッジをめぐる過激な過渡的連合は、300万人の無関係な人々を1つのクラスタに溶接する。
我々は, 誤差ファミリー, 分割, クランプの双方を報告し, グローバル・スケール・ユニオン・マップが主張する高精度の精度が, 膨らんだ領域を決して計測しない人工物であることを示す。
ALFAAの人間格付け金に対して、地図は0.70/精度0.88をリコールし、3,006,318-idのメガクラスタが数えられると、以前のWoCマップの精度0.95の精度は0.52に崩壊する。
正規のソフトウェアオーサライザIDは、学術的なグラフ作成のためのクロスコーパスジョインキーでもあり、クランプは再びバインディング制約となる。
全てのアーティファクトには、WoC V2604リリースと自己完結した複製パッケージが付属している。
関連論文リスト
- WithEveryone: Unified Planning and Identity Grounding for Group Image Generation [60.528070962852716]
グループイメージを最大10個の参照IDまで生成する統合フレームワークであるWithEveryoneを紹介した。
WithEveryoneは、それぞれの選択したIDをアドレストークンとして注入し、構造化されたID計画を予測する。
GPT-Image-2では0.462から0.499に改善され、コピー・ペースト・アーティファクトは0.169から0.055に削減された。
論文 参考訳(メタデータ) (2026-08-20T17:59:53Z) - Why Git Is the Memory Solution for the Agentic Development Lifecycle [0.0]
私たちは、メモリはgitバウンドで、リポジトリのバージョン管理に組み込まれるべきであると考えています。
この台帳では、2つの問題を別々に解決し、それらを組み合わせます。
ルータは、git-anchored構造図に幅を広げ、信頼されたエピソードにルックアップを向け、意思決定の合理化を行う。
論文 参考訳(メタデータ) (2026-07-15T22:06:59Z) - More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning [54.65906330923846]
対象中心のスロット表現は、事前学習された視覚モデルに代わる構造化された代替物であることを示す。
トークンの16倍の高密度なパッチグリッドは、グローバル機能に匹敵するパフォーマンスはない。
明示的な2D空間目標とネイティブ解像度レンダリングにより、全システムは68.7$pm$4.2%まで上昇し、特権付き3Dオーラクルの上界の直ぐ下にある。
論文 参考訳(メタデータ) (2026-07-10T10:35:24Z) - Scaling Author Identity Disambiguation to the World of Code: A Methodology [2.788646205877688]
本稿では,WoC (World of Code) コレクション(バージョン V2604, バージョン V2604, 6B コミット上の 107M の異なる著者文字列)を標準人物にエイリアスするための方法論について述べる。
このスケールでは、中心的な問題はマージの過大さであり、マージの欠落ではない。
デプロイされた設計の背後にある完全な実験記録(失敗を含む20以上の実験を含む)を報告する。
論文 参考訳(メタデータ) (2026-07-08T02:30:26Z) - Claimed or Attested? A Commit-Signature Dataset and Identity Trust Tiers across the World of Code [2.788646205877688]
We release the first commit-signature axis for the World of Code (WoC)
V2604コーパスの5,866,595,698コミットのうち、17.59%が署名を持っている。
全てのアーティファクトは、WoC V2604コレクションにキーされた、自己完結した、依存的にホストされた複製パッケージとしてリリースされる。
論文 参考訳(メタデータ) (2026-07-07T12:19:25Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Deforking the World of Code: A Project-Provenance Map that Recovers Cross-Forge Fork Families that Platform Graphs Cannot See [2.788646205877688]
We release a curated deforking map for the World of Code (WoC) version V2604: p2PFull。
すべての生のレポジトリ p を、その属する除かれたプロジェクト P に分解する。
GH ForkEventsから再構築されたGitHubの宣言されたフォークグラフに対するマップを検証する。
論文 参考訳(メタデータ) (2026-06-28T18:25:17Z) - Fractional Verkle Trees: A Hypertree Decomposition and Verified Proof Serialization Architecture for High-Performance Blockchain State Accumulators [0.0]
We present Fractional Verkle Trees (FVT), a hypertree serialization decomposition global state into N independent sub-accumulator coordinateed by a Merkle commitment tree。
Apple M1 Proのベンチマークでは、ヒープ割り当ての57%(566,760から242,004バイト/10K$)、並列挿入は2,433 ns/op、ネットワーク全体では6000のフルノードで1年4.85PBである。
論文 参考訳(メタデータ) (2026-06-15T07:16:07Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - WorldDB: A Vector Graph-of-Worlds Memory Engine with Ontology-Aware Write-Time Reconciliation [0.0]
WorldDBは3つのコミットメントに基づいて構築されたメモリエンジンである。 (i) 各ノードは世界であり、 (ii) ノードはコンテンツに適応し不変であり、 (iii) エッジは書き込み時プログラムである。
LongMemEval-s (500の質問、115kの会話スタック)では、応答子としてClaude Opus 4.7とWorldDBが96.40%、タスク平均精度97.11%を達成した。
論文 参考訳(メタデータ) (2026-04-20T16:30:53Z) - NearID: Identity Representation Learning via Near-identity Distractors [116.71529576796605]
既存のビジョンエンコーダは、オブジェクトのアイデンティティを背景コンテキストと絡み合わせることで、信頼性の低い表現やメトリクスを生み出します。
我々は、この脆弱性に対処するための最初の原則付きフレームワークをNear-identity distractorsを使って紹介する。
我々は、厳密なマージンベースの評価プロトコルとともに、NearIDデータセット(19KのID、316Kの一致したコンテキストインタプリタ)を提示する。
論文 参考訳(メタデータ) (2026-04-02T12:33:14Z) - GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving [55.14836667214487]
GeoFocusは、2つのコアモジュールからなる新しいフレームワークである。
GeoFocusは、主要な特殊モデルよりも4.7%の精度向上を実現している。
多様な視覚条件下でのMATHVERSEの強靭性を示す。
論文 参考訳(メタデータ) (2026-02-09T11:15:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。