論文の概要: The Hitchhiker's Guide to Monoculture
- arxiv url: http://arxiv.org/abs/2607.13077v1
- Date: Sun, 12 Jul 2026 21:01:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.521968
- Title: The Hitchhiker's Guide to Monoculture
- Title(参考訳): ヒッチハイカーのモノカルチャーガイド
- Abstract要約: 私は、2019年から2026年中頃のKaggleコンテストの応募書を使って、コードの均質化を調べます。
LLMと整合したランダムシード値42に対して,まず広範に収束した。
セマンティック・ホモジェナイゼーションの証拠はほとんど見つからない。
- 参考スコア(独自算出の注目度): 0.7614628596146601
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) often produce homogeneous outputs, raising concerns that AI coding assistants may lead to convergence in the software artifacts that developers create. Whether this occurs in practice is unclear because developers interactively prompt, evaluate, modify, and reject model outputs, and because outputs vary with prompt and repository context. I examine code homogenization using Kaggle contest submissions from 2019 to mid-2026. I first document widespread convergence toward the random seed value 42, consistent with LLMs reinforcing a longstanding convention in programming culture. I then study homogenization more broadly, at two levels of aggregation and abstraction. At the submission level, I measure the average pairwise similarity of submissions within contests. At the contest level, I measure the conceptual span of submitted code, motivating distinct measures for each: TF-IDF representations, which capture surface syntax, and Voyage 3 code embeddings, which capture code intent and semantics. The results demonstrate substantial syntactic homogenization at both the individual and collective levels: individual submissions have become more alike in literal syntax and code structure, while the latent dimensionality of syntactic variation has narrowed. In contrast, I find little evidence of semantic homogenization, individually and collectively. Average semantic distance remains essentially flat, and the contest-level latent dimensional span of semantic approaches remains stable, with evidence suggesting it has even expanded modestly. These findings suggest that AI coding assistants are certainly standardizing implementation details, yet they have not yet produced evidence of homogenization in the approaches and problem-solving strategies coders employ.
- Abstract(参考訳): 大規模言語モデル(LLM)は、しばしば均質な出力を生成し、AIコーディングアシスタントが開発者が生成するソフトウェアアーティファクトに収束する可能性があるという懸念を提起する。
開発者がインタラクティブにモデル出力をプロンプトし、評価し、修正し、拒否し、アウトプットがプロンプトとリポジトリコンテキストによって異なるため、実際にこれが起こっているかどうかは不明だ。
私は、2019年から2026年中頃のKaggleコンテストの応募書を使って、コードの均質化を調べます。
最初にランダムシード値42に対する広範囲の収束を文書化し、プログラミング文化における長年の慣習を補強するLLMと一致した。
次に、より広範にホモジェナイゼーションを、集約と抽象化の2つのレベルで研究します。
応募レベルでは、コンテストにおける応募のペア平均の類似度を測定します。
コンテストレベルでは,提案されたコードの概念的範囲を計測し,表層構文をキャプチャするTF-IDF表現と,コードインテントとセマンティクスをキャプチャするVoyage 3コード埋め込みという,それぞれに異なる測度を動機付ける。
その結果、個人と集団の双方において、実質的な構文的均質化が示され、個々の投稿はリテラル構文やコード構造においてより類似し、一方、構文的変動の潜在次元性は狭まりつつある。
対照的に、セマンティック・ホモジェナイゼーションの証拠はほとんど見つからない。
平均意味距離は基本的に平坦であり、競合レベルの潜在次元のセマンティックアプローチのスパンは安定であり、その証拠は緩やかに拡大したことを示している。
これらの結果は、AIコーディングアシスタントが実装の詳細を標準化していることを示唆している。
関連論文リスト
- Where Does Generative Difficulty Reside? An Empirical Study of Target Representations [62.54876287800644]
ターゲット表現は、イメージジェネレータが学ぶ必要がある分布を定義するが、しばしば交換可能なインターフェースとして扱われる。
マスク付き自己回帰整流モデルにおいて,生画素,SD-VAE潜伏剤,DINOv2,MAE表現-オートエンコーダの特徴について検討した。
その結果, 圧縮, 再構成忠実度, トークン次元, 可視的セマンティッククラスタリングは生成挙動を個別に予測できないことがわかった。
論文 参考訳(メタデータ) (2026-08-01T12:32:31Z) - CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment [15.634714514096487]
CLIPのような視覚言語モデルは、視覚的および意味論的に類似したカテゴリの体系的な分類に苦しむ。
そこで本研究では,モデルが自身のミスアライメントから学習することを可能にする,Confusion-Aware Prompt TuningフレームワークであるCAPTを提案する。
論文 参考訳(メタデータ) (2026-03-03T03:20:23Z) - Bidirectional Logits Tree: Pursuing Granularity Reconcilement in Fine-Grained Classification [89.20477310885731]
本稿では,粒度分類タスクにおけるグラニュラリティコンペティションの課題について述べる。
既存のアプローチは通常、共通のベースエンコーダから抽出された共有特徴に基づいて、独立した階層認識モデルを開発する。
グラニュラリティ再構成のための双方向ロジットツリー(BiLT)と呼ばれる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-17T10:42:19Z) - Localizing Factual Inconsistencies in Attributable Text Generation [74.11403803488643]
本稿では,帰属可能なテキスト生成における事実の不整合をローカライズするための新しい形式であるQASemConsistencyを紹介する。
QASemConsistencyは、人間の判断とよく相関する事実整合性スコアを得られることを示す。
論文 参考訳(メタデータ) (2024-10-09T22:53:48Z) - Towards Unsupervised Recognition of Token-level Semantic Differences in
Related Documents [61.63208012250885]
意味的差異をトークンレベルの回帰タスクとして認識する。
マスク付き言語モデルに依存する3つの教師なしアプローチについて検討する。
その結果,単語アライメントと文レベルのコントラスト学習に基づくアプローチは,ゴールドラベルと強い相関関係があることが示唆された。
論文 参考訳(メタデータ) (2023-05-22T17:58:04Z) - Multifactor Sequential Disentanglement via Structured Koopman
Autoencoders [2.7759072740347017]
複数の意味的不整合成分が生成される多要素不整合について考察する。
我々のアプローチの鍵は強い帰納バイアスであり、そこでは基礎となる力学が潜在空間において線形に表現できると仮定する。
本稿では,完全教師なしで多要素不整合をサポートする,単純で簡単な新しい深層モデルを提案する。
論文 参考訳(メタデータ) (2023-03-30T10:01:58Z) - Generate, Discriminate and Contrast: A Semi-Supervised Sentence
Representation Learning Framework [68.04940365847543]
本稿では,大規模未ラベルデータを効果的に活用する半教師付き文埋め込みフレームワークGenSEを提案する。
1) 生成: 生成: 生成/識別器モデルはオープンドメインの未ラベルコーパスから文ペアを合成するために共同で訓練される; 2) 識別: ノイズのある文ペアは識別器によってフィルタリングされ、高品質な正と負の文ペアを取得する; 3) コントラスト: 注釈付きデータと合成されたデータの両方を用いて文表現を学習するために、プロンプトベースのコントラクティブアプローチが提示される。
論文 参考訳(メタデータ) (2022-10-30T10:15:21Z) - Evaluation of Semantic Answer Similarity Metrics [0.0]
そこで本稿では,アメリカとアメリカのパブリックな人物の名前対からなる新しいデータセットをトレーニングした,意味応答類似性のためのクロスエンコーダ拡張バイエンコーダとBERTScoreモデルを提案する。
共参照型文字列ペアの最初のデータセットとその類似性について,トレーニングに使用可能なデータセットを提供する。
論文 参考訳(メタデータ) (2022-06-25T14:40:36Z) - Unsupervised Mismatch Localization in Cross-Modal Sequential Data [5.932046800902776]
我々は、コンテンツミスマッチしたクロスモーダルデータ間の関係を推測できる教師なし学習アルゴリズムを開発した。
本稿では,音声生成過程を階層的に構造化された潜在変数に分解する,ミスマッチ局所化変分自動符号化(ML-VAE)という階層型ベイズディープラーニングモデルを提案する。
実験の結果,ML-VAEは人間のアノテーションを必要とせず,テキストと音声のミスマッチの特定に成功した。
論文 参考訳(メタデータ) (2022-05-05T14:23:27Z) - Contextualized Semantic Distance between Highly Overlapped Texts [85.1541170468617]
テキスト編集や意味的類似性評価といった自然言語処理タスクにおいて、ペア化されたテキストに重複が頻繁に発生する。
本稿では,マスク・アンド・予測戦略を用いてこの問題に対処することを目的とする。
本稿では,最も長い単語列の単語を隣接する単語とみなし,その位置の分布を予測するためにマスク付き言語モデリング(MLM)を用いる。
セマンティックテキスト類似性の実験では、NDDは様々な意味的差異、特に高い重なり合うペアテキストに対してより敏感であることが示されている。
論文 参考訳(メタデータ) (2021-10-04T03:59:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。