論文の概要: Where are the Hidden Gems? Applying Transformer Models for Design Discussion Detection
- arxiv url: http://arxiv.org/abs/2603.18393v1
- Date: Thu, 19 Mar 2026 01:27:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:05.90481
- Title: Where are the Hidden Gems? Applying Transformer Models for Design Discussion Detection
- Title(参考訳): 隠れたジェムはどこにあるのか? デザイン検証検出のためのトランスフォーマーモデルの適用
- Authors: Lawrence Arkoh, Daniel Feitosa, Wesley K. G. Assunção,
- Abstract要約: 設計決定はソフトウェアエンジニアリングの中核であり、Q&Aフォーラム、メーリングリスト、プルリクエスト、イシュー、コミットメッセージに現れる。
設計関連議論を検出するためのトランスフォーマーモデルの性能について検討する。
BERTとRoBERTaはドメイン間で強いリコールを示し、XLNetは高い精度でリコールを行う。
一方、LaMini-Flan-T5-77Mはより高精度でバランスの取れない軽量な代替品を提供する。
- 参考スコア(独自算出の注目度): 5.188300933354376
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Design decisions are at the core of software engineering and appear in Q\&A forums, mailing lists, pull requests, issue trackers, and commit messages. Design discussions spanning a project's history provide valuable information for informed decision-making, such as refactoring and software modernization. Machine learning techniques have been used to detect design decisions in natural language discussions; however, their effectiveness is limited by the scarcity of labeled data and the high cost of annotation. Prior work adopted cross-domain strategies with traditional classifiers, training on one domain and testing on another. Despite their success, transformer-based models, which often outperform traditional methods, remain largely unexplored in this setting. The goal of this work is to investigate the performance of transformer-based models (i.e., BERT, RoBERTa, XLNet, LaMini-Flan-T5-77M, and ChatGPT-4o-mini) for detecting design-related discussions. To this end, we conduct a conceptual replication of prior cross-domain studies while extending them with modern transformer architectures and addressing methodological issues in earlier work. The models were fine-tuned on Stack Overflow and evaluated on GitHub artifacts (i.e., pull requests, issues, and commits). BERT and RoBERTa show strong recall across domains, while XLNet achieves higher precision but lower recall. ChatGPT-4o-mini yields the highest recall and competitive overall performance, whereas LaMini-Flan-T5-77M provides a lightweight alternative with stronger precision but less balanced performance. We also evaluated similar-word injection for data augmentation, but unlike prior findings, it did not yield meaningful improvements. Overall, these results highlight both the opportunities and trade-offs of using modern language models for detecting design discussion.
- Abstract(参考訳): 設計決定はソフトウェアエンジニアリングの中核であり、Q\&Aフォーラム、メーリングリスト、プルリクエスト、イシュートラッカ、コミットメッセージに表示される。
プロジェクトの歴史にまたがる設計上の議論は、リファクタリングやソフトウェア近代化といった情報的意思決定に貴重な情報を提供する。
機械学習技術は、自然言語の議論において設計決定を検出するために使われてきたが、ラベル付きデータの不足とアノテーションの高コストによって、その効果は制限されている。
以前の作業では、従来の分類器を使ったクロスドメイン戦略を採用し、ひとつのドメインでトレーニングし、別のドメインでテストした。
彼らの成功にもかかわらず、トランスフォーマーベースのモデルは、しばしば伝統的な手法より優れているが、この設定では、ほとんど探索されていない。
本研究の目的は、設計に関する議論を検出するためのトランスフォーマーモデル(BERT、RoBERTa、XLNet、LaMini-Flan-T5-77M、ChatGPT-4o-mini)の性能を調べることである。
そこで本研究では,従来のクロスドメイン研究の概念的複製を行い,それらを近代的なトランスフォーマーアーキテクチャで拡張し,先行研究における方法論的問題に対処する。
モデルはStack Overflowで微調整され、GitHubアーティファクト(プルリクエスト、イシュー、コミットなど)で評価された。
BERTとRoBERTaはドメイン間で強いリコールを示し、XLNetは高い精度でリコールを行う。
一方、LaMini-Flan-T5-77Mはより高精度でバランスの取れない軽量な代替品を提供する。
また,データ拡張のための類似語注入も検討したが,従来と異なり有意な改善は得られなかった。
全体として、これらの結果は、設計議論を検出するためにモダン言語モデルを使用することの機会とトレードオフの両方を強調している。
関連論文リスト
- Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Stanceformer: Target-Aware Transformer for Stance Detection [59.69858080492586]
スタンス検出は、テキストで表現されたスタンスを特定の主題やターゲットに向けて識別する。
以前の作業は、ターゲットを効果的に優先順位付けする能力に欠ける既存のトランスフォーマーモデルに依存していた。
本稿では,学習と推論の両方において,目標に対する注意を高めるターゲット対応トランスフォーマーモデルであるStanceformerを紹介する。
論文 参考訳(メタデータ) (2024-10-09T17:24:28Z) - Pre-Trained Model Recommendation for Downstream Fine-tuning [22.343011779348682]
モデル選択は、市販の事前訓練されたモデルをランク付けし、新しいターゲットタスクに最も適したモデルを選択することを目的としている。
既存のモデル選択テクニックはスコープ内で制約されることが多く、モデルとタスク間の微妙な関係を見落としてしまう傾向があります。
我々は,多種多様な大規模モデルリポジトリを探索する実用的フレームワーク textbfFennec を提案する。
論文 参考訳(メタデータ) (2024-03-11T02:24:32Z) - A Multi-dimensional Evaluation of Tokenizer-free Multilingual Pretrained
Models [87.7086269902562]
サブワードベースのモデルは、多くの設定において依然として最も実用的な選択肢であることを示している。
我々は,新しいモデルを設計し,評価する際のこれらの要因を検討するために,トークンフリーな手法の今後の取り組みを奨励する。
論文 参考訳(メタデータ) (2022-10-13T15:47:09Z) - Transformer Models for Text Coherence Assessment [14.132559978971377]
コヒーレンス(coherence)は、テキストの品質の重要な側面であり、その可読性を保証するために不可欠である。
これまでの研究は、エンティティベースの手法、構文パターン、談話関係、最近ではテキストコヒーレンスアセスメントのための従来のディープラーニングアーキテクチャを活用してきた。
バニラ変換器,階層変換器,マルチタスク学習モデル,ファクトベース入力表現モデルという4つの異なるトランスフォーマーアーキテクチャを提案する。
論文 参考訳(メタデータ) (2021-09-05T22:27:17Z) - When Liebig's Barrel Meets Facial Landmark Detection: A Practical Model [87.25037167380522]
正確で、堅牢で、効率的で、一般化可能で、エンドツーエンドのトレーニングが可能なモデルを提案する。
精度を向上させるために,2つの軽量モジュールを提案する。
DQInitは、インプットからデコーダのクエリを動的に初期化し、複数のデコーダ層を持つものと同じ精度でモデルを実現する。
QAMemは、共有するクエリではなく、それぞれのクエリに別々のメモリ値を割り当てることで、低解像度のフィーチャーマップ上のクエリの識別能力を高めるように設計されている。
論文 参考訳(メタデータ) (2021-05-27T13:51:42Z) - Disfluency Detection with Unlabeled Data and Small BERT Models [3.04133054437883]
本稿では,BERTアーキテクチャに基づく小型・高速・オンデバイスモデルに焦点をあてて,ディフルエンシ検出タスクに着目する。
性能を保ちながら1.3 MiB程度の拡散検出モデルを訓練できることを実証する。
論文 参考訳(メタデータ) (2021-04-21T21:24:32Z) - Autofocused oracles for model-based design [8.22379888383833]
非ゼロサムゲームとしてデータ駆動設計問題を定式化する。
設計アルゴリズムが進むにつれて回帰モデルを再訓練するための原則的戦略を開発する。
論文 参考訳(メタデータ) (2020-06-14T23:22:50Z) - End-to-End Object Detection with Transformers [88.06357745922716]
本稿では,オブジェクト検出を直接セット予測問題とみなす新しい手法を提案する。
我々のアプローチは検出パイプラインを合理化し、手作業で設計された多くのコンポーネントの必要性を効果的に除去する。
この新しいフレームワークの主な構成要素は、Detection TRansformerまたはDETRと呼ばれ、セットベースのグローバルな損失である。
論文 参考訳(メタデータ) (2020-05-26T17:06:38Z) - Stress Test Evaluation of Transformer-based Models in Natural Language
Understanding Tasks [3.2442879131520126]
本研究は,自然言語推論(NLI)と質問応答(QA)における3つのトランスフォーマーモデル(RoBERTa,XLNet,BERT)を評価する。
実験の結果,RoBERTa,XLNet,BERTはニューラルネットモデルよりも堅牢であり,NLIタスクとQAタスクの両方のストレステストが可能であることがわかった。
論文 参考訳(メタデータ) (2020-02-14T21:52:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。