論文の概要: SemChunk-C: Semantic Segmentation for C Code
- arxiv url: http://arxiv.org/abs/2606.23697v1
- Date: Tue, 12 May 2026 09:52:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.930556
- Title: SemChunk-C: Semantic Segmentation for C Code
- Title(参考訳): SemChunk-C: Cコードのセマンティックセグメンテーション
- Abstract要約: 本稿では,C関連ファイルのセマンティックチャンキングのための軽量言語モデルであるSem-Chunkを紹介する。
これらのモデルは、17M、32M、68M、150Mパラメータを持つ最初の4つのEttinエンコーダに基づいている。
ネストされた定義やマクロといった難解な構造を含む実世界のコードに対するアプローチの堅牢性を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Semantic segmentation of code written in a C-family language remains a challenging problem, due to the language's complex syntax, macro expansion, and irregular structural patterns. Existing chunking methods, such as fixed-sized windows, heuristic splitting, and syntax-based tools, often fail to capture meaningful functional units, limiting the efficacy of retrieval and other downstream LLM driven tasks. In this paper, we address the problem of chunking in C-related languages. First, we define a set of code chunk categories. Second, we train an LLM-based classifier to a) identify chunk boundaries, and b) assign each chunk a descriptive functional attribute (a category), which can be useful for downstream tasks. By leveraging the LLM's ability to capture semantic context within the code, we assume flexible chunk boundaries, allowing to adapt to the specific structure and context of each instance. Third, we introduce SemChunk-C, a family of lightweight language models for semantic chunking of C-related files (.c, .cpp, .h, .cs, etc.). These models are based on the first four Ettin encoders [1] with 17M, 32M, 68M, and 150M parameters. Despite their relatively small size, they are capable of identifying cohesive code units, such as data structures, interface blocks, and other components. Furthermore, we demonstrate the robustness of our approach on real-world code, including challenging constructs such as nested definitions and macros. We test our approach on various datasets, and show that it achieves high boundary accuracy and semantic coherence, matching or outperforming chunkers that are based on much larger code-oriented LLMs. We also validate the improved performance of the downstream tasks on a few curated benchmarks.
- Abstract(参考訳): C言語で書かれたコードのセマンティックセグメンテーションは、複雑な構文、マクロ展開、不規則な構造パターンのため、依然として難しい問題である。
固定サイズのウィンドウやヒューリスティックスプリッティング、構文ベースのツールといった既存のチャンキング手法は、しばしば意味のある機能単位の取得に失敗し、検索やその他の下流のLLM駆動タスクの有効性を制限している。
本稿では,C言語におけるチャンキングの問題に対処する。
まず、コードチャンクカテゴリのセットを定義します。
次に LLM ベースの分類器を訓練する。
a) チャンクの境界を識別し、
b) 各チャンクに記述的機能属性(カテゴリ)を割り当て、下流タスクに役立ちます。
コード内のセマンティックコンテキストをキャプチャするLLMの機能を活用することで、フレキシブルなチャンク境界を前提とすることで、各インスタンスの特定の構造とコンテキストに適応することが可能になります。
第3に、C関連ファイル(.c, .cpp, .h, .csなど)のセマンティックチャンキングのための軽量言語モデルであるSemChunk-Cを紹介する。
これらのモデルは、17M, 32M, 68M, 150Mパラメータを持つ最初の4つのEttinエンコーダ[1]に基づいている。
サイズは比較的小さいが、データ構造、インターフェイスブロック、その他のコンポーネントなどの凝集性のあるコードユニットを識別できる。
さらに,ネストした定義やマクロといった難解な構造を含む実世界のコードに対するアプローチの堅牢性を示す。
提案手法を様々なデータセットで検証し,より大規模なコード指向LLMをベースとした,境界精度とセマンティックコヒーレンス,マッチング,あるいは優れたチャンカーを実現することを示す。
また、いくつかのベンチマークによるダウンストリームタスクの性能改善も検証した。
関連論文リスト
- RuC: HDL-Agnostic Rule Completion Benchmark Generation [1.8927558216457558]
大規模言語モデル(LLM)は、コード関連のタスク間で急速にパフォーマンスが向上している。
言語に依存しないルール補完(RuC)のためのフレームワークを提案する。
RuCは、入力ハードウェア記述ソースのセットからRTLコード補完タスクを生成する。
論文 参考訳(メタデータ) (2026-04-30T12:19:40Z) - CLARC: C/C++ Benchmark for Robust Code Search [2.225731679677886]
現実のGitHubリポジトリから構築されたC/C++ベンチマークであるCLARCを紹介します。
Clarcには、評価用の1,245のクエリコードペアと、トレーニング用の5,472のペアが含まれている。
論文 参考訳(メタデータ) (2026-03-04T18:57:37Z) - Completion by Comprehension: Guiding Code Generation with Multi-Granularity Understanding [37.78627994991325]
CoCoは、大規模なコードリポジトリから複数の粒度コンテキストでコード補完を可能にする新しいフレームワークである。
CrossCodeEvalとRepoEvalベンチマークの実験は、CoCoが最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-04T07:37:59Z) - On Code-Induced Reasoning in LLMs [21.875805779552564]
並列命令データセットを10のプログラミング言語で構築する。
コードの構造的・意味的特性を選択的に破壊する制御摂動を適用する。
以上の結果から,LLMは意味論的よりも構造的摂動に弱いことが示唆された。
論文 参考訳(メタデータ) (2025-09-25T19:57:36Z) - Efficiently Disentangling CLIP for Multi-Object Perception [62.523137132812764]
CLIPのような視覚言語モデルは、シーン内の1つの顕著なオブジェクトを認識するのに優れていますが、複数のオブジェクトを含む複雑なシーンで苦労しています。
凍結したVLMに最小限の学習可能なパラメータのみを追加しながら、最適な相互情報のレベルを学習する効率的なフレームワークであるDCLIPを提案する。
論文 参考訳(メタデータ) (2025-02-05T08:20:31Z) - What can Large Language Models Capture about Code Functional Equivalence? [24.178831487657945]
SeqCoBenchは、コード-LLMがコード関数同値をキャプチャする方法を評価するベンチマークである。
我々は,SeqCoBenchにおける意味論的に等価なプログラムと異なるプログラムのペアを識別できるかどうかを,最先端(Code)-LLMで評価する。
論文 参考訳(メタデータ) (2024-08-20T11:19:06Z) - African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification [53.89380284760555]
textttFOCI (textbfFine-fine textbfObject textbfClasstextbfIfication) は、きめ細かいオブジェクト分類のための難しい多重選択ベンチマークである。
textttFOCIxspaceは、ImageNet-21kから4つのドメイン固有のサブセットで5つの一般的な分類データセットを補完する。
論文 参考訳(メタデータ) (2024-06-20T16:59:39Z) - Leveraging Code to Improve In-context Learning for Semantic Parsing [48.66031267718704]
In-context Learning (ICL) は、その少数ショットの性質と一般化の改善により、意味解析に魅力的なアプローチである。
我々は,(1)DSLの代わりにPythonなどの汎用プログラミング言語を用いた意味解析におけるICLの有効性を向上し,(2)ドメイン記述を構造化したプロンプトを増強する。
論文 参考訳(メタデータ) (2023-11-16T02:50:06Z) - Waffling around for Performance: Visual Classification with Random Words
and Broad Concepts [121.60918966567657]
WaffleCLIPはゼロショット視覚分類のためのフレームワークで、LLM生成した記述子をランダムな文字と単語記述子に置き換える。
LLM生成記述子で導入された追加意味論の影響と欠点について、広範囲にわたる実験的研究を行う。
論文 参考訳(メタデータ) (2023-06-12T17:59:48Z) - LLM-Pruner: On the Structural Pruning of Large Language Models [65.02607075556742]
大規模言語モデル(LLM)は、言語理解と生成において顕著な能力を示している。
タスク非依存であり、元のトレーニングデータセットへの依存を最小限に抑えるという2つの制約の範囲内でLLMの圧縮に取り組む。
LLM-Prunerという名前のこの手法は、非臨界結合構造を選択的に除去する構造プルーニングを採用する。
論文 参考訳(メタデータ) (2023-05-19T12:10:53Z) - CodeT5+: Open Code Large Language Models for Code Understanding and
Generation [72.1638273937025]
大きな言語モデル (LLM) は膨大なソースコードで事前訓練されており、コードインテリジェンスにおいて顕著な進歩を遂げている。
CodeT5+は、コンポーネントモジュールを柔軟に組み合わせて、幅広い下流のコードタスクに適合させることができるコードのためのエンコーダ-デコーダLLMのファミリーである。
我々は、ゼロショット、微調整、命令調整を含む20以上のコード関連ベンチマークでCodeT5+を広範囲に評価した。
論文 参考訳(メタデータ) (2023-05-13T14:23:07Z) - CoCoMIC: Code Completion By Jointly Modeling In-file and Cross-file
Context [82.88371379927112]
予め訓練されたコード LM 上で,ファイル内コンテキストとファイル内コンテキストを協調的に学習するための,クロスファイルコンテキストを組み込んだフレームワークを提案する。
CoCoMICは既存のコードLMを33.94%の精度で改善し、クロスファイルコンテキストが提供されるとコード補完のための識別子マッチングが28.69%増加した。
論文 参考訳(メタデータ) (2022-12-20T05:48:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。