論文の概要: EmbeddedKittens: An Evaluation of Code Embeddings for Scratch
- arxiv url: http://arxiv.org/abs/2607.19291v1
- Date: Tue, 21 Jul 2026 17:02:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.496698
- Title: EmbeddedKittens: An Evaluation of Code Embeddings for Scratch
- Title(参考訳): EmbeddedKittens: Scratch用のコード埋め込みの評価
- Authors: Benedikt Fein, Gordon Fraser,
- Abstract要約: ソースコードを埋め込む一般的なアプローチは、自然言語に似たトークンシーケンスとしてコードを扱うことである。
Scratchのようなビジュアルブロックベースのプログラミング言語の場合、このアプローチを直接適用することはできない。
ブロックベースのコードのテキストベースの表現は、この問題にLLMを適用するために作成できるが、他の専用の埋め込みモデルでは性能が向上する可能性がある。
- 参考スコア(独自算出の注目度): 10.485567182441194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The trend of embedding source code for machine learning applications also enables new opportunities in learning analytics in programming education, but which code embedding approach is most suitable for learning analytics remains an open question. A common approach to embedding source code lies in treating the code as a token sequence similar to natural language when training large language models~(LLMs). However, in case of visual block-based programming languages like Scratch, this approach cannot be applied directly. While text-based representations of block-based code can be created to apply LLMs to this problem, other dedicated embedding models could potentially exhibit improved performance by capturing additional structural information. In this paper, we therefore instantiate four LLMs and five different popular embedding approaches for Scratch programs, create a token-prediction and two different classification tasks with corresponding datasets, and empirically evaluate the models on them. Our experiments demonstrate that a transfer of code embeddings to the educational environment of Scratch is feasible. The embedding models trained on large open Scratch datasets capture relevant structural and semantic information about the code to enable learning analytics like predicting functional correctness of student programs, in the typically small classroom setting without requiring further task-specific model fine-tuning.
- Abstract(参考訳): 機械学習アプリケーションにソースコードを埋め込むことのトレンドは、プログラミング教育で分析を学ぶ新たな機会を可能にするが、どのコード埋め込みアプローチが分析を学ぶのに最も適しているかは未解決のままである。
ソースコードを埋め込む一般的なアプローチは、大きな言語モデル~(LLM)を訓練する際に、自然言語に似たトークンシーケンスとしてコードを扱うことである。
しかし、Scratchのような視覚ブロックベースのプログラミング言語では、このアプローチを直接適用することはできない。
ブロックベースのコードのテキストベースの表現は、この問題にLLMを適用するために作成できるが、他の専用の埋め込みモデルは、付加的な構造情報をキャプチャすることで、性能の向上を示す可能性がある。
そこで本研究では,Scratchプログラムの4つのLCMと5つの一般的な埋め込み手法をインスタンス化し,トークン予測と2つの異なる分類タスクを対応するデータセットで作成し,それらのモデルについて実験的に評価する。
実験により,Scratchの教育環境へのコード埋め込みが実現可能であることを示した。
大規模なオープンなScratchデータセットでトレーニングされた埋め込みモデルは、関連する構造的および意味的な情報をキャプチャして、学生プログラムの機能的正しさを予測するなどの学習分析を可能にする。
関連論文リスト
- Code Fingerprints: Disentangled Attribution of LLM-Generated Code [7.515488307576106]
生成したコードに責任を負うソースLLMを決定することを目的とした,モデルレベルのコード属性の問題について検討する。
本稿では、ソース非依存のセマンティック情報とソース-特異なスタイル表現を分離するDisentangled Code Attribution Network (DCAN)を提案する。
4つのプログラミング言語で広く使われている4つの大規模言語モデル(LLM)が生成するコードからなる,最初の大規模ベンチマークデータセットを構築した。
論文 参考訳(メタデータ) (2026-03-04T15:58:36Z) - CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models [0.0]
大規模言語モデル(LLM)は、その常識的推論、言語理解、論理的推論能力に基づいて主に評価される。
既存のベンチマークデータセットは、特定の強度と弱点を特定できない。
我々は,Python プログラミングの 24 つの異なる側面にわたる LLM を厳格に評価するために設計された多次元ベンチマークデータセットである CodeEval を紹介した。
論文 参考訳(メタデータ) (2026-01-06T21:42:01Z) - EmbedLLM: Learning Compact Representations of Large Language Models [28.49433308281983]
大規模言語モデルのコンパクトなベクトル表現を学習するためのフレームワークである EmbedLLM を提案する。
このような埋め込みを学習するためのエンコーダ-デコーダアプローチと,その有効性を評価するための体系的なフレームワークを導入する。
EmbedLLMはモデルルーティングにおいて,精度とレイテンシの両方において,従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-10-03T05:43:24Z) - SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models [54.78329741186446]
本稿では,コードに基づく批判モデルを用いて,質問コードデータ構築,品質管理,補完的評価などのステップをガイドする新しいパラダイムを提案する。
英語と中国語におけるドメイン内ベンチマークとドメイン外ベンチマークの両方の実験は、提案したパラダイムの有効性を実証している。
論文 参考訳(メタデータ) (2024-08-28T06:33:03Z) - Language models are weak learners [71.33837923104808]
本研究では,プロンプトベースの大規模言語モデルは弱い学習者として効果的に動作可能であることを示す。
これらのモデルをブースティングアプローチに組み込むことで、モデル内の知識を活用して、従来のツリーベースのブースティングよりも優れています。
結果は、プロンプトベースのLLMが、少数の学習者だけでなく、より大きな機械学習パイプラインのコンポーネントとして機能する可能性を示している。
論文 参考訳(メタデータ) (2023-06-25T02:39:19Z) - CodeGen2: Lessons for Training LLMs on Programming and Natural Languages [116.74407069443895]
我々はエンコーダとデコーダベースのモデルを単一のプレフィックスLMに統一する。
学習方法は,「フリーランチ」仮説の主張を考察する。
データ配信においては,混合分布と多言語学習がモデル性能に及ぼす影響について検討した。
論文 参考訳(メタデータ) (2023-05-03T17:55:25Z) - Offline RL for Natural Language Generation with Implicit Language Q
Learning [87.76695816348027]
ユーザ指定タスクの完了に関して、大きな言語モデルは矛盾する可能性がある。
本稿では,RLのフレキシブル・ユーティリティ・フレームワークと教師あり学習能力を組み合わせた新しいRL手法を提案する。
ILQLの実証的な検証に加えて、オフラインRLが自然言語生成設定で有用となるような、詳細な経験的分析状況も提示する。
論文 参考訳(メタデータ) (2022-06-05T18:38:42Z) - Contrastive Learning for Source Code with Structural and Functional
Properties [66.10710134948478]
本稿では,ソースコードの特徴に基づいて事前学習に焦点を当てた,新たな自己教師型モデルBOOSTを提案する。
私たちは、機能的に等価なコードを生成する自動化された構造誘導型コード変換アルゴリズムを採用しています。
私たちは、対照的な学習目標を通じて、機能的に等価なコードをより近く、異なるコードに近づける方法で、モデルをトレーニングします。
論文 参考訳(メタデータ) (2021-10-08T02:56:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。