論文の概要: CALICO: A Human-Centered, Codebook-Aligned System for Annotation
- arxiv url: http://arxiv.org/abs/2609.14726v1
- Date: Sun, 13 Sep 2026 18:38:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.90895
- Title: CALICO: A Human-Centered, Codebook-Aligned System for Annotation
- Title(参考訳): CALICO: アノテーションのための人間中心のコードブックアラインメントシステム
- Abstract要約: 人中心のコードブック対応のアノテーションワークフローであるCALICOについて紹介する。
CALICOはプロンプトを編集可能、バージョン管理可能、最適化可能なアーティファクトとして扱う。
ドメイン固有のAIコンパニオン会話コードブック上でCALICOを評価する。
- 参考スコア(独自算出の注目度): 10.833002335797
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly used to scale codebook-based annotation in scientific research, but existing workflows provide limited support for translating domain experts' codebooks into reliable, revisable, and auditable prompts. Prompts are often treated as fixed instructions and hidden from annotators, making it difficult for non-technical domain experts to diagnose and correct model behavior when outputs violate codebook guidelines. In this paper, we present CALICO, a human-centered, codebook-aligned annotation workflow that treats prompts as editable, versioned, and optimizable artifacts. CALICO integrates codebook parsing, prompt generation, result inspection, prompt versioning, natural language human feedback, and label-supervised prompt optimization through existing optimizers such as GEPA, MIPROv2, and OPRO, together with our reflection-based optimizer, ReflectAgent. Empirically, we evaluate CALICO on domain-specific AI-companion chatbot conversation codebooks. Across evaluated dimensions, CALICO improves mean held-out performance by +13.0 and +7.4 absolute points for two coders, respectively. A coder-specificity analysis further suggests that optimized prompts capture coder-specific interpretations rather than only generic codebook clarification. CALICO runs as a web application that takes users from raw codebook materials to inspectable, exportable labels; the website, codebase, and live demo are released at https://calico-annotation.github.io/ under the Apache 2.0 License.
- Abstract(参考訳): 大規模な言語モデルは、科学研究においてコードブックベースのアノテーションをスケールするために使われることが多いが、既存のワークフローは、ドメインの専門家のコードブックを信頼性、修正可能、監査可能なプロンプトに変換するための限定的なサポートを提供する。
プロンプトはしばしば固定命令として扱われ、アノテータから隠されているため、アウトプットがコードブックガイドラインに違反している場合、非技術ドメインの専門家がモデルの振る舞いを診断し、修正することは困難である。
本稿では,プロンプトを編集可能,バージョン管理可能,最適化可能なアーティファクトとして扱う,人間中心のコードブック対応のアノテーションワークフローであるCALICOを提案する。
CALICOは、コードブック解析、プロンプト生成、結果検査、プロンプトバージョニング、自然言語のヒューマンフィードバック、GEPA、MIPROv2、OPROといった既存のオプティマイザによるラベル付きプロンプト最適化とリフレクションベースのオプティマイザであるReflectAgentを統合している。
実証的に、我々はドメイン固有のAIコンパニオンチャットボットの会話コードブック上でCALICOを評価する。
評価された次元全体で、CALICOは平均ホールドアウト性能を2つのコーダに対して+13.0と+7.4の絶対点で改善する。
コーダ固有の分析により、最適化されたプロンプトは、一般的なコードブックの明確化だけでなく、コーダ固有の解釈をキャプチャすることを示唆している。
CALICOは,生のコードブック資料から,検査可能な,エクスポート可能なラベルまで,Webアプリケーションとして動作する。Webサイト,コードベース,ライブデモは,Apache 2.0ライセンスの下でhttps://calico-annotation.github.io/で公開されている。
関連論文リスト
- An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc [7.236134946837382]
petscagent-benchはエージェント評価エージェントのパラダイムに基づいて構築されたエージェントフレームワークである。
正確性、パフォーマンス、コード品質、アルゴリズムの適切性、ライブラリ固有の規約の5つの評価カテゴリで14評価パイプラインを編成する。
本フレームワークは,HPC用PETScライブラリを用いて,現実的な問題のベンチマークスイート上で実演する。
論文 参考訳(メタデータ) (2026-03-16T22:46:10Z) - Vibe Checker: Aligning Code Evaluation with Human Preference [35.939058895669895]
提案するVeriCodeは,30の検証可能なコード命令とそれに対応する決定論的検証器の分類法である。
最強モデルでさえ、複数の命令に従わず、明確な機能回帰を示すのに苦労していることを示す。
我々の研究は、バイブチェックの中核的な要素を特定し、モデルをベンチマークし、開発するための具体的なパスを提供します。
論文 参考訳(メタデータ) (2025-10-08T17:59:19Z) - IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Leveraging Reward Models for Guiding Code Review Comment Generation [13.306560805316103]
コードレビューは、コード品質の評価、潜在的な問題に対するフィードバックの提供、特定された問題に対処するためのコード修正を含む、現代のソフトウェア開発において重要なコンポーネントである。
ディープラーニングのテクニックは、人間のレビュアーが行うようなコードにコメントすることで、コードレビューのジェネレーティブな側面に取り組むことができる。
本稿では,報酬機構を備えた強化学習を活用することによって,レビューコメント生成を自動化するディープラーニングフレームワークであるCoRALを紹介する。
論文 参考訳(メタデータ) (2025-06-04T21:31:38Z) - SparseCoder: Identifier-Aware Sparse Transformer for File-Level Code
Summarization [51.67317895094664]
本稿では,大規模なソースコードプロジェクトの理解と維持を支援するファイルレベルのコード要約について検討する。
長いコードシーケンスを効果的に処理するための識別子対応スパース変換器であるSparseCoderを提案する。
論文 参考訳(メタデータ) (2024-01-26T09:23:27Z) - Code Execution with Pre-trained Language Models [88.04688617516827]
コードインテリジェンスのトレーニング済みモデルのほとんどは実行トレースを無視しており、ソースコードと構文構造のみに依存している。
我々は,大規模かつ現実的なPythonデータセットとコード実行タスクを作成するために,突然変異に基づくデータ拡張手法を開発した。
次に、コード実行事前学習とカリキュラム学習を活用して意味理解を強化するトランスフォーマーモデルであるCodeExecutorを提案する。
論文 参考訳(メタデータ) (2023-05-08T10:00:05Z) - ReCode: Robustness Evaluation of Code Generation Models [90.10436771217243]
コード生成モデルのための総合的ロバストネス評価ベンチマークであるReCodeを提案する。
ドクストリング、関数と変数名、コード構文、コードフォーマットのコードに特化して、30以上の変換をカスタマイズします。
ヒトのアノテータでは、摂動プロンプトの90%以上が本来のプロンプトの意味を変えていないことが確認された。
論文 参考訳(メタデータ) (2022-12-20T14:11:31Z) - Interactive Code Generation via Test-Driven User-Intent Formalization [60.90035204567797]
大きな言語モデル(LLM)は、非公式な自然言語(NL)の意図からコードを生成する。
自然言語は曖昧であり、形式的な意味論が欠けているため、正確性の概念を定義するのは難しい。
言語に依存しない抽象アルゴリズムと具体的な実装TiCoderについて述べる。
論文 参考訳(メタデータ) (2022-08-11T17:41:08Z) - ReACC: A Retrieval-Augmented Code Completion Framework [53.49707123661763]
本稿では,語彙のコピーと類似したセマンティクスを持つコード参照の両方を検索により活用する検索拡張コード補完フレームワークを提案する。
我々は,Python および Java プログラミング言語のコード補完タスクにおけるアプローチを評価し,CodeXGLUE ベンチマークで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-03-15T08:25:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。