論文の概要: string2string Studio: An Interactive, In-Browser Platform for String-to-String Algorithms
- arxiv url: http://arxiv.org/abs/2608.03984v1
- Date: Tue, 04 Aug 2026 17:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 17:47:10.518513
- Title: string2string Studio: An Interactive, In-Browser Platform for String-to-String Algorithms
- Title(参考訳): string2string Studio: 文字列から文字列へのアルゴリズムのためのインタラクティブなブラウザ内プラットフォーム
- Authors: Mirac Suzgun, James Zou, Stuart M. Shieber, Dan Jurafsky,
- Abstract要約: string2string Studioは、ストリングツーストリング分析のためのインタラクティブなブラウザ内プラットフォームである。
システムは6つの主要なモジュールを統合し、文字、単語、トークン、行、残余レベルを操作できる。
コア操作は、インストールやデータのアップロードなしに、デフォルトでローカルに実行される。
- 参考スコア(独自算出の注目度): 53.57099780847477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present string2string Studio, an interactive in-browser platform for string-to-string analysis across natural language processing, computational biology, and the digital humanities. The system integrates six main modules (alignment, distance, similarity, search, generation metrics, and BLAST homology search), operating at character, word, token, line, and residue levels. Its C++-based algorithms compile to WebAssembly, so core operations run locally by default without any installation or data upload. The interface reports scores with their "evidence" (alignments, edit paths, metric matches, search hits, and homology traces), making methods inspectable, debuggable, and comparable on shared inputs. Internal benchmarks show speedups of up to 2,500x over the Python predecessor, faster global/local alignment than a general-purpose native C aligner, and exact agreement with independent references under declared settings. For homology search, the scoped client-side blastn path closely matches NCBI BLAST+ rankings and statistics under matched parameters. A curated showcase and Learn mode present canonical algorithms and metrics as reusable demonstrations. string2string Studio is open-source and freely available at string2string.org.
- Abstract(参考訳): string2string Studioは、自然言語処理、計算生物学、デジタル人文科学を対象とする、文字列間文字列解析のためのインタラクティブなブラウザ内プラットフォームである。
このシステムは6つの主要モジュール(アライメント、距離、類似性、検索、生成メトリクス、BLASTホモロジー検索)を統合し、文字、単語、トークン、行、残基のレベルで操作する。
C++ベースのアルゴリズムはWebAssemblyにコンパイルされるため、コア操作はインストールやデータのアップロードなしに、デフォルトでローカルに実行される。
インターフェースは、その"エビデンス"(アライメント、編集パス、メートル法マッチ、検索ヒット、ホモロジートレース)でスコアを報告し、メソッドを検査可能、デバッグ可能、共有入力で同等にする。
内部ベンチマークでは、Pythonの前任者よりも最大2,500倍のスピードアップ、汎用のネイティブCコーディネータよりも高速なグローバル/ローカルアライメント、宣言された設定の下での独立参照との正確な一致などが示されている。
ホモロジー検索では、スコープ化されたクライアント側ブラストパスはNCBI BLAST+のランキングと一致したパラメータの統計値と密接に一致している。
キュレートされたショーケースとLearnモードは、標準的なアルゴリズムとメトリクスを再利用可能なデモとして提示する。
string2string Studioはオープンソースで、string2string.orgで無料で利用できる。
関連論文リスト
- Boolean queries are all you need? [10.637635718179075]
TREC 2024 RAGトラックで使用されるMS MARCO V2.1復号セグメントコレクションを検索する。
86のトピックの標準トラックサブセットと100のモデルコール/トピックの予算の下で動作し、エージェントは0.6863のNDCG@10を達成した。
ランク付けは、クエリにマッチするコーパスの密度のみに基づいており、教師付き学習、グローバル統計、用語の重み付けは不要である。
論文 参考訳(メタデータ) (2026-07-13T10:25:46Z) - SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search [2.1542644686007173]
コーパス構築,検索スタック,ツール契約,評価プロトコルが明確で実行可能であるSimpleWikiSearchを提案する。
環境は、完全なウィキペディアダンプから始まり、コーパスを掃除してチャンクし、キーワードと密度の高い検索インデックスを構築し、最小限のツールインターフェースを公開する。
オープンソースLCMを用いた6つのQAデータセットのベースライン結果と、クローズドソース商用モデルとの比較のためのランダム300サブセットについて報告する。
論文 参考訳(メタデータ) (2026-07-10T13:05:10Z) - GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - STRABLE: Benchmarking Tabular Machine Learning with Strings [53.03295517218137]
STRABLEは108のテーブルからなるベンチマークコーパスであり、様々なアプリケーションフィールドにまたがる文字列や数値を使った実世界の学習問題である。
445個のパイプラインを評価し,文字列を用いた表型学習の大規模な実証的研究を行った。
野生のほとんどのテーブルは分類的に支配的であるため、単純な文字列埋め込みと組み合わせた先進的な表型学習者は、計算コストを低くして優れた予測を達成できる。
論文 参考訳(メタデータ) (2026-05-12T15:47:50Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - CLARC: C/C++ Benchmark for Robust Code Search [2.225731679677886]
現実のGitHubリポジトリから構築されたC/C++ベンチマークであるCLARCを紹介します。
Clarcには、評価用の1,245のクエリコードペアと、トレーニング用の5,472のペアが含まれている。
論文 参考訳(メタデータ) (2026-03-04T18:57:37Z) - Prompt Stability Scoring for Text Annotation with Large Language Models [0.0]
研究者たちは、テキストアノテーションに言語モデル(LM)をますます利用している。
これらのアプローチは、一連の命令に従って与えられた出力を返すようモデルに指示するプロンプトにのみ依存する。
LM出力の診断は、にもかかわらず、プロンプト設計の小さな変更に対して脆弱である。
論文 参考訳(メタデータ) (2024-07-02T08:11:18Z) - Context Perception Parallel Decoder for Scene Text Recognition [52.620841341333524]
シーンテキスト認識手法は高い精度と高速な推論速度を達成するのに苦労している。
本稿では、STRにおけるARデコーディングの実証的研究を行い、ARデコーダが言語文脈をモデル化するだけでなく、視覚的文脈知覚のガイダンスも提供することを明らかにする。
我々は一連のCPPDモデルを構築し、提案したモジュールを既存のSTRデコーダにプラグインする。英語と中国語のベンチマーク実験により、CPPDモデルはARベースモデルよりも約8倍高速に動作し、高い競争精度を達成できることを示した。
論文 参考訳(メタデータ) (2023-07-23T09:04:13Z) - string2string: A Modern Python Library for String-to-String Algorithms [24.167017445129105]
string2stringは、文字列から文字列への問題に対する効率的なアルゴリズムの包括的なスイートを提供するオープンソースライブラリである。
これには、文字列アライメント、距離測定、語彙と意味探索、類似性解析といった様々な問題に対処する、従来のアルゴリズムによる解や、最近の先進的なニューラルアプローチが含まれる。
Pythonで実装されており、ip経由で簡単にインストールでき、シンプルなAPI経由でアクセスできる。
論文 参考訳(メタデータ) (2023-04-27T17:57:19Z) - AutoSTR: Efficient Backbone Search for Scene Text Recognition [80.7290173000068]
テキストインスタンスの多様性とシーンの複雑さのため、シーンテキスト認識(STR)は非常に難しい。
テキスト認識性能を向上させるために,データ依存のバックボーンを検索するための自動STR(AutoSTR)を提案する。
実験によると、データ依存のバックボーンを検索することで、AutoSTRは標準ベンチマークにおける最先端のアプローチより優れている。
論文 参考訳(メタデータ) (2020-03-14T06:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。