論文の概要: Predicting Startup Exit from Textual Descriptors - A Computational Linguistics Framework
- arxiv url: http://arxiv.org/abs/2608.00045v1
- Date: Fri, 24 Jul 2026 09:33:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-09 10:00:34.265877
- Title: Predicting Startup Exit from Textual Descriptors - A Computational Linguistics Framework
- Title(参考訳): テキスト記述子からスタートアップの出口を予測する - 計算言語学フレームワーク
- Abstract要約: この研究は、テキスト記述子だけで早期スタートアップの成功を予測できることを示し、Exitと定義している。
20年以上にわたる7,419のスタートアップを対象とするベンチャーキャピタルによるデータセットを使用して、この研究はテキストベースのフレーミング変数とエンジニア850の機能を、スタートアップの物語マッピングを通じて分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This study shows that textual descriptors alone can predict early-stage startup success, defined as Exit, without relying on contextual, financial, or human capital variables. Using venture capital-curated datasets covering 7,419 startups over 20 years, the research isolates text-based framing variables and engineers 850 features through startup narrative mapping. Data subsets and vector embeddings are evaluated for statistical significance, followed by supervised machine learning experiments across six models. LightGBM achieved the highest predictive performance (F1 = 0.48), while textual descriptors alone achieved F1 = 0.30, confirming the standalone predictive value of founder narratives. Feature analysis shows that optimized densities of hyping markers, including adjectives, jargon, and buzzwords, are associated with higher Exit probability, whereas excessive statement or name length reduces it. The study also introduces a quantifiable Hyping Score for venture capital applications, demonstrating that startup framing provides measurable signals for predicting Exit under conditions of high information asymmetry.
- Abstract(参考訳): この研究は、テキスト記述子だけで、文脈、財務、人的資本変数に頼ることなく、Exitとして定義されたアーリーステージスタートアップの成功を予測することができることを示している。
20年以上にわたる7,419のスタートアップを対象とするベンチャーキャピタルによるデータセットを使用して、この研究はテキストベースのフレーミング変数とエンジニア850の機能を、スタートアップの物語マッピングを通じて分離する。
データサブセットとベクトル埋め込みを統計的に評価し、6つのモデルにわたる教師付き機械学習実験を行う。
LightGBMは最高予測性能(F1 = 0.48)を達成し、テキスト記述子はF1 = 0.30を達成し、創始者の物語のスタンドアロン予測値を確認した。
特徴分析により、形容詞、ジャーゴン、バズワードを含むハイプマーカーの最適化された密度は、より高いエクイット確率に関連し、一方過剰なステートメントや名前長はそれを減らすことが示された。
また、ベンチャーキャピタリストのための定量ハイピングスコアを導入し、スタートアップフレーミングが高情報非対称性の条件下でExitを予測するための測定可能な信号を提供することを示した。
関連論文リスト
- Predicting LLM Performance from Prompt Linguistic Features: An Empirical Study in Requirements Engineering [5.806534256425491]
言語的特徴は、すべてのターゲットにおける迅速なパフォーマンスを著しく予測する。
クロスLLM予測器は、複合依存性分布、接続密度、単語/文長を含む。
論文 参考訳(メタデータ) (2026-08-27T19:02:09Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - From Limited Data to Rare-event Prediction: LLM-powered Feature Engineering and Multi-model Learning in Venture Capital [0.0]
本稿では,大規模言語モデル (LLM) とマルチモデル機械学習 (ML) アーキテクチャを統合することで,希少かつ高インパクトな結果を予測する枠組みを提案する。
構造化されていないデータから複雑な信号を抽出・合成するために,LLMを利用した特徴工学を用いる。
我々はこのフレームワークをVC(Venture Capital)の分野に適用し、投資家は限られた、騒々しいアーリーステージデータでスタートアップを評価する必要がある。
論文 参考訳(メタデータ) (2025-09-09T20:46:54Z) - CoKe: Customizable Fine-Grained Story Evaluation via Chain-of-Keyword Rationalization [90.15027447565427]
思考の連鎖(CoT)は、モデルの予測を導くのに役立つ自由テキストの説明を生成する。
自己一貫性(SC: Self-Consistency)は、複数の生成された説明に対する予測を疎外する。
我々は、$textbfC$hain-$textbfo$f-$textbfKe$ywords (CoKe)を提案する。
論文 参考訳(メタデータ) (2025-03-21T13:37:46Z) - TimeCAP: Learning to Contextualize, Augment, and Predict Time Series Events with Large Language Model Agents [52.13094810313054]
TimeCAPは、時系列データのコンテキスト化ツールとしてLarge Language Models(LLM)を創造的に利用する時系列処理フレームワークである。
TimeCAPには2つの独立したLCMエージェントが組み込まれており、1つは時系列のコンテキストをキャプチャするテキスト要約を生成し、もう1つはより情報のある予測を行うためにこのリッチな要約を使用する。
実世界のデータセットによる実験結果から,TimeCAPは時系列イベント予測の最先端手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-02-17T04:17:27Z) - Context is Key: A Benchmark for Forecasting with Essential Textual Information [87.3175915185287]
コンテキスト is Key" (CiK) は、数値データを多種多様なテキストコンテキストと組み合わせた予測ベンチマークである。
我々は,統計モデル,時系列基礎モデル,LLMに基づく予測モデルなど,さまざまなアプローチを評価する。
提案手法は,提案するベンチマークにおいて,他の試験手法よりも優れる簡易かつ効果的なLCMプロンプト法である。
論文 参考訳(メタデータ) (2024-10-24T17:56:08Z) - A Knowledge-Informed Large Language Model Framework for U.S. Nuclear Power Plant Shutdown Initiating Event Classification for Probabilistic Risk Assessment [6.200373536860575]
本研究では,知識インフォームド・機械学習・モードを組み込んで非SDIEをプリスクリーンするハイブリッド・パイプラインと,SDIEを4つのタイプに分類する大規模言語モデル(LLM)を提案する。
提案手法は,精度,リコール率,F1スコア,平均精度を用いて,10,928イベントのデータセットを用いて評価した。
論文 参考訳(メタデータ) (2024-09-30T20:35:03Z) - Improving Startup Success with Text Analysis [0.21847754147782888]
より良い予測を達成するために、ソースと機能の数を大きく拡大し、多様化させます。
Crunchbase、Google Search API、およびTwitter(現在はX)から収集されたデータは、企業が資金調達を行うかどうかを予測するために使用される。
合計10の機械学習モデルも、最高のパフォーマンスで評価されている。
論文 参考訳(メタデータ) (2023-12-11T09:22:18Z) - On the Role of Attention in Prompt-tuning [90.97555030446563]
本研究では,一層アテンションアーキテクチャのプロンプトチューニングについて検討し,文脈混合モデルについて検討する。
ソフトマックス・プロンプト・アテンションは, ソフトマックス・自己アテンションやリニア・プロンプト・アテンションよりも明らかに表現力が高いことを示す。
また、実際のデータセットに関する理論的洞察を検証し、モデルが文脈関連情報にどのように対応できるかを示す実験も提供する。
論文 参考訳(メタデータ) (2023-06-06T06:23:38Z) - Syntactic Structure Distillation Pretraining For Bidirectional Encoders [49.483357228441434]
本稿では,BERTプレトレーニングに構文バイアスを注入するための知識蒸留手法を提案する。
我々は,構文的 LM から単語の周辺分布を抽出する。
本研究は,大量のデータを利用する表現学習者においても,構文バイアスの利点を示すものである。
論文 参考訳(メタデータ) (2020-05-27T16:44:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。