1. One-hot编码:将每个词映射为一个唯一的ID,然后将每个ID转换为一个长度为词汇表大小的向量,其中每个位置上的值都为0,除了对应ID的位置,其值为1。

  2. TF-IDF:首先计算每个词在文档中出现的频率(TF),然后计算每个词的逆文档频率(IDF),最后将两个值相乘得到TF-IDF值。将每个文档表示为一个向量,其中每个位置上的值为对应词的TF-IDF值。

  3. Bag of Words(BoW):将文档表示为一个词袋,其中每个词被视为一个独立的特征。首先构建词汇表,然后计算每个词在文档中的出现次数。将每个文档表示为一个向量,其中每个位置上的值为对应词的出现次数。

文本向量化:One-hot编码、TF-IDF和词袋模型

原文地址: https://www.cveoy.top/t/topic/n2Np 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录