文本预处理

优质

小牛编辑

151浏览

2023-12-01

句子分割text_to_word_sequence

keras.preprocessing.text.text_to_word_sequence(text, 
    filters=base_filter(), lower=True, split=" ")

本函数将一个句子拆分成单词构成的列表

字符串列表

keras.preprocessing.text.one_hot(text, n,
    filters=base_filter(), lower=True, split=" ")

本函数将一段文本编码为one-hot形式的码，即仅记录词在词典中的下标。

【Tips】从定义上，当字典长为n时，每个单词应形成一个长为n的向量，其中仅有单词本身在字典中下标的位置为1，其余均为0，这称为one-hot。【@Bigmoyan】

为了方便起见，函数在这里仅把“1”的位置，即字典中词的下标记录下来。

整数列表，每个整数是[1,n]之间的值，代表一个单词（不保证唯一性，即如果词典长度不够，不同的单词可能会被编为同一个码）。

keras.preprocessing.text.Tokenizer(nb_words=None, filters=base_filter(), 
    lower=True, split=" ")

Tokenizer是一个用于向量化文本，或将文本转换为序列（即单词在字典中的下标构成的列表，从1算起）的类。

fit_on_texts(texts)
- texts：要用以训练的文本列表
texts_to_sequences(texts)
- texts：待转为序列的文本列表
- 返回值：序列的列表，列表中每个序列对应于一段输入文本
texts_to_sequences_generator(texts)
- 本函数是texts_to_sequences的生成器函数版
- texts：待转为序列的文本列表
- 返回值：每次调用返回对应于一段输入文本的序列
texts_to_matrix(texts, mode)：
- texts：待向量化的文本列表
- mode：‘binary’，‘count’，‘tfidf’，‘freq’之一，默认为‘binary’
- 返回值：形如(len(texts), nb_words)的numpy array
fit_on_sequences(sequences):
- sequences：要用以训练的序列列表
sequences_to_matrix(sequences):
- sequences：待向量化的序列列表
- mode：‘binary’，‘count’，‘tfidf’，‘freq’之一，默认为‘binary’
- 返回值：形如(len(sequences), nb_words)的numpy array