我有一个由 DNA 序列组成的数据,其中单词表示为长度为 6 的 kmers,句子表示为 DNA 序列。每个 DNA 序列有 80 kmers(单词)
我拥有的 kmers 列表约为 130,000 kmers,但删除重复元素后,我将只有 4500 kmers。因此,这个巨大的差距让我对是否删除重复的公里数感到困惑。我的问题是,在这种情况下是否建议删除word2vec算法中重复的kmers?
谢谢。
dna-sequence word2vec
dna-sequence ×1
word2vec ×1