在 2006 年关于联结主义时间分类的文章中,Alex Graves 等人。引入了一种具有27 个标签的语音解码模型:26 个用于字母表字母,一个用于空白,意思是没有标签(我理解为沉默)。
然而,我看到很多 CTC 的实现都使用28 个标签,一个是空白,另一个是空格。到目前为止,我还无法找到需要使用这两个标签的解释,对我来说,它们代表同一件事。
您能否解释一下 CTC 背景下空白和空格之间的区别以及为什么需要这两个标签?
speech-recognition speech speech-to-text labeling ctc
ctc ×1
labeling ×1
speech ×1
speech-recognition ×1
speech-to-text ×1