Nic*_* D. 5 speech-recognition speech speech-to-text labeling ctc
在 2006 年关于联结主义时间分类的文章中,Alex Graves 等人。引入了一种具有27 个标签的语音解码模型:26 个用于字母表字母,一个用于空白,意思是没有标签(我理解为沉默)。
然而,我看到很多 CTC 的实现都使用28 个标签,一个是空白,另一个是空格。到目前为止,我还无法找到需要使用这两个标签的解释,对我来说,它们代表同一件事。
您能否解释一下 CTC 背景下空白和空格之间的区别以及为什么需要这两个标签?
小智 2
\n\n\n在联结主义时态分类中,空间只是一个空白,空白就是“-”,我们用它来解决数据的重复出现。例如“pizza”将被编码为“piz-za”。
\n
太长了;
\n\n参考:https://towardsdatascience.com/beam-search-decoding-in-ctc-trained-neural-networks-5a889a3d85a7
\n\n在CTC中存在一个如何对重复字符进行编码的问题。它是通过引入一个伪字符(称为空白,但不要将其与 \xe2\x80\x9creal\xe2\x80\x9d 空白,即空白字符混淆)来解决的。该特殊字符在文本中将表示为\xe2\x80\x9c-\xe2\x80\x9d。我们使用巧妙的编码模式来解决重复字符问题:在对文本进行编码时,我们可以在任意位置插入任意多个空格,而在解码时这些空格将被删除。但是,我们必须在重复字符之间插入空格,例如 \xe2\x80\x9chello\xe2\x80\x9d。此外,我们可以随意重复每个字符。\n让\xe2\x80\x99s 看一些示例:\n\xe2\x80\x9cto\xe2\x80\x9d \xe2\x86\x92 \xe2\x80 \x9c---ttttttooo\xe2\x80\x9d,或 \xe2\x80\x9c-to-\xe2\x80\x9d,或 \xe2\x80\x9cto\xe2\x80\x9d\n\xe2\x80\ x9ctoo\xe2\x80\x9d \xe2\x86\x92 \xe2\x80\x9c---ttttto-o\xe2\x80\x9d,或 \xe2\x80\x9c-too-\xe2\x80\x9d,或\xe2\x80\x9cto-o\xe2\x80\x9d,但不是 \xe2\x80\x9ctoo\xe2\x80\x9d\n 如您所见,此模式还允许我们轻松创建同一文本的不同对齐方式,例如\xe2\x80\x9ct-o\xe2\x80\x9d 和 \xe2\x80\x9ctoo\xe2\x80\x9d 和 \xe2\x80\x9c-to\xe2\x80\x9d 都表示相同的文本 (\xe2 \x80\x9cto\xe2\x80\x9d),但与图像的对齐方式不同。神经网络经过训练以输出编码文本(在神经网络输出矩阵中编码)。
\n| 归档时间: |
|
| 查看次数: |
2203 次 |
| 最近记录: |