比较 MFCC 特征向量与 DTW

ami*_*one 5 audio speech-recognition dynamic-programming mfcc dtw

我正在寻找有关动态时间扭曲 (DTW) 的一些建议。

我有一个 Python 脚本并从各种长度的 .WAV 文件中提取梅尔频率倒谱系数 (MFCC) 特征向量。特征向量是不同长度的数组,包含 12 个 MFCC 的数组。

例如,一个 .WAV 文件可以由包含 10 个 12 个特征向量的 10 组的数组表示,而另一个 .WAV 文件可以由包含 20 个 12 个特征向量的一组数组表示。

我打算使用 DTW 来比较两个数组数组,但我不确定如何。我理解 DTW 的概念,如果数组中包含的特征向量是单个数字,那么实现它就没有问题,我的困惑是因为它们是数组。

Tl; dr:如何使用 DTW 比较两个数组数组?

编辑:我已阅读此问题但无济于事。

非常感谢,亚当

小智 3

这里有一个关于 DTW 的很好的教程

我已经在十几篇论文中做到了这一点,请参阅此处的斑胸草雀示例

需要注意的一个关键事项。您可能只想将一个特征向量与相应的特征向量进行比较。使用全部 12 种方法的情况很少见。