DCT 变换可以将时域波形转换为频域系数,从而实现信号压缩和去除冗余信息的目的。在语音识别中,我们可以将提取出来的 FBank 特征进行 DCT 变换,得到一组相关的滤波器组系数。通常选择其中的 2~13 维作为最终的特征,这样可以保留大部分重要信息,同时压缩掉一部分冗余信息,提高识别的准确性和效率。需要注意的是,扔掉的信息里面包含一些滤波器组,这些信息可能对于某些语音信号的识别会有影响。因此,在实际应用中需要根据具体情况进行调整和优化。

语音识别中的离散余弦变换 (DCT) - 特征提取与压缩

原文地址: https://www.cveoy.top/t/topic/oRs2 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录