杂记

希望多年以后,看到之前记录的文章,会有所感触。

0%

1. 语音识别引擎的介绍

从今天开始,我将用预计30天的时间,进行语音识别引擎的系统学习与分享。适合于没有接触过语音识别引擎但是有一定的代码基础和物理数学基础的人来阅读。刚开始撰写文章的顺序会很杂乱,后续全部完成后,会调整文章的顺序,让文章更适合阅读学习。
语音识别引擎(Automatic Speech Recognition Engine,简称 ASR Engine)是一套将人类语音信号转换为文本信息的软件系统。它是智能语音交互系统的核心模块,广泛应用于智能助手、车载语音、会议转写、客服机器人、智能家居、语音输入法等场景。
这是人机交互中不可或缺的一个关键环节,当识别引擎正确识别了人说的话,后续才会进行自然语言的理解以及后面的语音合成。当然,目前也存在端到端的模型。
概括来讲,引擎主要分为:音频输入模块,前端预处理模块,特征提取模块,声学模型/深度学习模型,解码器模块,语言模型。根据其部署位置,又分为端侧(轻量)和云侧,本系列侧重于云侧。
ChatGPT-Image-2026年8月3日-22_02_05.png

嘿嘿嘿,学校食堂太贵了,我快吃不饱饭了。