近期工作主要围绕云端 L2 Router 的识别效果优化与 LLM 调用率压降展开。当前整体云端识别的LLM调用率已经明显下降了,但是与此同时字准也发生了明显的下降,因此需要先提升字准,看在字准不变的情况下,如何保证LLM调用率的下降。围绕这一目标,近期主要从特征增强、训练目标优化、错误样本分析以及专项预筛几个方向进行了推进。
首先,在 Router 特征侧新增了 CTC32 与 ED 结果一致性特征。原有 Router 特征主要来源于 ED N-best、Decoder Beam 搜索过程、FA 声学匹配以及 RAG 检索结果,能够描述候选之间的文本、语义、声学以及搜索稳定性,但缺少不同识别分支之间的一致性信息。因此新增 ctc_ed_sim,用于衡量 CTC32 直接识别结果与 ED/Decoder 最终结果之间的相似程度。该特征本质上反映了模型内部不同解码分支之间是否达成一致:当 CTC 与 ED 结果高度一致时,通常表示识别结果较稳定;而当两者存在明显差异时,则说明模型内部对当前音频存在一定分歧,后续调用 LLM 可能具有更高收益。从实际 LightGBM 特征重要性结果来看,ctc_ed_sim 的 Gain 已进入前列,说明跨分支一致性信息确实能够为 Router 提供新的有效判别信息,也验证了这一特征设计方向的合理性。但是通过具体的实验结果看出,加入ctc32结果后,效果并不及预期,有所提高,但是不多,因此暂时舍弃了这个特征。
在阅读论文SR-CEM后,参考这个论文的思路:Decoder token-level score 特征。之前的 Decoder 特征主要包括 ed_top1_top2_avg_gap、ed_beam_dist_entropy 和 ed_top1_switch_rate,这些特征主要描述的是 Beam Search 层面的整体竞争情况,例如 Top1 与 Top2 的分数差距、多个 beam 之间的分布熵以及 Top1 路径切换频率。这些特征在当前模型中重要性一直较高,但它们更多反映的是“搜索空间整体稳定不稳定”,并没有直接描述最终 winning path 上每一个 token 的局部质量。因此参考 SR-CEM 中利用 token score 和路径上下文进行置信度估计的思路,在 ED_dec_simple_imp.cpp 中沿最终 getMaxPath() 的 winning path 回溯,通过 pPrePath_ 获取每一个真实 token 对应的 fStepScore_,并基于这些局部 step score 构造了三个句级特征:ts_score_mean、ts_score_min 和 ts_suffix_avg。其中,ts_score_mean 表示最终最优路径中所有真实 token 局部得分的平均值,用于衡量整句路径的总体质量;ts_score_min 用于捕获整句话中得分最低、最不稳定的 token,解决“整句平均很高但某一个字非常危险”的问题;ts_suffix_avg 则进一步统计各位置之后 token 的平均得分,并对整句进行聚合,用于刻画 winning path 在后续生成过程中的稳定性。相比原有的 Beam Gap、Entropy 等统计量,这一组特征把 Router 的信息粒度从 beam-level 进一步深入到了 token-level。
同时,对现有 Beam 特征也重新进行了分布与有效性分析。以 ed_beam_dist_entropy 为例,在 7-beam 场景下理论最大熵为:
实际数据中发现约 97% 的 entropy 都集中在 1.4~1.95 的高位区间。针对这一现象,进一步分析了是否需要将熵归一化到 0~1。结论是,对 LightGBM 来说,是否归一化并不是核心问题,因为树模型主要依赖特征排序和切分点,线性缩放并不会增加新的判别信息。真正需要关注的是高熵区间内部是否仍然能够区分 LLM Benefit 样本和 No-Benefit 样本。从当前特征 Gain 排名来看,ed_beam_dist_entropy 仍然处于非常靠前的位置,说明即使整体分布集中在高位区间,LightGBM 仍然可以在 1.4~1.95 内部找到有效切分点,因此目前没有必要为了数值范围强行归一化。
进一步分析错误 case 后,发现一个比较突出的专项问题来自 数字、符号和书写规范化场景。例如:
五点五英寸 → 5.5英寸
百分之零点三三 → 0.33%
九的立方 → 9³
一百除以零点五 → 100÷0.5
三十八点六摄氏度 → 38.6℃
这类 case 的特点是:从传统 ASR 声学识别角度看,ED 其实可能是正确的,甚至 CTC、Decoder、FA 等内部置信信号都非常稳定,但是最终 benchmark 或业务要求希望输出更规范的书写形式。因此,这类错误并不是传统 ASR confidence 特征能够很好区分的,本质上更接近 Normalization Risk,也就是“当前文本虽然声学识别正确,但存在较高概率需要数字、单位、符号、日期、时间、公式等书写规范化”。因此加入了预筛选的逻辑,将这些任务直接送到LLM中。
在现有模型效果分析方面,也对当前约 70% 的 LLM 调用率进行了进一步拆解。通过比较 ED 和 LLM 最终文本,发现仍然存在大量 ED 与 LLM 完全一致、或者仅存在标点差异的样本。这意味着当前仍然有相当一部分 LLM 调用实际上没有带来任何实质性收益。从统计角度看,这部分样本就是后续继续降低调用率的主要空间。另一方面,对当前已经被 Router 省掉的 LLM 调用进行分析后,也发现真正存在非标点实质文本差异的比例相对较低,说明当前 Router 在保证字准的前提下已经具备一定的安全降调用能力,但对“可无损省调用”样本的覆盖仍然不足。加入该类特征(3种)后,字准上升到96.68%已经超过了基线!但是LLM调用率升高到了70%左右(仍低于基线的95%左右)。
另外,对整个 ASR 引擎内部多个模块进行重新梳理,包括 ED Decoder、Simple Decoder、FA、FSA、LM、PGS 等模块之间的关系。对 FA 的理解进一步明确:FA 本质上是 Forced Alignment 强制对齐模块,在候选文本已经确定的前提下,利用 Encoder/声学头提供的帧级声学信息,在固定文本顺序约束下寻找最佳时间对齐路径,并输出对应的声学匹配分。因此 FA 更适合作为“候选文本是否与当前音频声学一致”的判断依据,而不是判断文本语义或者书写规范是否正确。FSA 则主要作为热词、领域词、通讯录等定制场景下的受约束搜索模块,通过预定义有限状态图产生候选,并与 ED、FA、LM 等结果进行 PK。通过这部分梳理,对当前 Router 各个特征的来源和物理含义也更加明确。
当前阶段的核心目标已经比较明确:云端整体字准已经达到要求,后续不再以单纯提高字准为主要目标,而是重点研究如何识别“LLM 无收益”的请求,在保证最终识别准确率不下降的前提下,将当前约 70% 的 LLM 调用率继续向更低水平压缩。
后续准备重点推进三项工作。第一,基于现有模型进行完整 threshold sweep,建立 Final Accuracy - LLM Call Rate 曲线,确认当前模型本身还有多少仅靠阈值调整即可释放的降调用空间;第二,基于新的 LLM Benefit Label 重构 Router V2 数据集并重新训练,重点提高对 ED≈LLM、LLM无收益 等样本的识别能力;第三,完成 Normalization Risk 预筛模型,对数字、单位、时间、日期、运算符、特殊符号等场景进行专项保护,考虑使用 Char TF-IDF + Logistic Regression 作为轻量文本分类模型,使主 Router 在普通样本上能够采用更激进的省调用策略。
