杂记

希望多年以后,看到之前记录的文章,会有所感触。

0%

4. L2级路由方法介绍

目前计划的 L2 级路由整体采用两阶段决策机制。第一阶段为基于规则的预筛选阶段,主要针对数字、公式、实体以及部分特定业务场景进行识别。当输入命中预先配置的关键词、模式或场景规则时,认为该类样本具有较高的 LLM 纠错收益,因此不再经过后续置信度模型判断,而是直接调用 LLM 进行二次纠错。该阶段主要用于优先覆盖 LLM 收益较为明确的高价值场景,减少后续模型的决策压力。

对于未命中第一阶段规则的样本,则进入第二阶段的置信度路由模型。当前计划采用 LightGBM 作为主要分类模型,同时也可以进一步探索其他置信度估计模型。模型根据 ED 解码过程、N-best 候选、RAG 检索结果以及声学信息等多维特征,对当前 ED 识别结果的可靠程度进行综合打分。模型输出一个连续置信度分数,并通过预设阈值完成最终路由决策。当模型得分高于阈值时,认为当前 ED 结果已经具有较高可信度,无需继续调用 LLM,直接输出 ED 结果;当得分低于阈值时,则认为 ED 结果存在较大的潜在错误风险,进一步调用 LLM 进行纠错。

因此,整个 L2 路由的核心问题可以归纳为:如何尽可能准确地判断当前 ED 结果是否已经足够可靠,从而在保证识别准确率的前提下减少不必要的 LLM 调用。 在这一过程中,置信度模型所使用的特征质量将直接影响最终的路由效果。

现有 ASR 置信度估计方法通常会利用 Decoder、Beam Search 或 CTC 解码过程中产生的概率、得分以及候选分布信息,例如 Top1 与 Top2 的分数差、Beam 分布熵、token posterior、N-best 一致性等。这些信息能够从不同角度反映模型在解码过程中的确定程度。但仅依赖单一的 Decoder 得分往往难以完整描述一个识别结果是否可靠,因此当前 Router 在传统解码分数的基础上,进一步引入了文本、语义、声学、Beam Search 以及 RAG 检索等多源特征。

当前使用的特征主要包括 semantic_distance、text_distance 和 faNorm_distance,分别用于衡量 N-best 候选在语义、文本和声学层面的离散程度;EntityMissRate 用于描述关键实体信息的缺失情况;ed_top1_top2_avg_gap、ed_beam_dist_entropy 和 ed_top1_switch_rate 用于描述 Decoder Beam Search 过程中候选之间的竞争程度和搜索稳定性;同时利用 rag_top1_score、rag_top1_top2_gap、rag_recall_count、rag_score_mean、rag_score_std 和 rag_score_sum 等特征描述外部检索结果的置信度及分布情况。

后续还计划继续补充 CTC 与 Decoder 的跨分支一致性特征,以及 Decoder token-level 的 score、rank 等 SR-CEM 类特征,使 Router 不再只依赖最终 N-best 结果,而能够进一步利用解码过程中的动态置信度信息。例如,CTC 与 Decoder 最终结果的一致程度可以反映不同解码分支之间是否形成一致判断,而 token score、token rank 等特征则能够刻画 Decoder 在逐 token 生成过程中的局部稳定性。

最终希望形成一套由声学一致性、文本一致性、语义一致性、搜索稳定性、CTC 置信度以及外部知识检索置信度共同组成的多维特征体系,并基于这些特征训练 LGB Router。通过调整模型阈值,可以在最终识别准确率与 LLM 调用率之间取得合适的平衡,从而实现“容易样本直接使用 ED,困难样本调用 LLM”的自适应路由机制。

嘿嘿嘿,学校食堂太贵了,我快吃不饱饭了。