南京龙垣申请基于说话人语音微动作的说话人识别专利,提升模型泛化性能
金融界2024年11月11日消息,国家知识产权局信息显示,南京龙垣信息科技有限公司申请一项名为“基于说话人语音微动作的说话人识别方法”的专利,公开号 CN 118918900 A ,申请日期为 2024 年 8 月。
专利摘要显示,本发明涉及电子数字数据处理技术领域,具体涉及一种基于说话人语音微动作的说话人识别方法,包括:语音流经过预处理后提取Fbank特征分别送入教师网络和学生网络中,得到各自对应的特征嵌入;将教师网络和学生网络分别得到的特征嵌入送入loss函数中并进行反向传播;学生网络正常迭代,教师网络通过EMA滑动平均的方法进行迭代;将经过ECAPA‑TDNN声纹模型提取得到的声纹特征信息与通过口音数据训练得到的说话人语音微动作信息进行特征聚合和分类,进行说话人识别;本发明利用数据增强等方法提升模型的泛化性能,避免拟合在信道特征当中,且不需要人工标注,并通过引入新的特征来帮助说话人验证模型取得在更大人群中识别说话人的能力。
本文源自:金融界
作者:情报员