AI-NEWS · 2026年 8月 5日

腾讯混元 Hy ASR 3.0 评测

腾讯混元刚放出的 Hy ASR 3.0 预览版,把语音识别从“逐字转写”拉到了“理解语境”的阶段。核心变化是接入了 Hy3 大模型,不再只输出文字稿,而是能根据对话直接生成符合场景的回复或总结,实现“语音到行动”的闭环。

实测数据看下来,这个模型在 WER(字数错误率)上确实达到了行业顶尖水平。中文、英语、粤语的 WER 分别为 3.34%、2.62% 和 3.12%,综合准确率约 97%。自建评测集覆盖了通用识别、10 多种方言、语境语义理解、专业术语,以及高噪、耳语等复杂声学场景。即便在高噪声和耳语这种极端环境下,WER 依然保持在行业领先位置。

技术架构上做了全链路优化。底层基座直接换成了 Hy3 大模型,配合混合专家网络(MoE)保证推理效率。声学特征提取部分,用自研的无监督编码器基于数千万小时语音数据训练,大幅提升了特征提取能力。训练策略分两步走:预训练阶段将语音编码器和 Hy3 联合训练,针对性增强方言识别和上下文感知;后训练阶段构建覆盖 20 多个方言区域的 SFT 数据集,并结合多阶段强化学习(RL)解决复杂场景下的识别错误和漏识问题。

这次发布有两点值得注意。一是语音识别行业正式进入“语义感知”时代,Hy ASR 3.0 强调的是“语音信号 – 语义理解 – 场景适配 – 智能回复”的完整链条,而不是传统的声学信号到文本映射。二是通过引入数千万小时数据和针对 20 多个方言区域的专项微调,在解决“方言难识”和“环境嘈杂”这两个行业痛点上取得了显著进展,WER 控制在 3% 以下的表现极具竞争力。

大模型赋能语音识别的必然性在这次升级里体现得很清楚。单纯依靠声学模型已经触及天花板,只有与大模型深度融合,才能赋予语音系统真正的“听懂人话”的能力,从而在客服、会议助手、车载交互等实时性要求高的场景中实现从“记录者”到“参与者”的角色转变。

火龙果频道