腾讯混元于2026年8月6日正式发布Hy ASR 3.0预览版语音识别模型,并已在腾讯元宝应用程序中全面开放,所有用户均可免费使用。
该模型基于Hy3基座大模型,首次实现声学建模与语义理解的深度融合,突破传统语音识别仅依赖声学特征进行机械转写的局限,在多方言口音、高噪声环境、远距离拾音等复杂条件下,仍能持续输出高准确率文本。
模型已覆盖全国十大方言区及二十余种细分方言,包括粤语、吴语、西南官话、中原官话等主流方言口语,支持用户以自然语态直接对话,无需刻意调整为标准普通话发音。
无论是日常闲谈,还是用家乡话口述文案,系统均能准确识别并理解语义。例如,在烹饪过程中以粤语询问某种调料的配比,模型不仅能识别语音内容,还能结合上下文准确解析意图并给出相应反馈,省去人工转译方言为普通话的中间环节。
技术底层融合Hy3大语言模型能力,使语音识别不再停留于字面转写,而是具备上下文感知能力:可自动校正同音词歧义,动态匹配领域热词与专业表达,显著提升语义连贯性与实用性。
实测数据显示,该模型在普通话识别任务中的词错误率为3.34%,粤语为3.12%,英语为2.62%,整体精度位居当前行业前列。
架构层面采用自主研发的无监督语音编码器,并整合Hy3的上下文纠错机制,可依据对话前后文智能修正同音混淆、模糊发音等误判问题;同时针对厨房背景噪音、户外交通声、多人交谈等典型干扰场景进行了专项降噪优化,对长时音频录制、低音量耳语以及远距离收音等挑战性输入,亦能保持转写结果的完整性与连贯性。
普通用户只需在元宝App的对话界面长按语音输入按钮,即可即时启用全新识别功能;企业开发者可通过云服务平台调用Hy ASR 3.0预览版商用API,广泛适配智能客服响应、会议录音实时转写、车载语音交互、短视频自动字幕生成等多元应用场景;腾讯内部多款生产力工具,如WorkBuddy,也正有序推进模型集成与功能升级。

评论
更多评论