AI大模型
腾讯混元发布语音识别模型 Hy ASR 3.0 preview 元宝已首发上线
腾讯混元今日发布了新一代语音识别模型 Hy ASR 3.0 preview。
官方表示,基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果,从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。
Hy ASR 3.0 preview 在多个开源评测集和自建评测集上整体表现领先。在开源评测集中,Hy ASR 3.0 preview 在多语种的 WER( Word Error Rate,词错误率)上都控制在 3% 左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%。

在自建评测集上,Hy ASR 3.0 preview 在通用识别、方言识别、上下文 Context 理解、专词理解、复杂声学场景(高噪、耳语)等场景化评测中,WER 也保持较低水平。

官方表示,元宝深度参与共研并已完成首发上线,用户打开元宝按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写等能力提升,语音输入更准、更稳,且免费开放;WorkBuddy 等产品也在陆续接入中。
目前 Hy ASR 3.0 preview 已上线腾讯云官网对外提供 API 服务,可广泛应用于智能客服、内容理解、语音搜索等场景。
IT人网附相关链接:
腾讯混元:https://aistudio.tencent.com/visual
腾讯云:https://cloud.tencent.com/document/product/1093/135476
相关阅读
-
Youtube 推出 AI 自动配音功能 支持中文及 27 种语言
在线视频平台Youtube昨日在其官方博客上宣布:基于AI的自动配音功能现已全面开放。IT人注:Youtube自动配音功能目前支持中文等27种主要语言,并为其中8种语言(英语、法语、德语、印地语、印
-
2025年深圳机器人产业年产值突破2400亿元同比增长20.56%
据深圳特区报,4月22日,《深圳市机器人产业发展白皮书(2025)》在FAIRplus2026机器人全产业链接会开幕式上发布。数据显示,2025年,深圳市机器人产业总产值达2426亿元,同比增长20.56%,创下历史
-
Claude 化身‘AI 华尔街之狼’狂赚 6 万串通与欺诈的趁火打劫
Claude,堪称AI界「老油条」。这不,沃顿商学院EthanMollick教授发现,ClaudeOpus4.6会自主决定「思考」时间。只要不涉及编程、数学的任务,哪怕是再难的问题,干活主打一个「偷工减料」。
-
阿里通义实验室推出PrismAudio声画同步的音频视频生成框架
阿里巴巴通义实验室今日发布了PrismAudio,这是一个视频生成音频(Video-to-Audio)框架,其研究重点是环境音/音效合成,比如马蹄声、风雨声、金属敲击声等与画面内容同步的背景声音,而不是


