阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型,让AI更好听懂专业词汇

业界
2026
07/31
17:23
IT之家
分享
评论

7 月 31 日消息,阿里巴巴今日发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash。简单来说,就是让 AI 更好地听懂专业词汇。

Qwen-Audio-3.0-ASR-Flash 主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。

研究团队持续从医疗、IT 编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的“听中率”都有明显提升,其中医疗场景更是突破了 95.36%。

阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型,让AI更好听懂专业词汇

目前,Qwen-Audio-ASR-Flash 系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到验证,曾在 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率拿下全球第一。

Qwen-Audio-3.0-ASR—— 现已通过阿里云百炼平台开放调用,提供三个版本:

Qwen-Audio-3.0-ASR-Flash:语音识别,最长 5 分钟

Qwen-Audio-3.0-ASR-Filetrans:离线文件转写

Qwen-Audio-3.0-ASR-Streaming:实时语音识别

【来源:IT之家】

THE END
广告、内容合作请点击这里 寻求合作
阿里
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

7 月 17 日消息,据《读佳》今日消息,阿里 ATH 事业群将推出 AI 音乐创作平台“HappyShrimp”,中文名“快乐虾米”,或主打一句话生成专属音乐。
业界
7月16日,据“申妈的朋友圈”消息,阿里ATH事业群旗下Token Foundry事业部进行架构调整,通义万相团队已被合并至阿里副总裁张迪负责的未来生活实验室。
业界
6月18日,据读佳消息,阿里千问团队将推出名为“千问输入法”的独立APP,产品已开发完成,即将上线各大应用商店。
业界
6月16日,阿里旗下桌面AI助理QoderWork正式上线“意识”功能,集成记忆、反思与技能进化三大模块。
业界
6月2日,今日凌晨,通义实验室正式发布Qwen3.7-Plus多模态智能体模型。
业界

相关推荐

1
3