科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型

互联网
2026
09/16
17:02
分享
评论

9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。

Spark-Audio-1.0-Preview支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,覆盖99种语言及202种方言识别,使智能语音完成从“听清”到“听懂”的跃升。

在训练数据量仅相当于同尺寸模型Qwen3.5-omni-Flash十分之一的情况下,Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在偏真实应用类任务上明显领先,与尺寸更大的闭源语音基座模型效果接近。Spark-Audio-1.0-Preview整体上在多语言、多方言、复杂场景下的高噪声和小音量任务中有更好的表现。

据了解,作为业界首个基于全国产算力训练的语音基座大模型,Spark-Audio-1.0-Preview通过音频编码器预训练,逐步扩展音频编码器的表征能力;再通过预训练和后训练,提升了模型的基础能力、复杂场景泛化性以及多个任务效果。

目前,Spark-Audio-1.0-Preview正式开放体验,API后续将上线讯飞开放平台;基于Spark-Audio-1.0-Preview语音基座大模型,科大讯飞还将在近期陆续展开一系列语音相关大模型的发布和升级。

THE END
广告、内容合作请点击这里 寻求合作
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

相关推荐

1
3