在刚刚过去的2026世界人工智能大会开幕式上,《携手构建公正合理的全球人工智能治理体系》主旨讲话中深刻指出:“各国应当秉持以人为本、向上向善理念,让人工智能成为促进共同繁荣、维护共同安全的一个重要动力源,携手构建公正合理的全球人工智能治理体系。”
这一愿景,为AI的发展指明了方向。技术的“向上”探索,是突破极限、追求极致的硬实力;而技术的“向善”应用,则是普惠大众、消除鸿沟的暖温度。二者一体两面,共同构成了AI时代的核心价值。
云知声积极响应这一时代呼唤,近日全面完成U2-ASR与U2-TTS的多语种能力升级:ASR新增13种国际语言识别,TTS新增8种东南亚语言合成。至此,U2语音大模型已支持超100种中国方言及超15种国际语言。此次升级,不仅是云知声技术能力的又一次飞跃,更是对“智能向上”与“智能向善”理念的坚定实践。
01 智能向上:以技术突破,攀登语音能力新高峰
技术的“向上”,意味着持续挑战能力边界,并将前沿技术转化为稳定、高效、可规模化调用的基础设施。
过去,企业要构建一套覆盖多个国家和地区的多语种语音系统,往往需要分别采购、部署和维护多套模型,不仅成本高、周期长,也面临接口不统一、系统协同复杂、后期运维压力大等问题。
此次U2-ASR与U2-TTS多语种能力升级,正是为了打破这一技术壁垒,通过统一模型、统一接口与标准化服务,帮助企业更高效地构建全球化语音交互能力。
U2-ASR:统一模型,听懂世界
本次升级中,U2-ASR进一步拓展统一多语种联合建模架构,新增支持:
阿拉伯语、德语、西班牙语、法语、印尼语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、意大利语等13种国际语言。
针对不同语言在音素体系、发音节奏、语调规律及口音分布等方面的差异,U2-ASR通过统一联合建模,实现跨语言特征的协同学习与能力共享。
现在,企业只需接入一个模型、一套接口,即可处理不同语言的音频内容,无须分别部署和维护多套识别系统。
在统一测试口径下,U2-ASR与Whisper Large V3 Turbo、FunASR、Seed-ASR等业界代表性模型进行了对比评测,并分别验证了“显式传入语种标签”与“不传入语种标签”两类场景下的识别表现。

显式传入语种标签时:U2-ASR在13种语言工业级测试集上的平均字错率(CER)低至6.58%,12种语言CER低于8%,德语、西班牙语、印尼语、意大利语、越南语等5个重点语种更全部进入5%以内。
在图示的对比评测中,U2-ASR均取得最低CER,实现全线领先。其中,越南语CER低至3.01%,俄语和印尼语分别低至5.26%和3.41%,展现出覆盖不同语系的稳定识别优势。与FunASR 1.5、Seed-ASR、Whisper large-v3-turbo、Cohere transcribe、Qwen3-ASR-1.7B等模型相比,U2-ASR相较各语种表现最优的其他模型平均相对降错约30%;其中,越南语相对降错超过50%,俄语和印尼语分别降低约41%和37%,整体性能优势显著。
不传入语种标签时(更贴近真实业务):面对无标注的音频流,U2-ASR 凭借自动语种识别与闭集路由能力,依然保持高准确率,有效避免了语种误判和错误率飙升。在跨境客服、国际会议、多语种内容审核等场景下,企业无需前置语言分类,即可获得稳定、可靠的识别结果。
U2-TTS:自然发声,言说全球
如果说ASR解决的是“听懂用户”,那么TTS决定的,则是AI能否用用户熟悉的语言自然回应。
此次升级中,U2-TTS重点强化东南亚多语种语音合成能力,新增支持:
泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语等8种语言。
针对不同语言的发音规则、语调习惯、停顿节奏和韵律特征,U2-TTS进行了专项优化,让AI不仅能够“开口说”,还能够说得更加清晰、自然、流畅,更符合当地用户的语言习惯。
自然流畅,提升本地化交互体验:U2-TTS能够准确还原不同语言的发音特点、语调变化和表达节奏,为当地用户带来更加自然、亲切的语音交互体验。对于拓展海外业务的企业而言,本地化不再只是界面与文字内容的翻译,还可以进一步延伸至语音交互,让产品真正以当地用户熟悉的方式进行沟通。
流式架构,实现首包快速响应:U2-TTS采用流式神经网络声学模型,可逐chunk实时输出24kHz、16bit高保真语音。通过“边生成、边播放”的流式机制,模型能够有效降低首包等待时间,避免长文本全部生成后才能播放的问题,更好地满足实时语音对话、数字人驱动、智能客服、车载交互及智能终端等强时效场景的应用需求。
案例展示:U2-TTS多语种合成文本:Unisound 语音模型更新,欢迎体验
02 智能向善:以普惠初心,跨越语言数字鸿沟
技术的“向善”,不仅体现在能力有多强,更体现在技术能够服务多少人、覆盖多少场景,以及能否让更多国家、地区和语言群体共享人工智能发展成果。
长期以来,全球AI语音技术资源更多集中于中文、英文等大语种,部分发展中国家及语言资源相对有限的市场,仍面临训练数据不足、模型建设成本高、优质服务供给有限等问题。
云知声此次推进多语种能力升级,正是希望通过统一模型和标准化服务,让优质语音技术覆盖更多语言与用户,推动跨语言智能交互从“高门槛建设”走向“低门槛调用”。
开箱即用,让全球化语音能力触手可及
云知声将复杂的多语种AI能力,转化为标准化、开箱即用的MaaS(模型即服务)。 无论是跨境出海企业、智能硬件厂商,还是数字人、在线教育、智能客服及内容平台,均可通过标准API快速接入多语种ASR与TTS能力,显著缩短研发周期。企业无需再从零开始采集语料、训练模型或搭建底层系统,即可以极低的成本构建面向全球用户的智能语音应用,让技术真正转化为商业协作与产业发展的生产力。
让小语种被听见,让多元文化被看
语言不仅是信息传递的工具,也是文化与身份的重要载体。
当老挝语、柬埔寨语、缅甸语等语言也能够获得高质量的AI语音支持,技术所创造的价值,便不再局限于提升交互效率,也有助于推动不同语言与文化在数字世界中被听见、被理解、被保留。
从面向不同地区的智能教育,到跨境医疗沟通、公共服务与文化内容传播,多语种语音技术正在不断拓展AI普惠应用的边界,让智能服务触达更多地区和人群。
03 从“听见”到“回应”,打通全球语音交互闭环
从“百种方言”的本土深耕,到“全球多语种”的能力拓展,云知声正加快构建覆盖语音识别、理解与合成的完整能力矩阵。此次U2-ASR与U2-TTS的协同进化,彻底打通了多语种语音交互的“入口”与“出口”,形成了从“听见”、“听懂”到“回应”的完整闭环,为Agent时代的全球化交互奠定了坚实的语音基础。
技术的演进,最终应回归人的需求与福祉。让更多语言被AI准确理解,让全球用户都能听到自然、亲切的AI声音,正是云知声践行“智能向上”与“智能向善”的具体体现。通过不断深化普惠实践,云知声致力于消除语言壁垒,让前沿AI技术真正服务于全球用户的真实需求。
面向未来,云知声将不断突破技术极限,让智能语音成为跨越文化鸿沟、连接全球数字生态的核心纽带。作为中国AI企业的代表,云知声将持续以多语种交互能力共筑全球智能桥梁,促进跨语言交流与全球文化沟通,为推动世界数字经济的共同繁荣贡献中国智慧与力量。
立即体验,开启全球化语音交互新旅程
目前,完成多语种能力全面升级的U2-ASR 与 U2-TTS 已全量上线云知声TokenHub大模型服务平台,并开放标准API,支持开发者与企业根据业务需求灵活调用。
欢迎广大开发者、企业及个人用户登录平台,抢先体验
