OpenAI发布新一代语音模型，让AI智能体语音表达更自然

业界

2025

03/21

14:01

IT之家

3月21日消息，OpenAI昨日（3月20日）发布博文，宣布推出语音转文本（speech-to-text）和文本转语音（text-to-speech）模型，提升语音处理能力，支持开发者构建更精准、可定制的语音交互系统，进一步推动人工智能语音技术的商业化应用。

在语音转文本模型上，OpenAI主要推出了gpt-4o-transcribe和gpt-4o-mini-transcribe两个模型，官方表示在单词错误率（WER）、语言识别和准确性上超越现有Whisper系列。

这两个模型支持超100种语言，主要通过强化学习和多样化高质量音频数据集训练，能捕捉细微语音特征，减少误识别，尤其在嘈杂环境、口音及不同语速下表现更稳定。

在文本转语音上，OpenAI最新推出了gpt-4o-mini-tts模型，开发者通过“模拟耐心客服”或“生动故事叙述”等指令，控制语音风格，可以应用于客服（合成更具同理心的语音，提升用户体验）和创意内容（为有声书或游戏角色设计个性化声音）方面。

IT之家援引博文介绍，附上三款模型费用如下：

gpt-4o-transcribe：音频输入每100 万tokens费用6美元、文本输入每100万tokens费用2.5美元，输出每100万tokens费用10美元，每分钟成本0.6美分。

gpt-4o-mini-transcribe：音频输入每100万tokens费用3美元、文本输入每100万tokens费用1.25美元，输出每100万tokens费用5美元，每分钟成本0.3美分。

gpt-4o-mini-tts：每100万tokens输入费用为0.60美元，每100万tokens输出费用为12美元，每分钟成本1.5美分。

【来源：IT之家】

THE END

广告、内容合作请点击这里寻求合作

OpenAI

免责声明：本文系转载，版权归原作者所有；旨在传递信息，不代表砍柴网的观点和立场。

北京时间3月19日，据彭博社报道，OpenAI规模为1000亿美元的“星际之门”基础设施计划的首个数据中心综合体可容纳多达40万个英伟达强大AI芯片。

业界

北京时间3月17日，百度在上周日发布了文心大模型4.5和推理模型X1，再次引起了美国媒体对于大模型成本的关注。

业界

3月12日消息，据报道，OpenAI发布了专为构建AI Agents设计的新工具和API。

业界

北京时间3月12日，据路透社报道，OpenAI在周二推出了新的开发者工具，帮助开发者利用几个应用程序接口(API)构建先进的AI代理，以应对来自中国AI创业公司日益激烈的竞争。

业界

3 月 10 日消息，在 AI 时代如何证明你才是人类？OpenAI 创始人萨姆・奥尔特曼的新初创公司 World Network 希望探寻这个问题的答案。

业界