Loading...

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

GoodNav 3 月 21 日消息,OpenAI 于昨日(3 月 20 日)发表博文,宣布推出新的语音转文本(speech-to-text)和文本转语音(text-to-speech)模型,以增强其语音处理能力,帮助开发者创造更加精准和可定制的语音交互系统,进而促进人工智能语音技术的商业化应用。

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

在语音转文本模型方面,OpenAI 推出 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 两个新模型,官方表示这两个模型在单词错误率(WER)、语言识别及准确性方面超越了现有的 Whisper 系列。

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

这两个模型支持超过 100 种语言,主要通过强化学习与多样化的高质量音频数据集进行训练,能够捕捉细微的语音特征,降低误识别率,尤其在噪声环境、不同口音及语速下表现更加稳定。

在文本转语音方面,OpenAI 最新发布的 gpt-4o-mini-tts 模型,开发者可以通过“模拟耐心客服”或“生动故事叙述”等指令控制语音风格,此技术可应用于客服(合成更具同理心的语音,提升用户体验)以及创意内容(为有声书或游戏角色设计个性化声音)等领域。

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

根据博文的介绍,以下是三款模型的费用:

  • gpt-4o-transcribe:音频输入每 100 万 tokens 费用为 6 美元,文本输入每 100 万 tokens 费用为 2.5 美元,输出每 100 万 tokens 费用为 10 美元,每分钟成本为 0.6 美分。

  • gpt-4o-mini-transcribe:音频输入每 100 万 tokens 费用为 3 美元,文本输入每 100 万 tokens 费用为 1.25 美元,输出每 100 万 tokens 费用为 5 美元,每分钟成本为 0.3 美分。

  • gpt-4o-mini-tts:每 100 万 tokens 输入费用为 0.60 美元,每 100 万 tokens 输出费用为 12 美元,每分钟成本为 1.5 美分。

© 版权声明

相关文章

暂无评论

您必须登录才能参与评论!
立即登录
暂无评论...