Voice Engine - OpenAI公布的AI语音合成和声音克隆模型（ai智能语音合成）

Voice Engine是什么

Voice Engine是OpenAI最新公布的一项AI语音合成和声音克隆技术，能够利用简短的15秒音频样本和文本输入，生成接近原声的自然听起来的语音。该项技术自2022年底开发以来，已经被应用于OpenAI的文本到语音API和ChatGPT的语音功能中。Voice Engine的应用前景广泛，包括为儿童和非读者提供阅读辅助、翻译内容以触及全球听众、支持非言语交流者、帮助恢复患者的声音等。同时，为确保技术的安全使用，OpenAI制定了严格的使用政策，防止声音冒充，并采取了包括水印追踪在内的多项安全措施。

官方博客介绍：https://openai.com/blog/navigating-the-challenges-and-opportunities-of-synthetic-voices

Voice Engine的应用场景和案例

教育与阅读辅助：Voice Engine可以为儿童和非读者提供自然听起来的语音，帮助他们更好地接触和理解书面内容。例如，教育技术公司Age of Learning利用这一技术生成预设脚本的语音内容，并与GPT-4结合，创造实时、个性化的互动响应，以提高学生的学习体验。内容翻译与全球化：通过Voice Engine，视频和播客等内容可以被翻译成听众的母语，同时保留原始说话者的口音，使得创作者和企业能够以更加地道和亲切的方式触及全球听众。例如，AI视觉叙事平台HeyGen使用Voice Engine进行视频翻译，使其内容能够跨越语言障碍，触及更广泛的受众。改善偏远地区的服务提供：Voice Engine能够通过提供本地语言的服务，改善偏远社区的基本服务，如健康咨询等。Dimagi公司正在开发工具，使用Voice Engine和GPT-4为社区卫生工作者提供互动反馈，帮助他们提高技能。支持言语残障人士：对于有交流障碍的个体，Voice Engine可以提供独特且非机械性的声音，使他们能够通过增强和替代通讯（AAC）设备进行交流。Livox公司就是利用这一技术，为其用户提供多种语言的自然听起来的声音，让他们能够更好地表达自己。恢复患者的声音：对于那些因疾病或神经问题而失去语言能力的患者，Voice Engine可以帮助他们恢复或重建自己的声音。例如，Norman Prince Neurosciences Institute正在探索如何使用Voice Engine帮助因肿瘤或神经原因导致语言障碍的个体。

Voice Engine的音频示例

1. 音频翻译

参考英文音频

生成的中文音频

2. 患者声音恢复

患者原声

参考音频

生成音频

如何使用Voice Engine

Voice Engine目前还处于小规模预览阶段，并没有广泛发布。OpenAI正在通过与一小部分可信赖的合作伙伴进行私下测试，以更好地理解这项技术的可能用途，并且根据这些小规模测试的结果和收到的反馈，来决定如何以及是否在未来更广泛地部署这项技术。

因此，目前Voice Engine并没有对公众开放在线使用。OpenAI采取了谨慎的态度，以确保在推广这项技术的同时，能够充分考虑到其潜在的滥用风险，并制定相应的安全措施和使用政策。未来，OpenAI可能会根据测试结果和社会发展的需要，决定是否将Voice Engine提供给更广泛的用户群体。