OpenAI 近日发布了两款全新的语音转文字模型——GPT Transcribe 和 GPT Live Transcribe。前者主要面向录音文件处理和批量转录任务,后者则适用于直播字幕、电话会议等实时场景。这是 OpenAI 在语音识别领域的一次重要产品更新。
正文解读
两款模型在识别能力上做了针对性优化,能够结合录音的主题、关键词和语言提示进行分析,重点提升了短句、数字、专业术语、多口音以及嘈杂环境下的识别准确率。这意味着在会议记录、采访整理、客服质检等实际应用中,识别效果将更加可靠。
据 Artificial Analysis 的测试数据,GPT Transcribe 的词错误率降至 3.31%,相比上一代 GPT-4o Transcribe 降低了 0.7 个百分点,提升幅度较为明显。与此同时,价格也下调了 25%,目前每 1000 分钟音频的收费为 4.5 美元,进一步降低了企业级语音转录的使用门槛。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/205853/



