Whisper语音识别模型

Whisper是OpenAI开源的语音识别模型,支持多语言音频转文字、语音翻译和语言识别,提供多种尺寸模型平衡速度和精度。

Github 🆓 免费 🔓 开源
✨ 开源免费,支持商用✨ 多语言识别与翻译✨ 五种模型尺寸可选✨ 准确率高,鲁棒性强✨ 多任务融合设计
🌐 访问官网 →

产品概述

Whisper是OpenAI开发并开源的多任务语音识别模型,在大量多语言音频数据集上训练而成。它不仅支持将语音转换为文字,还能执行语音翻译(如将非英语语音翻译为英语)和语言识别。Whisper提供了五种不同尺寸的模型,从tiny到large,用户可以根据速度和准确性需求灵活选择,同时还推出了仅支持英语的四种模型变体,进一步优化了性能。该模型完全免费且开源,可在GitHub上获取代码和预训练权重。

核心优势