SenseVoice

阿里通义实验室的多语言音频基础模型,能精准识别语音、情感和事件,速度比Whisper快15倍,还支持零样本语音克隆。

voice 🆓 免费 🔓 开源
✨ 支持50+语言,混合语言识别✨ 推理速度比Whisper快15倍✨ 精准识别情感和音频事件✨ 开源可商用,微调部署便捷✨ 阿里通义实验室出品,实力背书
🌐 访问官网 →

产品概述

SenseVoice是阿里通义实验室FunAudioLLM框架下的多语言音频基础模型,专注于高精度的语音识别、情感识别和音频事件检测。它经过超40万小时数据训练,支持50多种语言,在中文和粤语等语种上表现尤为出色。不仅如此,SenseVoice还能混合语言处理、控制音色和情感,在零样本语音生成、跨语言克隆和指令跟随方面也展现出强大能力。

核心优势