FireRedASR

小红书开源的语音识别模型,中文普通话字错误率仅3.05%,支持方言、英语和歌词识别,还兼顾高精度与效率。

Github 🆓 免费 🔓 开源
✨ 中文ASR新SOTA,字错误率仅3.05%✨ 8.3B大模型极致精度,1.1B小模型高效推理✨ 支持方言、英语及复杂歌词识别✨ 多场景词错率比商业ASR低23.7%~40%✨ 完全开源,训练代码与模型权重均可获取
🌐 访问官网 →

产品概述

FireRedASR 是小红书 FireRed 团队于2025年2月发布并开源的大模型语音识别系统。它包含两个核心版本:FireRedASR-LLM(8.3B参数)追求极致准确率,在多个中文测试集上字错误率(CER)低至3.05%,刷新了中文ASR的SOTA纪录;FireRedASR-AED(1.1B参数)则在保证高精度的前提下大幅提升推理速度,CER为3.18%却优于当时12B参数的竞品。模型基于Encoder-Adapter-LLM框架,结合Qwen2-7B大模型通过LoRA微调实现端到端语音交互,已全部在GitHub开源。

核心优势

**精度与效率双赢**:LLM版本专注离线高精度场景(如专业字幕),AED版本适合实时交互(如直播字幕、语音助手),两者均超越同期主流商业ASR服务,相对错误率降低23.7%~40.0%。 **多语言与多场景适应**:不仅完美支持普通话,在中文方言、英语甚至复杂歌词识别上也有显著提升(歌词识别CER相对降低50%~66%)。在短视频、直播、语音输入等日常场景表现稳定,抗噪声能力强。 **开源且易二次开发**:模型权重、训练代码及推理脚本全部开放,基于工业级设计,社区可快速微调或部署到自己的业务中。LLM训练时冻结大部分参数,仅更新编码器和适配器,降低了定制门槛。

适用场景