产品概述
FireRedASR 是小红书 FireRed 团队于2025年2月发布并开源的大模型语音识别系统。它包含两个核心版本:FireRedASR-LLM(8.3B参数)追求极致准确率,在多个中文测试集上字错误率(CER)低至3.05%,刷新了中文ASR的SOTA纪录;FireRedASR-AED(1.1B参数)则在保证高精度的前提下大幅提升推理速度,CER为3.18%却优于当时12B参数的竞品。模型基于Encoder-Adapter-LLM框架,结合Qwen2-7B大模型通过LoRA微调实现端到端语音交互,已全部在GitHub开源。
核心优势
**精度与效率双赢**:LLM版本专注离线高精度场景(如专业字幕),AED版本适合实时交互(如直播字幕、语音助手),两者均超越同期主流商业ASR服务,相对错误率降低23.7%~40.0%。
**多语言与多场景适应**:不仅完美支持普通话,在中文方言、英语甚至复杂歌词识别上也有显著提升(歌词识别CER相对降低50%~66%)。在短视频、直播、语音输入等日常场景表现稳定,抗噪声能力强。
**开源且易二次开发**:模型权重、训练代码及推理脚本全部开放,基于工业级设计,社区可快速微调或部署到自己的业务中。LLM训练时冻结大部分参数,仅更新编码器和适配器,降低了定制门槛。
适用场景
- **专业媒体**:视频字幕生成、会议转写、长音频存档,需要高准确率。
- **实时互动**:直播字幕、语音助手、在线课堂,要求低延迟和合理算力。
- **创意内容**:歌词识别(翻唱、K歌应用)、方言转写、多语言内容理解。
- **智能设备**:语音输入法、智能家居控制、车载语音系统。