产品概述
Step-Audio是业内首款产品级开源语音交互模型,由阶跃星辰与吉利汽车集团联合研发,于2025年2月18日正式开源。基于130亿参数的多模态框架,它实现了语音理解与生成的统一,能够同时处理语音识别、语义理解、对话、语音克隆、音频编辑与合成等任务。在汉语水平考试六级评测中表现卓越,被誉为最懂中文的开源模型。
核心优势
**统一模型架构**:基于130亿参数的多模态模型,将语音理解与生成整合在一个框架内,无需串联多个独立模块,大幅降低延迟和复杂度,交互更流畅自然。
**情感与风格多样化**:支持按照场景需求生成生气、高兴、悲伤等不同情绪,粤语、四川话等方言,多语种,以及RAP、哼唱等歌声;还能定制个性化风格,精准调控语气和表现力,满足从严肃客服到娱乐互动的各种需求。
**高质量智能交互**:对话体验如同真人交谈般自然流畅,同时具备逻辑推理、创作、指令控制、语言理解、角色扮演及文字游戏等高级交互特性,让AI对话不再呆板。
适用场景
- **智能客服**:提供带有情绪和个性化的服务,提升用户满意度和亲和力。
- **有声阅读**:生成带有情感色彩的朗读,增强听书的沉浸感和代入感。
- **音视频创作**:自动为视频或动画角色生成配音,节省人工录制成本。
- **游戏NPC**:为游戏角色赋予自然流畅、风格多样的语音交互能力。
- **会议记录**:实时将语音转为文本,并支持语音反馈,提升会议效率。
- **教育辅助**:作为个性化教学助手,灵活调整教学风格和语气,适配不同学习者。