Step-Audio

阶跃星辰与吉利汽车联合打造的开源语音交互模型,130亿参数统一处理理解与生成,支持情绪、方言、歌声等多样表达,被誉为最懂中文的模型。

Github 🆓 免费 🔓 开源
✨ 业内首款产品级开源语音交互模型✨ 130亿参数统一理解与生成✨ 支持情绪、方言、歌声等多样表达✨ 汉语水平考试六级评测表现出色✨ 与吉利汽车联合研发,开源可商用
🌐 访问官网 →

产品概述

Step-Audio是业内首款产品级开源语音交互模型,由阶跃星辰与吉利汽车集团联合研发,于2025年2月18日正式开源。基于130亿参数的多模态框架,它实现了语音理解与生成的统一,能够同时处理语音识别、语义理解、对话、语音克隆、音频编辑与合成等任务。在汉语水平考试六级评测中表现卓越,被誉为最懂中文的开源模型。

核心优势

**统一模型架构**:基于130亿参数的多模态模型,将语音理解与生成整合在一个框架内,无需串联多个独立模块,大幅降低延迟和复杂度,交互更流畅自然。 **情感与风格多样化**:支持按照场景需求生成生气、高兴、悲伤等不同情绪,粤语、四川话等方言,多语种,以及RAP、哼唱等歌声;还能定制个性化风格,精准调控语气和表现力,满足从严肃客服到娱乐互动的各种需求。 **高质量智能交互**:对话体验如同真人交谈般自然流畅,同时具备逻辑推理、创作、指令控制、语言理解、角色扮演及文字游戏等高级交互特性,让AI对话不再呆板。

适用场景