产品概述
Moshi是由Kyutai实验室开发的全双工实时语音生成模型,采用多流Transformer架构。它突破了传统语音助手“听-想-说”的回合制模式,支持同时语音输入和输出,能处理重叠语音、打断等复杂对话动态。核心创新在于“内心独白”机制——在生成语音前预测文本标记,确保内容连贯;同时直接对语音信号建模,保留语气、情绪等非语言信息,避免传统ASR+TTS链路的信息丢失。
核心优势
- **全双工对话**:用户说话时即可回应,无需等待停顿。通过并行处理用户和系统两个音频流,实现类似人类的自然交互。
- **超低延迟**:理论延迟仅160毫秒,实际约200毫秒,接近人类对话反应速度。基于7B参数的Helium文本语言模型和神经音频编解码器Mimi,在单张L4或M3 Macbook Pro上即可实时运行。
- **情感保留**:直接处理语音而非中间文本,能识别并生成包含笑、叹气、声调变化等情感表达的语音,让AI对话更有温度。
适用场景
- 实时语音助手(如智能家居、车载系统)
- 客服机器人(需要打断、追问的复杂对话)
- 虚拟角色或游戏NPC的自然语音交互
- 语音翻译与同声传译(低延迟高保真)
- 无障碍辅助工具(如为听障人士提供实时语音反馈)