Moshi

一款全双工实时语音生成Transformer模型,能同时听和说,延迟低至160毫秒,直接处理语音保留情感与语气,让对话更自然。

voice 🆓 免费 🔓 开源
✨ 全双工对话,同时听和说✨ 极低延迟(160-200ms)✨ 直接语音到语音,保留情感✨ 内心独白机制提升语言质量✨ 处理打断、重叠等复杂场景
🌐 访问官网 →

产品概述

Moshi是由Kyutai实验室开发的全双工实时语音生成模型,采用多流Transformer架构。它突破了传统语音助手“听-想-说”的回合制模式,支持同时语音输入和输出,能处理重叠语音、打断等复杂对话动态。核心创新在于“内心独白”机制——在生成语音前预测文本标记,确保内容连贯;同时直接对语音信号建模,保留语气、情绪等非语言信息,避免传统ASR+TTS链路的信息丢失。

核心优势