Hibiki

一款由Kyutai Labs开发的高保真实时语音翻译工具,支持法语和英语,能边听边译,像同声传译一样保留原声特点,同时输出语音和文字。

Github 🆓 免费 🔓 开源
✨ 保留原声语调与情感✨ 实时语音到语音翻译✨ 支持设备端离线运行✨ 智能适配不同口音✨ 多流架构同步处理
🌐 访问官网 →

产品概述

Hibiki是一款专注于实时语音翻译的高精度模型,由AI研究实验室Kyutai Labs推出。它采用创新的多流语言模型架构,能够同时处理源语言和目标语言的语音信号,实现语音到语音(S2ST)和语音到文本(S2TT)的无缝转换。不同于传统的分段式翻译,Hibiki在说话人讲完一句话的瞬间就能输出翻译结果,并且译后语音会保留原声的语调、情感和语速节奏,听起来非常自然。该模型还提供了轻量化版本Hibiki-M(17亿参数),可以在iPhone等移动设备上本地运行,无需联网即可完成实时翻译。

核心优势

Hibiki最大的亮点是对声音特征的保留能力。它不仅翻译语义,还能迁移说话人的语气、情感和音色,使得译后语音生动真实,克服了机器翻译常见的机械感。此外,Hibiki具备智能语速调节功能,能够根据源语言的内容��动调整翻译语音的语速,确保信息传达的准确性和流畅性。它的多流架构使得语音识别与翻译几乎同步完成,延迟极低,达到了同声传译级别的体验。对于不同口音(如英式英语、美式英语、印度英语等),Hibiki也能精准识别并正确翻译。

适用场景