VIMI大模型

商汤科技推出的首个可控人物视频生成AI,支持用动作、声音、文字驱动画中人物,生成稳定、长达一分钟的写实视频。

coding 🆓 免费
✨ 全球首个可控人物视频生成AI✨ 分钟级单镜头视频,画质不劣化✨ 多种驱动方式:动作/声音/文字✨ 精准控制表情及上半身肢体✨ 自动生成合理场景与光影变化
🌐 访问官网 →

产品概述

VIMI大模型是商汤科技基于日日新大模型技术研发的全球首个可控人物视频生成AIGC产品。用户只需上传一张或多张人物照片,即可通过动作视频、动画、语音、文字等多种方式驱动照片中的人物,生成与目标动作高度一致、画质稳定不衰减的分钟级单镜头人物视频。该模型在2024年世界人工智能大会(WAIC)上发布并荣获“镇馆之宝”称号。

核心优势

VIMI最突出的特点是**超强的人物可控性**。它不仅能精准控制面部表情(如微笑、眨眼),还能自然驱动上半身肢体动作,甚至自动补全合理的头发、服饰及背景变化,连光影效果都能随动生——这让生成的视频看起来和谐唯美,摆脱了早期AI视频的“鬼畜”感。 另一个关键突破是**长视频稳定性**。传统AI视频生成往往几秒后画面就开始模糊、抖动或失真,而VIMI能稳定生成长达一分钟的单镜头人物视频,且画面品质不随时间劣化。同时支持多种控制输入(视频、动画参数、语音、文字),让创作方式更灵活。

适用场景