Janus-Pro

DeepSeek开源的统一多模态模型,既能文生图又能理解图像,性能超越DALL·E 3,支持消费级GPU本地运行。

image 🆓 免费 🔓 开源
✨ 文生图+图像理解统一模型✨ 超越 DALL·E 3 和 Stable Diffusion✨ 解耦视觉编码技术避免任务冲突✨ 消费级 GPU 即可本地运行✨ MIT 开源可商用
🌐 访问官网 →

产品概述

Janus-Pro 是由 DeepSeek 推出的开源多模态理解和生成模型,基于自回归框架设计。它通过解耦视觉编码路径,将“理解”与“生成”任务独立处理,解决了传统统一模型在两类任务中的冲突问题。模型基于 DeepSeek-LLM 底座(1.5B/7B),采用 SigLIP-L 视觉编码器,输入分辨率 384×384,并在 7200 万张合成图像上预训练,显著提升生成质量与稳定性。

核心优势