YOLO-World

腾讯AI实验室推出的实时开放词汇目标检测工具,无需训练即可识别从未见过的物体,速度比同类快20倍,准确率领先。

Github 🆓 免费 🔓 开源
✨ 零样本检测,无需训练认出新物体✨ 速度比 GroundingDINO 快 20 倍✨ LVIS 零样本评估达 35.4 AP✨ 同时支持目标检测与实例分割✨ 腾讯 AI 实验室开发,开源可用
🌐 访问官网 →

产品概述

YOLO-World 是腾讯 AI 实验室开发的新一代 YOLO 检测器,专为实时开放词汇目标检测设计。它在海量视觉语言数据集(如 Objects365、GQA、Flickr30K 和 CC3M)上预训练,获得了强大的零样本泛化能力。只需输入类名文本提示,模型就能自动在图像中定位并识别目标,即使这些物体从未在训练中出现过。它同时支持开放词汇实例分割,可广泛应用于物体检测与分割任务。

核心优势

YOLO-World 在速度和准确性上均超越现有方法。在 LVIS 数据集零样本评估中达到 35.4 AP,在 V100 GPU 上的处理速度达到 52.0 FPS,比 GroundingDINO 快约 20 倍。这得益于其大规模视觉-语言联合学习,让模型既理解视觉特征又理解语言描述,从而能够根据上下文线索识别全新类别的物体。无需额外训练即可部署,极大降低了使用门槛。 此外,YOLO-World 的场景适应性极强,无论是复杂背景还是小目标都能保持高准确率。其最先进的性能已刷新 LVIS 对象检测数据集的多项记录。

适用场景