产品概述
YOLO-World 是腾讯 AI 实验室开发的新一代 YOLO 检测器,专为实时开放词汇目标检测设计。它在海量视觉语言数据集(如 Objects365、GQA、Flickr30K 和 CC3M)上预训练,获得了强大的零样本泛化能力。只需输入类名文本提示,模型就能自动在图像中定位并识别目标,即使这些物体从未在训练中出现过。它同时支持开放词汇实例分割,可广泛应用于物体检测与分割任务。
核心优势
YOLO-World 在速度和准确性上均超越现有方法。在 LVIS 数据集零样本评估中达到 35.4 AP,在 V100 GPU 上的处理速度达到 52.0 FPS,比 GroundingDINO 快约 20 倍。这得益于其大规模视觉-语言联合学习,让模型既理解视觉特征又理解语言描述,从而能够根据上下文线索识别全新类别的物体。无需额外训练即可部署,极大降低了使用门槛。
此外,YOLO-World 的场景适应性极强,无论是复杂背景还是小目标都能保持高准确率。其最先进的性能已刷新 LVIS 对象检测数据集的多项记录。
适用场景
- 工业质检:实时检测生产线上的各类缺陷或异物,无需提前标注所有缺陷类型。
- 安防监控:自动识别从未见过的可疑物品或行为,提升预警能力。
- 自动驾驶:快速识别道路上的新障碍物或罕见交通标志。
- 图像搜索与标注:基于用户提供的自然语言描述,精准定位图片中的对应物体。
- 机器人抓取:让机器人根据语言指令即时识别并抓取任意形状的物件。