Tarsier

字节跳动开源的视频理解大模型,能生成详细描述、回答视频问题、定位事件时间,并有效减少AI幻觉。

Github 🆓 免费 🔓 开源
✨ 字节跳动出品,开源免费✨ 视频描述、问答、定位全能✨ Tarsier2性能超GPT-4o✨ 特有幻觉抑制优化✨ 支持多语言视频理解
🌐 访问官网 →

产品概述

Tarsier是字节跳动推出的一系列大规模视觉语言模型(LVLM),专门用于视频理解任务。它不仅能看懂视频,还能生成高质量的文字描述、回答用户关于视频内容的问题、精准定位事件发生的时间点,并且经过优化后大大减少了模型编造信息的现象。最新版本Tarsier2在预训练数据量、时间对齐精度和人类偏好优化上做了大幅升级,性能超越了GPT-4o和Gemini-1.5-Pro等主流模型。

核心优势