产品概述
Tarsier是字节跳动推出的一系列大规模视觉语言模型(LVLM),专门用于视频理解任务。它不仅能看懂视频,还能生成高质量的文字描述、回答用户关于视频内容的问题、精准定位事件发生的时间点,并且经过优化后大大减少了模型编造信息的现象。最新版本Tarsier2在预训练数据量、时间对齐精度和人类偏好优化上做了大幅升级,性能超越了GPT-4o和Gemini-1.5-Pro等主流模型。
核心优势
- **超强视频理解能力**:支持视频描述、问答、时间定位和幻觉测试等多种任务,覆盖从短片段到长视频的全面分析。Tarsier2在15个公开基准测试中都取得了新纪录,尤其在DREAM-1K基准上F1分数比GPT-4o高出2.8%。
- **减少幻觉,更可信**:通过直接偏好优化(DPO)训练和细粒度时间对齐,Tarsier2生成的描述更符合人类偏好,大幅降低虚假信息输出,适合对准确性要求高的场景。
- **多语言与开源友好**:支持多种语言的视频描述生成,并且代码、模型和数据集都在GitHub和HuggingFace上完全开源,方便开发者二次开发和集成。
适用场景
- **内容创作**:自动生成视频字幕、SEO描述,提升视频可访问性和搜索排名。
- **教育领域**:为教学视频提供详细内容描述,帮助学生快速理解复杂知识点。
- **视频监控与安全**:实时分析监控视频流,生成文字报告,辅助安全人员识别异常事件。
- **机器人/智能驾驶**:为指定任务生成步骤指令,或帮助车辆理解道路情况并做出决策。
- **社交媒体平台**:自动为用户生成视频标签和简介,增强用户体验。