PromptBench

微软开源的LLM评估库,提供统一接口进行模型性能测试、提示工程和对抗性攻击分析。

writing 🆓 免费 🔓 开源
✨ 统一接口快速评估LLM性能✨ 内置多种提示工程方法✨ 支持黑盒对抗性攻击模拟✨ 动态生成测试样本防数据污染✨ 开源可扩展,社区友好
🌐 访问官网 →

产品概述

PromptBench 是微软推出的统一评估框架,专为大型语言模型(LLM)设计。它整合了提示构建、数据集加载、模型评估、对抗性攻击模拟和动态测试协议等关键模块,帮助研究人员和开发者快速评估模型能力、鲁棒性及泛化性。

核心优势