以众包方式进行匿名随机对战的LLM基准平台
Chatbot Arena是一个大型语言模型 (LLM) 的基准平台,以众包方式进行匿名随机对战,该项目方LMSYS Org是由加州大学伯克利分校、加州大学圣地亚哥分校和卡内基梅隆大学合作创立的研究组织。
通过demo体验地址进入对战平台,输入自己感兴趣的问题,提交问题后,匿名模型会两两对战,分别生成相关答案,需要用户对答案做出评判,从4个评判选项中选择一个:模型A更好、模型B更好、平手、都很差。支持多轮对话。最终使用Elo评分系统对大模型的能力进行综合评估。(可以自己指定模型看效果,但不计入最终排名情况)。
Hugging Face推出的开源大模型排行榜单
由复旦大学NLP实验室推出的大模型评测基准
智源研究院推出的FlagEval(天秤)大模型评测平台
斯坦福大学推出的大模型评测体系
H2O.ai推出的基于Elo评级方法的大模型评估系统
中文通用大模型综合性测评基准