天津大学发布《大模型评测报告》,GPT-4 和百度文心一言排名领先
巴比特讯,8 月 12 日,天津大学和信创海河实验室举办“大模型技术与评测研讨会”,会上天津大学发布首份《大模型评测报告》,对国内外主流的 14 个大语言模型进行中文综合能力评测,结果显示,GPT-4 和百度文心一言相较于其他模型综合性能显著领先,两者得分相差不大,处于同一水平。
据了解,参与本次评测的大模型包括 GPT-4、ChatGPT gpt-3.5-turbo、Claude-instant、Sage gpt-3.5-turbo 等国外大模型,以及百度文心一言、阿里通义千问、讯飞星火认知大模型、ChatGLM-6B、360 智脑、MOSS-16B、MiniMax、baichuan-7B 等国产大模型。评测使用一套涵盖知识问答、语言表达、逻辑推理、常识问答、文本问答、机器翻译等不同领域知识、包含多种题型的中文综合性试题,通过多维度得分结果,清楚了解不同模型的擅长领域和综合能力优劣。