废话不多说,直接上图:
各大模型对比

从上图可以看出:

  • gpt-3.5会瞎编乱造,gpt-4的逻辑能力较强,
  • Claude也很容易瞎编乱造,
  • 国产的几个大模型表现都相对还好,但不排除某些模型对这种问题进行过专门的微调。

图片截图自网站谷流仓guliucang.com, 欢迎访问

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐