论各大模型逻辑能力的差距(GPT3.5,GPT4,Claude,文新一言,GeminiPro,通义千问)
·
废话不多说,直接上图:

从上图可以看出:
gpt-3.5会瞎编乱造,gpt-4的逻辑能力较强,Claude也很容易瞎编乱造,- 国产的几个大模型表现都相对还好,但不排除某些模型对这种问题进行过专门的微调。
图片截图自网站谷流仓guliucang.com, 欢迎访问
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)