搜索

高企税务稽查风险企检  团体标准制定

 

全球OPC持续商业服务平台 | 专知智库定义者思想白皮书定制 | 颠覆性创新技术设计(容度原理)

 (028)84400310    84321718   83359819   

DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这是为什么?

浏览: 发表时间:2026-09-29 11:46:12

DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这是为什么?

导语: 专知智库通过跑分与认证的对比实证发现:DeepSeek R1的MMLU 90.8分、GSM8K 97.3分、MATH 90.2分,跑分全面高于GPT-4o;但DeepSeek R1的认证等级为L3至L4,GPT-4o的认证等级为L4。DeepSeek R1的认证等级低于GPT-4o。这一差异的深层原因是什么?

正文:

结构性原因一:环境适应性差异。 DeepSeek R1的环境适应性为L3,GPT-4o的环境适应性为L4。DeepSeek R1以文本为主,多模态有限;GPT-4o原生多模态,支持文本、图像、音频。DeepSeek R1的环境适应性不如GPT-4o。

结构性原因二:决策自主性差异。 DeepSeek R1的决策自主性为L3,GPT-4o的决策自主性为L3至L4。DeepSeek R1推理强,但工具调用有限;GPT-4o Agent模式,工具调用完善。DeepSeek R1的决策自主性不如GPT-4o。

结构性原因三:人机协作度差异。 DeepSeek R1的人机协作度为L3,GPT-4o的人机协作度为L3。两者的人机协作度相同,但GPT-4o的安全对齐持续改进,DeepSeek R1的安全对齐也在改进。

差异的启示。 DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这一差异的启示是:跑分高不等于认证高。跑分测试的是“知识+推理”,认证测试的是“能力+信任+责任”。DeepSeek R1的跑分极高,说明DeepSeek R1在“知识+推理”上极强;但DeepSeek R1的认证等级只有L3至L4,说明DeepSeek R1在“能力+信任+责任”上还有短板。

跑分与认证的差异,正是AI技能认证的独立价值所在。跑分测“知道什么”,认证测“能不能信”。跑分是“考试”,认证是“上岗证”。两者是互补关系,不是替代关系。


DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这是为什么?
DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这是为什么?导语: 专知智库通过跑分与认证的对比实证发现:DeepSeek R1的MM
长按图片保存/分享
0
海松知识产权服务

Copyright©2026

成都专知利乎数字科技有限公司
蜀ICP备13001814号-3

科创定位是战略资源  |    IPO更简单    |  数据场景服务  |    专利市值管理

    电话:+86(028)84400310           地址:成都市·天府新区

©2026 成都专知利乎数字科技有限公司  蜀ICP备13001814号-3

热线电话
028-84400310
上班时间
周一到周五
二维码
微信咨询
添加微信好友,详细了解产品
使用企业微信
“扫一扫”加入群聊
复制成功!
添加微信好友,详细了解产品
我知道了