DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这是为什么?
导语: 专知智库通过跑分与认证的对比实证发现:DeepSeek R1的MMLU 90.8分、GSM8K 97.3分、MATH 90.2分,跑分全面高于GPT-4o;但DeepSeek R1的认证等级为L3至L4,GPT-4o的认证等级为L4。DeepSeek R1的认证等级低于GPT-4o。这一差异的深层原因是什么?
正文:
结构性原因一:环境适应性差异。 DeepSeek R1的环境适应性为L3,GPT-4o的环境适应性为L4。DeepSeek R1以文本为主,多模态有限;GPT-4o原生多模态,支持文本、图像、音频。DeepSeek R1的环境适应性不如GPT-4o。
结构性原因二:决策自主性差异。 DeepSeek R1的决策自主性为L3,GPT-4o的决策自主性为L3至L4。DeepSeek R1推理强,但工具调用有限;GPT-4o Agent模式,工具调用完善。DeepSeek R1的决策自主性不如GPT-4o。
结构性原因三:人机协作度差异。 DeepSeek R1的人机协作度为L3,GPT-4o的人机协作度为L3。两者的人机协作度相同,但GPT-4o的安全对齐持续改进,DeepSeek R1的安全对齐也在改进。
差异的启示。 DeepSeek R1跑分高于GPT-4o,但认证等级低于GPT-4o——这一差异的启示是:跑分高不等于认证高。跑分测试的是“知识+推理”,认证测试的是“能力+信任+责任”。DeepSeek R1的跑分极高,说明DeepSeek R1在“知识+推理”上极强;但DeepSeek R1的认证等级只有L3至L4,说明DeepSeek R1在“能力+信任+责任”上还有短板。
跑分与认证的差异,正是AI技能认证的独立价值所在。跑分测“知道什么”,认证测“能不能信”。跑分是“考试”,认证是“上岗证”。两者是互补关系,不是替代关系。





