硬核测试:我用DeepSeek的8B与7B的核心较量,谁是最厉害的模型

近年来,大型语言模型(LLM)发展迅速,尤其是国产的AI,DeepSeek系列(包括DeepSeek R1、DeepSeek V3、DeepSeek Coder V2、DeepSeek VL、DeepSeek V2、DeepSeek Coder、DeepSeek Math、DeepSeek LLM)均为业界翘楚。本文将从测试和性能两方面,对DeepSeek R1 生成的7B和8B进行较量。
部署方面了解: DeepSeek则提供了更为灵活的部署方案,既支持云端部署,也支持本地部署,这为用户提供了更大的自主性和灵活性,尤其适用于对数据安全和隐私有较高要求的场景。
然而,本地部署需要用户具备一定的技术能力,并承担相应的硬件和维护成本。
PS:我看了看我腾讯云(良心云)的服务器,服务器木有显卡,么得筏子了(没有办法了)。所以:本次演示以云端API调用为例。
注:deepseek API费用如下:

本次测试使用云端API。目前DeepSeek API资源紧张,暂时停止服务,故使用其他API进行测试,例如硅基流动,其提供大量模型可供测试,无需本地部署。本文选取免费的8B和7B版本进行对比。

有大量模型可以测试,无需自己部署,这里找到i按免费的8B或者7B版本,

对比8B和7B
DeepSeek-R1-Distill-Llama-8B 是基于 Llama-3.1-8B 开发的蒸馏模型。该模型使用 DeepSeek-R1 生成的样本进行微调,展现出优秀的推理能力。在多个基准测试中表现不俗,其中在 MATH-500 上达到了 89.1% 的准确率,在 AIME 2024 上达到了 50.4% 的通过率,在 CodeForces 上获得了 1205 的评分,作为 8B 规模的模型展示了较强的数学和编程能力
DeepSeek-R1-Distill-Qwen-7B 是基于 Qwen2.5-Math-7B 通过知识蒸馏得到的模型。该模型使用 DeepSeek-R1 生成的 80 万个精选样本进行微调,展现出优秀的推理能力。在多个基准测试中表现出色,其中在 MATH-500 上达到了 92.8% 的准确率,在 AIME 2024 上达到了 55.5% 的通过率,在 CodeForces 上获得了 1189 的评分,作为 7B 规模的模型展示了较强的数学和编程能力 对
性能方面: 两者的性能差异主要体现在模型规模、响应速度和生成文本质量几个方面。7B明显要比8B快很多,但是吧结果让人爆炸。
测试内容一:以“什么值得买”为题作诗。8B模型理解为购买建议,而7B模型生成一首合格的诗歌。

好了,不得不提另一个经典测试,鸡兔同笼:
问:一个笼子,里头有鸡和兔子,一共有25个头和76只脚,请问笼子里边鸡和兔子各有多少只?
结果:7B已经给出答案,而8B仍在思考。但是吧,8B这里解释有些冗余,

计算结果和时间:
7b输出结果:tokens: 487, speed: 44.38 tokens/s
8B输出结果:「tokens: 1302, speed: 35.81 tokens/s」
性能方面:两者性能差异主要体现在模型规模、响应速度和生成文本质量。7B模型明显比8B模型速度快,不考虑性能的话,还是老版本略胜一筹。

第三次测试:写一个Linux环境的python脚本,要求登陆微信,自动在指定的微信群里留言签到。

测试结果:8B直接挂了,BUG出现了,模型请求出错!!!且不论7B对不对,但是流程思路是正确的。
第四次测试:你是个运维高手,在Windows环境下,把Windows系统的报错日志,每天下午7点发送给我指定的邮箱,要求日志是递增模式
下面是结果:

对比一下,8B结果用的是py,利用Smtplib发送,这个没毛病。而7B则是用outlook发送,结果如下。

结论:如果是运维,理论上用脚本自动执行的,不会再用脚本收集后再用邮件发送,所以,轮技术还是8B比7B强一些。
总结:
总而言之,测试数据进行更深入的评估和分析。 两者并非相互排斥,未来可能出现优势互补的应用模式。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
