UP主硬核实测DeepSeek:性能堪比顶流,但“幻觉”与短板仍存

源自50位全网作者

02-12 07:33

近期,国产大模型厂商DeepSeek动作频频,接连发布了多款备受关注的新模型。与以往不同,许多技术爱好者和UP主在第一时间对这些新模型进行了深入的实测,从不同维度揭示了它们的亮点与待解的难题。

首先引起广泛讨论的是一款名为DeepSeek-OCR的视觉压缩模型。它提出的核心理念颇具颠覆性:利用视觉模态对文本信息进行高效压缩,即所谓的“上下文光学压缩”。简单来说,传统大模型处理长文本时,计算量会随着文本长度呈二次方级增长,这被称为“二次方诅咒”,导致处理长篇报告或书籍时成本高昂且效率低下。DeepSeek-OCR尝试了一条新路径,将长篇文本渲染成图像,再通过其特有的视觉编码器(DeepEncoder)将信息压缩成数量远少于原文的“视觉Token”。

UP主硬核实测DeepSeek:性能堪比顶流,但“幻觉”与短板仍存

实测数据显示,这一方法潜力巨大。在10倍的压缩比下,模型解码回文本的精度高达97%,几乎无损;即便在20倍压缩比下,准确率仍能维持在60%左右。在一些标准测试中,它仅用数百个视觉Token就超越了其他需要数千个Token的同类模型,展现了极高的效率。

然而,UP主们的实际体验也揭示了这一创新路径的挑战。有用户指出,虽然名为OCR模型,但它更像一个“科研型项目”,而非开箱即用的成熟软件。普通用户在部署时可能会遇到显存不足(OOM)、需要手动调参等问题。更核心的 সীমাবদ্ধता在于,压缩过程虽然保留了大部分语义信息,但牺牲了精确的空间位置信息。这导致在处理多栏布局、复杂表格等需要精确定位的文档时,模型容易出错,甚至产生“幻觉”,将不同栏目的内容错误地连接起来,生成看似流畅但逻辑错误的文本。一位UP主在测试手写和模糊文档时发现,模型会“脑补”出格式完美但内容完全虚假的文本,暴露了其在不确定情况下的“强制输出”倾向,这在需要高度保真的场景下可能比直接识别失败更危险。

UP主硬核实测DeepSeek:性能堪比顶流,但“幻觉”与短板仍存

尽管如此,仍有观点认为,DeepSeek-OCR的价值远超OCR本身。它展示了一种为AI构建全新记忆系统的可能性,这种记忆可以像人类一样“平滑衰减”:重要的、近期的信息用高分辨率(低压缩率)存储,久远的信息则用低分辨率(高压缩率)存储,实现一种可控的、渐进式的遗忘,这为未来AI智能体的记忆管理提供了极具想象力的思路。

与DeepSeek-OCR的架构创新不同,DeepSeek发布的另一系列新模型V3.2(包括V3.2-Exp实验版和V3.2-Speciale特别版)则是在现有路线上追求极致的效率与性能。其核心技术是“DeepSeek稀疏注意力机制”(DSA)。UP主们用通俗的语言解释了这一机制:传统注意力模型像是在嘈杂的聚会中必须听清每个人的发言,非常耗费精力;而稀疏注意力则像一个智能过滤器,能快速锁定几个关键的发言者进行精听,从而“抓大放小”,大幅降低了计算量和成本。

UP主硬核实测DeepSeek:性能堪比顶流,但“幻觉”与短板仍存

这一优化带来的最直接好处是API价格的大幅下调,部分调用成本降低了50%以上,让开发者能以更低廉的成本构建AI应用。在性能上,标准版V3.2在多个公开评测中被认为达到了与GPT-5相当的水平,而为探索性能极限而生的V3.2-Speciale版,在数学、编程等高难度推理任务上更是取得了媲美甚至超越顶尖闭源模型的成绩。

UP主们也对V3.2进行了多样化的实测。在物理模拟、3D粒子特效生成等任务中,它表现出色。在解答复杂的逻辑谜题时,它也能展现清晰的思考步骤。新版本还强化了“智能体(Agent)”能力,可以自主调用搜索、计算等工具来完成多步骤任务。不过,在一些对比测试中,它也并非全能冠军。例如,在生成SVG矢量图和复杂前端UI界面时,有评测显示其效果细节不如同期的其他国产模型。这说明,不同模型在不同场景下各有优劣,用户需要根据自己的具体需求进行选择。

一个有趣的发现是,在DeepSeek官方未作正式发布的情况下,有细心用户通过与模型的对话实测发现,其在线版本似乎已悄然更新。模型自称支持高达1M(一百万)Token的上下文长度,知识库也更新至了更近的日期。为了验证这一点,有用户向其输入了整部《简爱》乃至近百万字的《三体》三部曲全文,模型均在几分钟内完成了阅读和处理,并能正确回答基于全文内容的问题。这一“静默升级”展示了其在超长文本处理能力上的又一次飞跃。

通过UP主们的全方位实测,外界得以一窥DeepSeek新模型的真实面貌。无论是DeepSeek-OCR在架构上的大胆探索,还是V3.2系列在效率和性能上的扎实精进,都显示了其强大的技术创新能力。用户的测试既验证了这些模型在理论和评测数据之外的实用价值,也客观地指出了它们在实际应用中存在的短板和局限,为广大开发者和普通用户选择和使用这些前沿工具提供了宝贵的参考。

内容由AI生成

精选参考来源

1. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?更新,抛出几个观点大家一起讨论, 第一个, 文本Token数量压缩到视觉Token数量的10倍以内时,解码精度可达97%, 但是

2. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?前人讲得很好了,我来讲讲别的,记忆。这个模型最关键的地方,是论文里反复测试的压缩率和精度关系。10倍压缩时,精度高达97%,几乎

3. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?非常有意思的一个工作。因为DeepSeek-OCR看似是一个OCR模型,其实背后是想解决LLM的长下文本计算效率的问题。我们知道

4. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?首先说一下我的总体印象:这是一个「科研型」项目,有一些创新点是比较有趣的,比如「上下文光学压缩」(用二维图像作为文本的高效载体,

5. 一文搞懂DeepSeek稀疏注意力机制 #deepseek #人工智能 #ai#知识前沿派对

今年年初Deep-Seek R1横空出世的时候那个时候我们给大家讲了Deep-Seek的一个很大的一个创举就是MLAMulti-Hazard Latent Attention你也可以把它翻译成多头潜在

6. DeepSeek新出的V3.1大模型太懂国产AI痛点了!直奔“算力自由”去的,核心亮点一眼抓重点用UE8M0 FP8超低...

DeepSeek新出的V3.1大模型太懂国产AI痛点了!直奔“算力自由”去的,核心亮点一眼抓重点用UE8M0 FP8超低... DeepSeek新出的V3.1大模型太懂国产AI痛点了!直奔“算力自由”

7. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?稳坐开源AI-OCR最小模型第一王座!小模型根本没对手!强与省钱的AI-OCR是闭源Gemini-2.5-Flash-lite,

8. 如何评价2 月 11 日上线的 DeepSeek 新模型?

如何评价2 月 11 日上线的 DeepSeek 新模型? 刚刚,DeepSeek新模型已经在App以及Web端上更新了(每次都是悄悄更新,但是这次貌似API没有同步更新)。但是这次不是DeepSee

9. DeepSeek 刚刚发布了新模型——DeepSeek-V3.2-Speciale!从分数上看就是 DeepSeek-V...

DeepSeek 刚刚发布了新模型——DeepSeek-V3.2-Speciale!从分数上看就是 DeepSeek-V... DeepSeek 刚刚发布了新模型——DeepSeek-V3.2-Spe

10. 导致DeepSeek价格暴降,「稀疏注意力机制」,到底是个啥?

导致DeepSeek价格暴降,「稀疏注意力机制」,到底是个啥?导致DeepSeek价格暴降,「稀疏注意力机制」,到底是个啥?特大号1759975729 9月30日,DeepSeek发新版本了。大家

11. 实测智谱新GLM-4.6 VS DeepSeek V3.2-国产Claude,当之无愧

实测智谱新GLM-4.6 VS DeepSeek V3.2-国产Claude,当之无愧 实测智谱新GLM-4.6 VS DeepSeek V3.2-国产Claude,当之无愧人人都是产品经理17600

12. DeepSeek V3.2发布!实测效果惊艳,便宜是最大优势

DeepSeek V3.2发布!实测效果惊艳,便宜是最大优势 DeepSeek V3.2发布!实测效果惊艳,便宜是最大优势36氪1764734761 小雷发现,DeepSeek似乎真的很喜欢大晚上给大

13. DeepSeek V3.2正式发布:推理达GPT-5水平,智能体评测中开源模型最高水平

DeepSeek V3.2正式发布:推理达GPT-5水平,智能体评测中开源模型最高水平 DeepSeek V3.2正式发布:推理达GPT-5水平,智能体评测中开源模型最高水平澎湃新闻176459173

14. DeepSeek-V3.2 技术报告解读

DeepSeek-V3.2 技术报告解读 DeepSeek-V3.2 技术报告解读人人都是产品经理1764897937 开源大模型领域迎来重磅突破!DeepSeek 推理能力追平 GPT-5-High

15. DeepSeek-V3.2-Exp发布,且继续大降价[鼓掌][鼓掌][鼓掌]。我请DS通俗解释了一下技术亮点,ta讲得很...

DeepSeek-V3.2-Exp发布,且继续大降价[鼓掌][鼓掌][鼓掌]。我请DS通俗解释了一下技术亮点,ta讲得很... DeepSeek-V3.2-Exp发布,且继续大降价[鼓掌][鼓掌][鼓

16. 独家!DeepSeek新模型上线,全新注意力机制基于北大ACL最佳论文

独家!DeepSeek新模型上线,全新注意力机制基于北大ACL最佳论文 独家!DeepSeek新模型上线,全新注意力机制基于北大ACL最佳论文新智元1759147347 编辑:好困 定慧【新智元导读】

17. 实测Deepseek-V3.1的编程能力,对比Qwen3、GLM-4.5、Kimi-K2

实测Deepseek-V3.1的编程能力,对比Qwen3、GLM-4.5、Kimi-K2 实测Deepseek-V3.1的编程能力,对比Qwen3、GLM-4.5、Kimi-K2查尔的AI次方1756

18. DeepSeek又上新!模型硬刚谷歌,承认开源与闭源差距拉大

DeepSeek又上新!模型硬刚谷歌,承认开源与闭源差距拉大 DeepSeek又上新!模型硬刚谷歌,承认开源与闭源差距拉大第一财经1764595882 12月1日晚,DeepSeek又上新了两款新模型

19. DeepSeek-V3.2-Exp模型今天正式开源,这次最大的亮点是,用了稀疏Attention技术,说白了就是,模型变...

DeepSeek-V3.2-Exp模型今天正式开源,这次最大的亮点是,用了稀疏Attention技术,说白了就是,模型变... DeepSeek-V3.2-Exp模型今天正式开源,这次最大的亮点是,用

20. 9月29日DeepSeek-V3.2-Exp 模型发布。作为迈向新一代架构的中间步骤,引入了 DeepSeek Spar...

9月29日DeepSeek-V3.2-Exp 模型发布。作为迈向新一代架构的中间步骤,引入了 DeepSeek Spar... 9月29日DeepSeek-V3.2-Exp 模型发布。作为迈向新一代架

21. DeepSeek新模型上线!引入DSA新稀疏注意力,还又狙了CUDA一枪

DeepSeek新模型上线!引入DSA新稀疏注意力,还又狙了CUDA一枪 DeepSeek新模型上线!引入DSA新稀疏注意力,还又狙了CUDA一枪量子位1759142807 编辑部 发自 凹非寺量子位

22. 开源社区一个 “又强又便宜” 的大模型选择—DeepSeek-V3.2

开源社区一个 “又强又便宜” 的大模型选择—DeepSeek-V3.2 开源社区一个 “又强又便宜” 的大模型选择—DeepSeek-V3.2人人都是产品经理1765769321 开源大模型与闭源顶尖

23. 又是长假之前更新DeepSeek-V3.2-Exp 发布!有两大看点。第一:DeepSeek Sparse Attent...

又是长假之前更新DeepSeek-V3.2-Exp 发布!有两大看点。第一:DeepSeek Sparse Attent... 又是长假之前更新DeepSeek-V3.2-Exp 发布!有两大看点。第

24. DeepSeekV3.2技术报告还是老外看得细

DeepSeekV3.2技术报告还是老外看得细 DeepSeekV3.2技术报告还是老外看得细量子位1764809506 henry 发自 凹非寺量子位 | 公众号ChatGPT三岁生日这一天,硅谷热

25. DeepSeek更新 上下文达百万级token

DeepSeek更新 上下文达百万级token DeepSeek更新 上下文达百万级token财联社1770806789 【DeepSeek更新 上下文达百万级token】《科创板日报》11日讯,多名

26. #DeepSeek发布梁文锋署名论文#补充一点点:传统大模型全靠注意力机制“硬算”,遇到实体名、固定搭配这类静态知识时又...

#DeepSeek发布梁文锋署名论文#补充一点点:传统大模型全靠注意力机制“硬算”,遇到实体名、固定搭配这类静态知识时又... 补充一点点:传统大模型全靠注意力机制“硬算”,遇到实体名、固定搭配这类静

27. DeepSeek发布最强开源新品,瞄向全能Agent,给GPT-5与Gemini 3下战书

DeepSeek发布最强开源新品,瞄向全能Agent,给GPT-5与Gemini 3下战书 DeepSeek发布最强开源新品,瞄向全能Agent,给GPT-5与Gemini 3下战书钛媒体APP176

28. DeepSeek宣布同时发布两个正式版模型,DS-V3.2和DS-V3.2-Speciale。 DS-V3.2(标准版...

DeepSeek宣布同时发布两个正式版模型,DS-V3.2和DS-V3.2-Speciale。 DS-V3.2(标准版... DeepSeek宣布同时发布两个正式版模型,DS-V3.2和DS-V3.2

29. 【国盛计算机】DeepSeek-V3.2发布,国产模型再度引领创新DeepSeek-V3.2(标准版)在公开推理 Ben...

【国盛计算机】DeepSeek-V3.2发布,国产模型再度引领创新DeepSeek-V3.2(标准版)在公开推理 Ben... 【国盛计算机】DeepSeek-V3.2发布,国产模型再度引领创新Dee

30. 【#DeepSeekV4被曝下月发布##DeepSeek新模型API大幅度降价#】今天下午DeepSeek突然发布了De...

【#DeepSeekV4被曝下月发布##DeepSeek新模型API大幅度降价#】今天下午DeepSeek突然发布了De... 【】今天下午DeepSeek突然发布了DeepSeek v3.2-Exp

31. DeepSeek-V3.2 在推理任务中的表现优于 GPT-5

DeepSeek-V3.2 在推理任务中的表现优于 GPT-5 DeepSeek-V3.2 在推理任务中的表现优于 GPT-5InfoQ1768120367 作者 | Anthony Alford 译

32. 【Deepseek V4的最后一块拼图来了?全新OCR架构超越视觉压缩,让AI在2D世界里推理因果】1月27日,#Dee...

【Deepseek V4的最后一块拼图来了?全新OCR架构超越视觉压缩,让AI在2D世界里推理因果】1月27日,#Dee... 【Deepseek V4的最后一块拼图来了?全新OCR架构超越视觉压缩,

33. 太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切

太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切 太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切机器之心Pro1760953927 机器之心报道机器之心编辑部我们或许能通过文本到

34. DeepSeek疑似已更新:上下文暴增至100万

DeepSeek疑似已更新:上下文暴增至100万 DeepSeek疑似已更新:上下文暴增至100万观察者网1770808961 (文/陈济深 编辑/张广凯) 观察者网今天发现,在手机端与DeepSee

35. #DeepSeek新架构意味着什么#DeepSeek代号Model1的全新架构曝光,标志着其从参数堆砌向架构优化的关键转...

#DeepSeek新架构意味着什么#DeepSeek代号Model1的全新架构曝光,标志着其从参数堆砌向架构优化的关键转... DeepSeek代号Model1的全新架构曝光,标志着其从参数堆砌向架构

36. DeepSeek模型更新!上下文提升至百万Token 可处理三体小说全集

DeepSeek模型更新!上下文提升至百万Token 可处理三体小说全集 DeepSeek模型更新!上下文提升至百万Token 可处理三体小说全集财联社1770815489 《科创板日报》2月11日讯

37. 【DeepSeek更新新模型 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,DeepSeek在网页端和...

【DeepSeek更新新模型 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,DeepSeek在网页端和... 【DeepSeek更新新模型 上下文达百万级token】《科创板日报》1

38. 外媒:DeepSeek出乎意料新突破能否打破大模型“长上下文”瓶颈?

外媒:DeepSeek出乎意料新突破能否打破大模型“长上下文”瓶颈? 外媒:DeepSeek出乎意料新突破能否打破大模型“长上下文”瓶颈?人工智能学家1761398304 信息来源:https://w

39. 【#DeepSeek更新新模型# 上下文达百万级token】多名用户反馈,DeepSeek在网页端和APP端进行了版本更...

【#DeepSeek更新新模型# 上下文达百万级token】多名用户反馈,DeepSeek在网页端和APP端进行了版本更... 【 上下文达百万级token】多名用户反馈,DeepSeek在网页端和A

40. 【DeepSeek更新新模型 上下文达百万级token】多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,...

【DeepSeek更新新模型 上下文达百万级token】多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,... 【DeepSeek更新新模型 上下文达百万级token】多名用户反馈,D

41. 18:50 ★★【DeepSeek更新新模型 上下文达百万级token】多名用户反馈,DeepSeek在网页端和AP...

18:50 ★★【DeepSeek更新新模型 上下文达百万级token】多名用户反馈,DeepSeek在网页端和AP... 18:50 ★★【DeepSeek更新新模型 上下文达百万级toke

42. DeepSeek-V3.1正式发布,混合推理架构加持,针对下一代国产芯片设计

DeepSeek-V3.1正式发布,混合推理架构加持,针对下一代国产芯片设计 DeepSeek-V3.1正式发布,混合推理架构加持,针对下一代国产芯片设计华尔街见闻1755761060 21日,Dee

43. 刚刚,DeepSeek重要突破!大模型上下文紧箍咒打破

刚刚,DeepSeek重要突破!大模型上下文紧箍咒打破 刚刚,DeepSeek重要突破!大模型上下文紧箍咒打破智东西1761015970 智东西作者 | 陈骏达编辑 | 云鹏在大语言模型不断拉长上下文

44. 【#DeepSeek更新新模型# 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,DeepSeek在网页...

【#DeepSeek更新新模型# 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,DeepSeek在网页... 【 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,De

45. 原生DeepSeek vs 豆包/文心/千问集成版:5大核心差异,选对不踩坑

原生DeepSeek vs 豆包/文心/千问集成版:5大核心差异,选对不踩坑 原生DeepSeek vs 豆包/文心/千问集成版:5大核心差异,选对不踩坑听风阁1766914546 在AI工具遍地的今

46. Deepseek的“一小步”——一文为你全面介绍Deepseek V3.1新版本的更新、使用情况及意义

Deepseek的“一小步”——一文为你全面介绍Deepseek V3.1新版本的更新、使用情况及意义 Deepseek的“一小步”——一文为你全面介绍Deepseek V3.1新版本的更新、使用情况

47. 【DeepSeek更新新模型 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,DeepSeek在网页端和...

【DeepSeek更新新模型 上下文达百万级token】《科创板日报》11日讯,多名用户反馈,DeepSeek在网页端和... 【DeepSeek更新新模型 上下文达百万级token】《科创板日报》1

48. DeepSeek新版本发布,速度更快,成本更低

DeepSeek新版本发布,速度更快,成本更低 DeepSeek新版本发布,速度更快,成本更低上观新闻1759615321 日前,DeepSeek-V3.2-Exp模型正式发布。这是一个实验性版本,主

49. Deepseek 又发货了!这次包括 DeepSeek-V3.2 正式版和 DeepSeek-V3.2-Speciale...

Deepseek 又发货了!这次包括 DeepSeek-V3.2 正式版和 DeepSeek-V3.2-Speciale... Deepseek 又发货了!这次包括 DeepSeek-V3.2 正式版

50. 【DeepSeek发布V3.2系列模型,强化Agent能力,推理能力追平GPT-5】DeepSeek发布V3.2系列两款...

【DeepSeek发布V3.2系列模型,强化Agent能力,推理能力追平GPT-5】DeepSeek发布V3.2系列两款... 【DeepSeek发布V3.2系列模型,强化Agent能力,推理能力追平
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章