当国内科技圈进入假期模式时,DeepSeek却在加速前进。创始人梁文锋连续发布两篇硬核论文,揭示了大模型记忆机制和训练稳定性的突破性解决方案。同时,公司正在大规模招聘核心技术人才,所有迹象都预示着DeepSeek V4即将到来。
智能速览
DeepSeek正在大量招聘技术核心岗位,涵盖深度学习研究员、全栈工程师等
Engram模块为大模型添加外挂式记忆,实现O(1)时间复杂度的知识调取
mHC架构解决超大规模模型训练稳定性问题,在27B参数模型上表现优异
20%-25%资源分给静态记忆的U型扩展规律被证明是反直觉但有效的
DeepSeek V4或将集成MoE、Engram和mHC三大技术,实现架构级创新
精华内容
DeepSeek在沉默中积蓄力量,用技术突破回答大模型发展的关键问题:除了MoE,还需要什么?答案正在通过两篇论文和大量招聘信息浮出水面。
记忆重构
DeepSeek发布的Engram模块直指Transformer架构痛点:缺乏原生条件记忆。当前模型只能靠计算模拟检索,而Engram为模型装上外挂式"硬盘",实现O(1)时间复杂度的知识调取。实验证明,在270亿参数规模上,Engram不仅让模型背书能力变强,MMLU提升3.4分,更意外提升了推理能力,BBH提升5.0分。长文本"大海捞针"测试准确率从84.2%飙升到97.0%。
稳定连接
mHC研究解决超大规模模型的训练稳定性问题。传统残差连接在大模型中失效,DeepSeek用数学方法将神经网络连接约束在特定流形空间。在27B参数混合专家模型上,mHC展现出稳定训练曲线,最终损失比基线降低0.021,推理能力提升2.1%。团队还进行了极端优化:扩展DualPipe调度策略,重新设计Sinkhorn-Knopp算法内核,通过操作融合减少显存访问。
架构创新
DeepSeek发现了一个反直觉的U型扩展规律:在同等计算量下,将20%-25%资源分给静态记忆,剩下的分给神经计算,效果最优。这意味着少算一点、多记一点反而更聪明。这种架构支持"预取-重叠"策略,可用CPU内存存储知识,让GPU专注逻辑推理,为解决显存成本问题提供新思路。
团队扩招
DeepSeek近期放出大量技术岗位招聘,包括深度学习研究员、研发工程师、全栈工程师等核心职位。校招、社招、实习全部开放,产品、设计、数据岗位也在招聘中。与以往不同,大部分岗位可选择北京或杭州办公。据相关人士透露,此前11月已开始行政招聘,“因为团队大了,需要更多行政伙伴”,显示出明显的扩招需求。
V4前瞻
所有线索指向DeepSeek V4即将发布。这个模型不会是单纯堆砌参数,而是架构精巧的"缝合怪":拥有MoE的计算效率、Engram的海量记忆、mHC的训练稳定性。V4可能在保持低成本推理的同时,拥有远超当前模型的知识容量和长上下文处理能力。对于算力资源有限的国内AI圈,这种算法级效率提升比购买英伟达芯片更具战略意义。
DeepSeek用一年时间完成了从应用层红海到底层架构创新的战略转移。Engram和mHC两大技术突破,加上团队规模的快速扩张,预示着大模型领域将迎来新的变革时刻。梁文锋手中的发令枪已经举起,静待那一声惊雷。
关键评论
比阿里千问靠谱!告别马云嘴炮,追求华为式的务实!
我国人才济济,未来数不尽的梁文锋报效国家,昌盛国家必然是大势所趋
爆炸!!继r1之后deepseek最新engram查找表继续证明了本人智人架构核心变种之一理论的正确性
期待发展壮大,并创新绵长!
我觉得DS推理能力在这几个大模型里不错