张大妈

日本乐天AI模型被曝套壳中国DeepSeek V3,技术参数高度一致引开源合规争议

源自14位全网作者

03-18 13:30

内容由AI生成

精选参考来源

1. 日本为什么不怕? #财经 #日本 #经济学知识看世界 #掘金计划2025 #零基础看懂全球

2. 日本引进印度移民背后,是一场没有退路的豪赌 #财经知识 #经济学视角看世界 #日本 #掘进计划2025 #我们的精选

3. #韩国企业否认套壳中国模型##韩国AI大赛引争议# 韩国自主AI模型竞赛深陷技术独立性争议,5家入围团队3家被曝用外国开源组件,多款与中国智谱AI、阿里千问等模型高度相似,理想与现实的割裂,暴露出韩国打造本土AI生态的多重困境。韩政府本欲通过从零构建模型实现自主AI,却因未明确判定标准,让企业有机可乘。涉事企业均否认套壳,称是战略性采用成熟技术、核心引擎自主,却难消业内质疑——核心组件依赖中国模型,与评估本土技术初衷相悖。竞赛判定标准模糊,让自主AI定义陷分歧,淘汰两家团队仍难平争议。这场风波本质是全球AI开源共享与各国技术自主诉求的碰撞,韩国既要借力成熟技术提速,又想守住自主底线,却因规则缺失陷入两难。缺乏清晰界定与技术沉淀,仅靠行政推动难达目标,后续无论结果如何,争议都将持续,也为各国AI自主化发展敲响规则先行的警钟。#如何看韩国AI用中国模型代码#韩国ai大赛引争议 川北小哥的微博视频

4. 《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

5. 九坤投资至知研究院发布开源大语言模型,将给国内大模型开源生态带来哪些改变?

6. 高市早苗:一缕“昭和遗魂”与她的迷失日本 #零距离看懂财经#热点零距离

7. 日本凭什么敢? #日本 #财经 #经济学视角看世界 #零基础看懂全球

8. 一定要小心日本 #财经知识 #经济学视角看世界 #社会 #日本

9. 日本新NISA怎么玩?乐天证券开户全流程演示(附薅羊毛技巧)【保姆级教程】最新日本股票开户攻略:从注册到入金,看这一期就够了

10. DeepSeek新模型爆火,硅谷玩疯了 #DeepSeek团队开源新模型 DeepSeek新模型爆火,硅谷玩疯了!把文字变成图像,让AI一目十行读完一本书!这次,它真的在教AI们,怎么省算力、怎么学会“遗忘” #AI #DeepSeek

11. 模型”,其配置文件显示基于

12. DeepSeek新版本,节前突袭发布!

13. DeepSeek发布V3.2-Exp:引入DSA、价格腰斩,为V4、R3铺路

14. DeepSeek-V3.2-Exp: DeepSeek发布V3系列向下一代架构过渡的中间版本

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章