这波开源潮看着热闹,但真正能落地进生产线的没几个。像PaddleOCR这种解决实际问题的,才真是顶了大用,别的大多还在炫技阶段
10月国内开源模型依旧坚挺,持续汇总!
AI为你总结
全文概述
10月,国内开源社区发布了多个重要模型,涵盖视觉、语言和多模态领域。Qwen、混元、蚂蚁等公司持续发力,美团进军视频领域,OCR技术成为亮点。这些模型在性能和应用场景上均有显著提升。
主要模型发布
Qwen发布了Qwen3-VL系列模型,尺寸齐全且支持多种版本;腾讯混元推出了Hunyuan-Vision-1.5,表现出色;蚂蚁发布了Ling、Ring、Ming等多个万亿参数级别的通用语言模型。
OCR技术进展
DeepSeekOCR和PaddleOCR成为本月的焦点,前者以高立意著称,后者则以强落地应用闻名,两者都获得了广泛认可。
视频与语音模型
美团发布了LongCat-Audio-Codec和LongCat-Video模型,分别提供语音编解码方案和支持文生/图生视频生成;腾讯混元还推出了HunyuanWorld-Mirror,支持多视图及视频输入。
其他重要模型
快手开源了KA T-Dev-72B-Exp模型,专注于Coding任务;字节跳动开源了FaceCLIP,专注于人脸理解与生成;智源开源了EditScore-72B,用于图像编辑奖励模型。
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹