当前位置:
AIGC文章详情

GLM-5.3能写小说、做游戏吗?扒了一圈全网实测:跟代码沾边的活靠谱,要“看”的活还差点意思

源自57位全网作者

16:41

GLM-5.3全量上线一周多了。编程圈的争论一直没停:跑分、订阅、开源时间,吵得挺凶。但我这两天翻了翻B站和知乎的实测内容,发现有一拨人压根没参与这些争论——他们拿GLM-5.3干的不是写代码的本职活,而是搞创作:写小说、做小游戏、搞AI剧。

这条路子聊的人不多,但对大多数普通用户来说,一个模型能不能帮到自己的副业和爱好,可能比跑分重要多了。今天就盘一盘:GLM-5.3干创作,到底行不行。

先看大家都拿它做出了什么

最近一周,B站上已经陆陆续续出现了一批GLM-5.3的创作案例:

有UP主只给了一段《神通者》首章前文,让GLM-5.3接着写简介和后续,首发实测视频拿到4600多播放、50多条评论,评论区还真有人在认真讨论续写质量。哔哩哔哩有人用它从零写了个FPS射击小游戏,完整可玩。还有人把GLM-5.3和MiniMax H3搭在一起,做出了AI剧《东北出马仙×东京》。哔哩哔哩甚至连《僵毁B42》的人物模组,作者都在简介里写明:建模交给别的模型,“代码和工作流:GLM-5.3”。哔哩哔哩

样本不算多,但方向出奇一致:这些创作者基本都在用它干同一件事——把一个想法变成一个能跑的东西。小说是文字产出,游戏、模组是代码产出,而这两类恰好是GLM-5.3这次升级最狠的方向。

为什么这类活它干得动

先看这次升级的路径。智谱没有重新训练基座,而是把后训练的规模拉大,重点压三个方向:Coding、长程Agent、网络安全。知乎

效果有数据可查:在考长程软件工程的DeepSWE v1.1上,从上代的46.2分提到66.9分。知乎

智谱自己的Code Bench最高难度下,GLM-5.3用平均约7.5万输出Token拿到34.5%的成绩,而GLM-5.2要花约9.6万Token才拿23.4%。知乎完成率更高、废话更少,说明模型学会了把事干完,而不是靠堆思考长度凑答案。

GLM-5.3能写小说、做游戏吗?扒了一圈全网实测:跟代码沾边的活靠谱,要“看”的活还差点意思

放到创作场景里,这就变成两个很直接的体验优势:

一是长任务不容易崩。 写连载小说、做一个文件几十个小游戏,都需要模型长时间持续推进。独立开发者李然的体验是,ZCode里的Goal Mode给定一个目标后,模型会持续推进、检查、验证,直到任务完成,长任务的可靠性比上一代更高。知乎

二是上下文够长。 公开资料显示,GLM-5.2这代就把上下文做到了1M级别,5.3沿用同一基座。知乎知乎小说连载最怕模型"忘了前文伏笔",项目做大最怕"忘了前面的设定",长上下文对创作型用户是真刚需。

整体水位也有榜单佐证:Artificial Analysis综合智能指数里,GLM-5.3拿到60分,与总参数约2.8万亿的Kimi K3并列开源模型第一。知乎知乎

在14模型对比集里,Agentic(智能体能力)排第二。知乎值得一提的细节是,前十模型里只有GLM-5.3的参数量不是T级——约744B的体量打出这个成绩,本身是个效率故事。知乎

GLM-5.3能写小说、做游戏吗?扒了一圈全网实测:跟代码沾边的活靠谱,要“看”的活还差点意思

但有一条明显的短板:它不会"看"

只说强的地方就成了软文,短板同样得讲清楚:GLM-5.3没有视觉能力。

这意味着所有需要"看结果、调结果"的任务都会打折扣。开发者李然的实测很典型:常规代码任务,GLM-5.3好用,水平高过Kimi K3,但到了游戏生成、创意编码这类依赖视觉反馈的场景,体验就比较一般——“还出现过生成的页面按钮都是歪的情况”。知乎

原因不难理解:写代码可以用测试和运行结果自我验证,但页面好不好看、按钮歪不歪,模型看不见,就只能瞎调。其实在5.3发布前,智谱创始人唐杰在X上征集用户期待时,视觉和多模态是呼声最高的方向,但这次没给。知乎这也是5.3"变强了却没刷屏"的重要原因之一。

所以边界很清楚:

  • 文字类创作(小说、剧本、设定集、续写):靠谱,长上下文还是加分项;

  • 代码类可玩内容(小游戏、模组、工具脚本、演示页面):靠谱,模型能自我验证、持续推进;

  • 依赖视觉反馈的活(页面UI微调、创意编码、分镜和画面理解):差点意思,别抱太高期待。

想试的话,要花多少钱

最后说钱。GLM-5.3的API定价与GLM-5.2持平,没涨价。知乎想大量跑创作任务,目前最常见的入口是GLM Coding Plan:7月底改版成积分制后,Lite版118元/月,有每5小时滚动额度和每周上限,已开放购买、不用抢。知乎

用量不大的话,按量调用更划算,不必上来就订阅。单任务花费上也有数据佐证:Artificial Analysis的统计里,GLM-5.3的单任务成本处在同智能档位的低位——拿到60分智能的同时,每完成一个任务的花销并不高,这对需要反复跑任务的创作型用户,是比订阅价更要紧的曲线。知乎

GLM-5.3能写小说、做游戏吗?扒了一圈全网实测:跟代码沾边的活靠谱,要“看”的活还差点意思

ZCode之前送过新用户1亿免费Token,活动8月24日已经结束。哔哩哔哩后面会不会再有可以留意。

如果你手里已经有会"看"的多模态模型,还有个现成的组合打法:那个僵毁模组作者就是建模和视觉相关的部分交给别的模型,GLM-5.3只负责代码和工作流——一个当眼睛,一个当手,比逼着单一模型全能要实在。

后续值得盯的三件事

  1. 权重开源。官方说法是8月底开源,智谱也承认因为网络安全能力超出预期,权重发布刻意压了压。知乎知乎开源后本地部署和微调的玩法才会真正打开,但744B级别的参数,先看自己的显卡跑不跑得动;

  2. 视觉能力补位。这是创作型用户最该等的一块。最近全网热议的匿名免费模型被不少人猜测和智谱的视觉栈有关,也有传言说9月是智谱的大月——传闻归传闻,方向可以盯。哔哩哔哩

  3. 价格走向。行业正从价格战转向质量战,DeepSeek已经在酝酿提价。哔哩哔哩GLM Coding Plan这个价位短期大概率不会降,刚需别指望等等党胜利。

一句话收个尾:GLM-5.3不只是"编程模型",跟代码和文字沾边的创作现在就能上手;要"看"的活,等视觉补齐再说。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章