智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

2024-11-26 18:02:15 1点赞 2收藏 0评论

在最新一期的 SuperCLUE 通用能力基准测评榜单中,智谱AI的 GLM-4 系列模型 再次跻身第一梯队,妥妥的优等生,这一点已经说明了智谱AI的实力了。

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

不过纸上跑分,也就那么回事,不如实测一下让人信服。我马上就想到了GLM-4-Flash大模型,因为它目前在智谱AI的BigModel平台进行API调用是免费的,特别适合个人开发者用来练手,或者做小型项目开发。

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

GLM-4-Flash 概览

看一下GLM4-Flash 特性:

长上下文:GLM-4带来128K的上下文窗口长度,在单次提示词中,可处理文本达到了300页。开发者再也不用担心文档太长,一次性处理不完了。

性能卓越:GLM-4-Flash 在语义、数学、推理、代码和知识等多方面的数据集测评中,均表现出超卓越性能。

生成速度:输出速度高达 72.14 token/s,约等于每秒 115 个字符。

咱就是说,就这性能,免费给用,真的挺大气!

bigmodel开发平台

广告

奥数老师项目

我正好最近在辅导娃学奥数,好多知识点都得自己现学,然后辅导,搞得焦头烂额。这款模型既然宣称擅长数学,那咱们就做一个奥数辅导老师的AI应用看看!

我的项目思路是,把手上的奥数讲义和习题集的资料经过简单清洗提供给模型,要求它能做到:

1、对指定题目讲解时不能一下子告知答案,而是一步一步抛出问题启发孩子进行交互,直至完成讲解。

2、需要针对孩子每一步的回答进行评价,题目完成后统计出交互过程中的回答错误次数,并且指出孩子掌握薄弱的点。

3、能够给出类似的问题,帮助孩子举一反三巩固练习。

首先是登录bigmodel开放平台,右上角获取API KEY:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

复制API Key用于调用API

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

使用SDK

下载包:

pip install zhipuai

先来一个“helloword”把调用过程跑通。调用时需要在请求里设置模型名称,比如glm-4-flash,然后用messages参数传入对话内容。支持多轮对话输入,像这样:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

官方文档提供的示例很贴心,基本照着改一下就能用。其中temperature参数决定生成内容的随机性,设置高一些,生成的内容更有创意。我们数学题,对严谨性要求比较高,设成0.8。

top_p控制生成内容的多样性,值越低,输出更集中于模型认为更可能的结果,我们设成0.7。返回结果还是很靠谱的:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

下面就开始我们的奥数老师的迭代进化之路!

1、数据资料准备

首先我的课件和习题集资源文件中有大量空白、页眉页脚,进行一下数据清洗。代码如下:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

我把源文件放在了input文件夹里,清洗后的数据放在output文件夹。看一下清洗的效果,还是不错的:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

如果用rag来做,还要考虑文件的分割问题,尤其这种数学题,最好做成结构化的内容再存向量数据库。现在因为支持超长上下文就简单了,每次发送的时候都带着资源文件、system以及所有历史聊天记录一股脑发过去就可以了。

2、调用大模型实现分步讲题

读目标文件夹的资料:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

调用代码:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

控制台测试一下:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

老师真的非常耐心。

3、迭代和进化

下面,我们来加上学情评价功能。在每次交互时,让模型针对孩子的回答做一个评价。要求模型来判断本题是否讲完,如果没讲完,就针当前步骤的回答情况做评价;如果讲完了,就针对整道题的回答情况做评价。我的prompt是这样写的:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

另外不想每次重跑聊天记录就没了,就做了个持久化存在文件里:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

我们换一道难一点的鸡兔同笼题测试一下:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

完全理解了我prompt中的意图,并且评价的准确率很高。中途躺平了两次,还对我进行鼓励,答完题之后给予表扬,真的超有老师的样子!

再加上举一反三的出类似题需求,一个有模有样的奥数老师就做好了。打包成API,对接到我现有的一个聊天项目的前端,界面长这样:

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

后续还可以做更多的迭代,比如把学情分析,知识点分析那里做得更细,针对某段时间的所有题目的答题情况进行分析,然后以图表的形式进行显示;比如接上一个音色比较有亲和力的tts,让老师可以“讲”题,等等,想想都很好玩。

谁懂啊!一把省下大几千,真的是太香了!

调用感受

1、整个过程根本没费什么难,最搭精力的地方,反而在写prompt上。主要是因为平台的各方面支持太直观和完善了,一看就知道怎么上手;另外加上GLM-4-Flash本身的代码能力很强,大部分代码都是我直接从控制台页面要求它自己写的——毕竟已经是个成熟的模型了,要学会自己调用自己!

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

作为一个多年不写代码的前程序员,我觉得我又可以了!

2、模型的自然语言理解能力真的是惊艳到我了。一开始我对于我写的这种prompt能不能奏效是没有信心的。要求不能列方程、分步交互、要判断题目有没有讲完,并且进行答题评价——讲完和没讲完的评价格式还是不一样的。

智谱AI家GLM-4-Flash模型提供API免费调用服务,实际性能怎么样?

按照以往经验,prompt中的要求只要一多一细碎,模型就特别容易出现“丢三落四”的情况,但是它真的都做到了!

3、推理能力和代码能力,也是明摆着的优秀。

总之真的可以支撑起很强大的上层应用,别忘了网页搜索、函数调用之类的我还没有用上呢。

场景价值

作为一名产品经理,在做这个应用的过程中,我已经开始心潮澎湃浮想联翩了。AI应用落地的进程才刚刚开始,GLM-4-Flash这款模型大有可为!

首先就是智慧教育领域。不管是现在大火的学习机智能硬件、各种教育类app等C端产品,还是智慧课堂、在线教育等等B端场景,这款模型都能派上大用场。

像我们做智能客服,用传统的 RAG(检索增强生成)实现知识库的方式真的一言难尽。命中率不稳定,即使查出来只言片语的内容给大模型,生成出来的也很有可能是惊吓,作为产品和开发人员,真的非常无能为力。

有了长上下文,把知识库、客户历史对话、各种产品说明资料,直接通通塞进上下文,一问一答的效率直接拉满,客户体验一个字,爽。

还有就是法律咨询场景。因为这个内容场景本身的复杂性和严谨性,普通模型很难胜任,因为逻辑链断了或者信息没关联好导致不知所云,非常正常。

但 GLM-4-Flash基于超长上下文和超强推理能力,就能结合合同条款、法律知识,再根据问题梳理清楚逻辑链条,给出严谨的、贴合实际的解答。

今年以来,明显地感觉到智谱在生态支持方面越来越发力。不管是完善的支持,还是亲切的价格,都在把高冷的大模型狠狠地往落地方向上拽,这对开发者来说真的是太幸福了!智谱AI,我愿称之为国货之光。

bigmodel平台

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
2
扫一下,分享更方便,购买更轻松