GLM-5.1和Kimi K2.6能接续写完你打断的代码,DeepSeek V4却不行

源自167位全网作者

04-29 10:21

内容由AI生成

精选参考来源

1. 国产大模型“春节档”混战,一文看懂豆包是怎么打这仗的

2. Kimi 发布并开源 K2.6,有哪些亮点值得关注?

3. GLM-5深夜登场,这是国产开源模型首次逼平Claude Opus 4.5。

4. GLM-5.1开源,SWE-Bench Pro 登顶王座,老金帮你拆清楚

5. 智谱 GLM-5.1 面向所有 codingplan 用户开放,对开发者意味着什么?

6. 体验完智谱刚刚发布的 GLM-5,我终于明白它为什么让硅谷猜破了头

7. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

8. 【LMArena最新排名:视觉理解,文心5.0 Preview成最强国产模型】11月22日,备受行业关注的LMArena大模型竞技场公布最新排名结果,其中文心大模型ERNIE-5.0-Preview-1120在视觉理解榜中交出了亮眼答卷,以1206分的成绩位列国内第一,更值得关注的是,其整体水平已与Claude-Sonnet-4、GPT-5-high等国际一线大模型相当,成为国产模型在该领域与国际顶尖力量同台竞技的重要突破。在LMArena众多细分榜单中,视觉理解榜对应的应用场景并非简单的图像识别,而是工业质检、视频解析、医疗影像分析这类对模型精度和可靠性要求极高的核心领域。工业质检的任何误差都可能影响整条生产线的效率,医疗影像分析则关系到诊断的准确性,这类任务更能深度检验其底层能力。此前,国内虽有部分模型在LMArena的其他赛道展现出一定潜力,取得过不错的成绩,但在视觉理解榜这一“硬骨头”赛道上,能真正突破门槛、与国际一线模型同场比拼的却几乎没有。而文心5.0 Preview不仅成功跻身该榜单,更成为目前国内在该榜单中排名最高的模型,1206分的成绩背后,是其在视觉推理与跨模态理解能力上的扎实积累,标志着国产模型已具备在视觉任务中与国际顶尖模型抗衡的实力。文心5.0 Preview的成绩并非偶然,而是源于其独特且扎实的技术路线。作为新一代原生全模态大模型,它摒弃了业界多数多模态模型的后期融合模式,而从训练之初就将语言、图像、视频、音频等多模态数据统一,让多模态特征充分交互、协同优化,从根源上实现了原生的全模态统一理解与生成,而非简单的功能叠加,这也为其在视觉理解任务中的出色表现奠定了基础。除了核心技术路线的优势,文心5.0在架构设计上的创新进一步强化了其性能。依托飞桨深度学习框架,该模型采用超稀疏混合专家架构,总参数量突破2.4万亿,这一庞大的参数规模为模型处理复杂任务提供了充足的算力支撑;同时,其激活参数比例低于3%,这一设计在保证模型强大处理能力的同时,有效降低了推理过程中的资源消耗,大幅提升了实际应用中的效率,让模型在面对大规模视觉数据时既能保持高精度,又能兼顾处理速度。此外,为了进一步提升模型的实用能力,文心5.0还基于大规模工具环境,合成了长程任务轨迹数据。同时,通过基于思维链和行动链的端到端多轮强化学习训练,模型的智能体与工具调用能力得到显著提升,进一步增强了其在实际应用中的适应性。作为目前国内唯一在LMArena视觉理解榜中站稳脚跟的模型,文心5.0 Preview的1206分不仅是一个排名上的突破,更承载着国产大模型在全模态核心技术领域的发展成果。它用实力证明,国产模型已不再局限于中低难度任务,而是具备了在高难度、高价值的视觉理解场景中与国际一线模型竞争的能力,这不仅为国产大模型的技术发展注入了信心,更为后续国产模型在全球大模型竞争格局中提升国际竞争力提供了有力支撑。#百度##Ai##大模型##科技##AI技术##科技先锋官#

9. 市值近600亿,大模型公司上市了! #AI #智谱ai

10. DeepSeek V4 预览版本上线并同步开源,哪些亮点值得关注?

11. DeepSeek V4 网页端《原神×我的世界》融合小游戏代码测试:拳打 ChatGPT,脚踢 Gemini,硬刚 Claude

12. OpenAI官方插件进Claude Code,老金装了后工作流省了这4步

13. 智谱官方在今天的GLM-5.1开源通知中特别强调“一个独立工作8小时的模型”,为什么是8个小时?正是贴合我们日常8小时的工作节奏。当我们休息时,AI能独立运转并持续创造价值,这才是真正意义上解放人力。另外,智谱GLM-5.1是当前全球除Claude Opus 4.6外唯一具备8小时级长程任务能力的模型。且它在业内最具代表性的三个代码评测排名中已经是全球模型第三、国产模型第一、开源模型第一。#GenJiAI观察室##智谱发布GLM5.1#

14. 【月之暗面最强模型!Kimi K2.6发布:13小时不停写代码 对标GPT-5.4】日前,月之暗面发布并开源Kimi K2.6模型,在代码、长程任务执行和Agent集群能力等方面全面升级。目前,Kimi K2.6已上线kimi官网、最新版应用、API和Kimi Code编程助手。在多项权威基准测试中,Kimi K2.6表现亮眼。无论是高难度的人类最后的考试(Humanity's Last Exam),还是侧重真实软件工程能力的SWE-Bench Pro,以及评估Agent检索能力的DeepSearchQA,成绩均达到行业领先水平,持平或优于GPT-5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型。作为Kimi迄今最强代码模型,Kimi K2.6长程编码能力大幅提升。在测试中可以不间断编码13小时,编写或修改超过4000行代码,完成复杂系统的开发和优化。同时,通过将代码与视觉能力的深度融合,Kimi K2.6可以交付极具设计创意的专业级Web应用。在内部代码评测Kimi Code Bench中,K2.6成绩较上一代K2.5提升约20%。值得一提的是,其泛化能力同样突出。实测显示,Kimi K2.6可在Mac本地部署模型,并通过Zig语言优化推理流程,在4000余次工具调用、12小时连续运行中,将吞吐量从约15tokens/s提升至约193tokens/s,最终实现比LM Studio快约20%的推理效率。在Agent能力方面,Kimi K2.6支持多Agent协同,可调度不同专长的Agent组合完成复杂任务,将搜索、深度研究、文档分析和长文生成等能力整合,整体任务质量显著提升。同时,其Agent集群架构也迎来升级,最多支持300个子Agent并行运行、执行约4000个协作步骤,可一次性完成从文档到网页、再到PPT和表格的多产物端到端交付。#kimi#

15. 智谱发布GLM-5技术细节:工程级智能,适配国产算力

16. 智谱新出的 GLM-5.1 非常好用,我自己实测一下,结果出奇的好。我一直想做一个内容付费的个人博客网站,带前后端、数据库、文章发布、付费解锁、后台管理,全套功能。这种项目说难不难,但环节多、链路长,自己从零撸的话怎么也得两三周。GLM-5.1 刚好主打"长程任务"能力,我就拿这个项目来测。需求都是用大白话写的,没有技术文档,就告诉它"我要一个程序员极简风的博客,支持专栏标签、Markdown 编辑器、内容锁定和付费解锁"。结果 GLM-5.1 上来没急着写代码,先花两分钟输出了一份完整的技术方案,前端 Next.js,后端 Node.js,数据库 SQLite,项目结构和实施步骤都列好了。这个起手式就跟其他模型不一样,其他模型基本上来就啪啪啪写代码,写到一半发现架构不对再推翻重来。然后我就坐旁边看它干活,睡了个午觉起来,活干完了。28 分钟,一次性跑通。只不过界面太素了,一点不满意之外,所以,又让它调用 front-design skill 重新设计,出来的效果很极客,CLI 风格的光标动画,黑白灰配色,所以,我准备过两天直接买服务器部署上线。中间也发现了一个 bug,长文发布后只显示一半。我把问题扔给 GLM-5.1,它先按我的猜测查数据库字段,发现没问题,就自己开始排查路由、前端渲染,最后定位到是付费解锁逻辑的问题。5 分钟修好,全程没问我。同样的需求跟 Opus 4.6 和 K2.5 做了对比。K2.5 单步代码没问题,但十几步之后上下文记忆就开始衰减,前后字段对不上,得手动修五六个地方,像个聪明的应届生,你得盯着。Opus 4.6 很稳,跟 GLM-5.1 基本一个水平线。但关键区别在价格,Opus 4.6 跑完这个项目要花几十美元,GLM-5.1 通过 Coding Plan 用,成本低了一个数量级。所以,我的感悟就是:以前用 AI 写代码像带实习生,你是项目经理,得盯着它一步步做。现在用 GLM-5.1,你是甲方,它是那个能独立交付的资深工程师。1 个小时 vs 两三周,这个效率差距已经不是"提效"能概括的了。具体实测请看这篇文章:网页链接#How I AI##科技先锋官#

17. DeepSeek V4(预览版)在编程领域表现如何?

18. 谁才是最强王者?ChatGPT5.5、Claude 4.7、Deepseek V4、Qwen 3.6 编程实测见真章!| 零度解说

19. Kimi 发布并开源 K2.6,有哪些亮点值得关注?

20. Kimi 发布并开源 K2.6,有哪些亮点值得关注?

21. 【2026年,开源编程模型将迎来爆发式增长】一个值得关注的信号:尽管过去几年开源大模型层出不穷,但真正投入到编程能力训练上的资源其实相当有限。这个局面正在改变——2026年,我们将见证一波专注于代码生成的开源模型密集发布,随之而来的是token成本的大幅下降。这背后的逻辑很清晰:当训练预算真正向编程领域倾斜,模型质量会快速跃升,而开源社区的竞争又会进一步压低使用成本。有人预测,未来六个月内,开源模型与顶级闭源模型之间的差距将显著缩小,到2026年底,两者可能趋于平衡。但更值得思考的是:当编程模型走向商品化,真正的护城河在哪里?答案可能不在模型本身,而在工作流层面。谁能围绕开源模型构建最好的工具链和使用体验,谁就能在这场竞争中胜出。价值正在向上游迁移——从模型能力,转向如何让模型无缝融入开发者的日常工作流。有个类比很精准:摄影变便宜不是关键,关键是相机变得“隐形”——当它融入手机,人们不再把它当作独立设备。编程模型也是如此,真正的转折点不是token便宜到什么程度,而是你开始忘记模型的存在,它只是你工作流中自然的一部分。当然,也有人提出冷静的视角:token从来不是真正的瓶颈,需求定义和结果验证才是。当token成本不再是问题,新的成本会浮现——测试、代码审查、还是线上故障?无论如何,对独立开发者和小团队来说,这是个好消息。一旦推理成本足够低,几乎所有应用创意都变得可行。2026年,或许是个人开发者的黄金时代真正开启的一年。x.com/thdxr/status/2011844073515073909

22. 智谱GLM-5强调的Agentic Engineering能力是什么?|甲子光年

23. MiniMax M2.1模型正式推出,多语言编程SOTA,如何评价该模型?

24. 盘点一周AI大事(11月9日)|GPT5.1决战Gemini OpenAI预热GPT5.1,月底决战Gemini 3.0 Google内测Nano banana2.0 月之暗面发布最强开源大模型Kimi K2 Thinking,一举将开源大模型提到GPT5水平 阿里发布Qwen 3 Max预览版 Higgsfield上线角色交换Recast Hume AI上线声音交换Voice Conversion Heygen推出超真实数字人 字节发布开源版Sora客串BindWeave 视频模型MotionStream能让大象转身 Futurehouse推出AI科学家Kosmos 科学家研发出最强读心术模型Brain-IT #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

25. 股价暴涨32%!GLM-5登顶全球开源第一,25分钟一镜到底搓出完整系统

26. DeepSeek V4好用吗?【秋芝的AI开箱】

27. OpenClaw AI Agent 小龙虾能力排行榜 专门测试各家大模型在 OpenClaw 框架下执行实际编码任务的成功率。 用一套标准化的 OpenClaw Agent 任务来跑各个模型,通过自动化检查 + LLM 评审来打分,衡量每个模型完成任务的成功率。 前三名分别为: Gemini 3 Flash Preview MiniMax M2.1 Kimi K2.5 然后是: Claude Sonnet 4.5 Gemini 3 Pro Preview Claude Haiku 4.5 Claude Opus 4.6 Claude 家族三个模型都在 90% 以上,GPT-5.2 反而只有 65.6% 排名靠后,DeepSeek V3.2 在 82% 左右。

28. #DeepSeekV4发布# DeepSeekV4终于发布了,简单总结下:1、双版本发布:推出 DeepSeek-V4-Pro(高性能)和 DeepSeek-V4-Flash(高性价比)两个版本,可按需选择。2、超长上下文:支持 1M token(约百万字) 的上下文长度,能一次性处理海量信息。3、核心能力领先:在 Agent能力、世界知识和推理性能 三方面均达到国内及开源模型的领先水平。4、具体任务表现:V4-Pro版本的代理编码能力接近顶尖闭源模型,在数学、编程等推理任务上超越所有已开源评测的模型。5、技术创新与迁移提醒:采用 DSA稀疏注意力机制 降低长上下文计算成本;原有 deepseek-chat 等模型名3个月后停止使用,需迁移到新名称。

29. 海外明星公司被曝套壳中国开源模型,负责人出面致歉

30. 揭秘GLM-5技术底牌:「异步强化学习框架Slime」成终极杀招

31. 财报需求和预期全面打开,英特尔突然大涨DeepSeekV4 MIMO也来了:拼谁把算力榨干 | 模型压缩 |CPU|GPU

32. DeepSeek V4 + Claude Code 一手实测!夯爆了还是拉完了?

33. DeepSeek V4实测体验

34. DeepSeek V4 Pro全面测评

35. Deepseek V4第一波测评来了!

36. DeepSeekV4预览版本正式发布

37. Deepseek V4即将发布,国产算力深度适配

38. 等了半年!DeepSeek V4终于要来了

39. DeepSeek V4震撼发布!实现全球开源领先

40. DeepSeek V4 全面详情介绍

41. DeepSeekV4预览版发布

42. “DeepSeek V4”发布

43. DeepSeek V4技术报告深度拆解

44. 硅谷慌了!DeepSeek V4代码能力90%,国产大模型首次超越Claude

45. DeepSeek V4 API 完全指南

46. Deepseek v4最新报告

47. 实测DeepSeek-V4,GLM-5.1,GPT-5.5谁更强?结果出人意料!

48. GLM-5.1深度解析

49. 智谱AI GLM-5.1悄然上线

50. DeepSeek-V4-Pro 写代码到底行不行?我拿 GLM-5.1 跟它硬碰硬比了一轮

51. GLM-5.1 正式发布

52. 国产编程模型巅峰对决

53. 智谱GLM-5.1开源

54. 智谱 GLM-5.1 测评

55. GLM-5.1发布,直追Claude Opus 4.6

56. GLM-5.1全面进化,紧逼Opus 4.6

57. 智谱GLM-5.1模型向所有GLM Coding Plan用户开放

58. GLM-5.1 登顶 Code Arena

59. KTransformers Day0 首发适配 GLM-5.1 大模型

60. 智谱AI GLM-5.1登场即巅峰,对标Claude Opus 4.6,刷新全球最佳纪录

61. Day-0支持|摩尔线程完成智谱GLM-5.1极速适配,高效支撑长程任务与代码生成

62. TRAE中国版首发GLM-5.1

63. GLM-5.1突然上线!编程能力飙升近10分,网友实测效果炸裂!

64. 实测 GLM-5.1

65. 智谱 GLM-5.1 开源实测

66. 26元月费挑战Claude!智谱GLM-5.1横空出世,编程能力断档领先

67. Kimi K2.6深度评测

68. 国产编程AI三强横评

69. K2.6 vs M2.7 编码能力硬核对决!SWE超GPT-5.4 | 13h连续编程碾压

70. 国产 AI 编程崛起

71. Kimi K2.6 开源

72. Kimi K2.6 深夜发布

73. Kimi K2.6

74. Kimi K2.6 / GLM 5.1 / MiniMax M2.7开源大模型编程能力对比

75. Kimi K2.6 开源了!还附送了 300 个 Agent 员工?

76. Kimi K2.6 深夜开源

77. 月之暗面发布最强模型KimiK2.6

78. 开源即顶尖?Kimi K2.6 的这些成绩,我不确定该怎么解读

79. Kimi K2.6开源

80. 「代码革命者」Kimi K2.6

81. Kimi K2.6 发布,跑分又追平 Opus 4.6,实测如何?

82. Kimi K2.6开源

83. Kimi K2.6深度测评

84. Kimi K2.6 发布并开源,全面精进代码和 Agent 集群能力

85. Kimi K2.6

86. Kimi K2.6 开源,最强大Agent模型,部署教程

87. Kimi K2.6 API 接入教程

88. 中国AI逆袭!KimiK2.6一夜开源,300个Agent集体上岗,性能碾压GPT-5.4!

89. Vibe Coding 一句话能做联机对战了?实测 Kimi K2.6

90. Kimi K2.6凌晨开源炸场!疯狂屠榜、超越Opus 4.6,12小时连续干活太猛了

91. 月之暗面 K2.6 来了

92. Kimi K2.6深夜开源!国产大模型编程能力进入全球第一梯队

93. 追踪了 300 个大模型一年,我整理了这份国产 API 性价比榜单(2026 Q2)

94. 【深度测评】Kimi K2.6

95. Kimi K2.6 开源了,国产模型开始抢「长周期编程」高地

96. Kimi K2.6深夜炸场!国产开源模型多项超越GPT-5.4,代码能力超强

97. 大模型的编程能力是如何评测出来的?

98. DeepSeek-V4大模型预计将于2026年4月正式上线,核心突破聚焦编程能力与长期记忆技术

99. 2026年4月9日全球主流大模型核心能力参考报告

100. 国内主流大模型编程能力深度对比

101. 2026年AI编程实战

102. 2026全球AI大模型TOP10深度评测

103. DeepSeek-V4-Flash vs GLM-5.1,性能+价格+Token效率全拆解

104. 3台M3 Ultra Mac Studio实测

105. DeepSeek发布V4,DeepSeek V4、Kimi K2.6、GLM5.1 编程对比测试

106. 三足鼎立!DeepSeek V4 vs GLM-5 vs SeedDance 2.0,国产AI选型必看

107. 2026 年大模型 Benchmark 全解析

108. Mistral开源两大编程模型!大参数模型性能超Kimi、Qwen,小参数模型PC可跑

109. 苦于找不到合适的大模型评测基准?我们整理了 378 个 Benchmark,做成了这个开源数据库

110. 2025 年开源 AI 模型回顾

111. GLM-5.1深度解析

112. 2026年最值得关注的10个AI模型,一文读懂技术差距

113. 横向对比第一梯队的大模型们,Minimax 2.7速览。

114. 国产AI开源模型,第一次在编程能力上超越了Claude

115. GLM5.1成开源榜首,估计也比Qwen3.6强

116. 浙大×腾讯提出Chat2Workflow

117. DeepSeek V4的Agent能力是开源第一——但还有一件事,悄悄变差了

118. DeepSeek V4刷屏了,但很少有人提出幻觉率大幅升高的问题

119. DeepSeek-V4海外评测

120. DeepSeekV4来了-王炸还是虚火?

121. Kimi 发布K2.6 开源 AI 模型

122. Kimi K2.6技术架构全解析:万亿参数MoE+原生多模态+Agent Swarm的工程实现

123. 国模崛起 GLM-5.1编程能力实测:首次超越Sonnet 4.5 Thinking

124. 炸场!Kimi 2.6 全面上线!5 大王炸更新一次性拉满

125. DeepSeek V4、Kimi K2.6、GLM5.1对比 DeepSeek 终于发布了 V4 版本,本视频详细介绍了 DeepSeek V4 的详细信息,重点对比测试在复杂系统开发上,DeepSeek-V4、Kimi-K2.6 与 GLM-5.1三者的完成情况,详细内容: 1、 DeepSeek V4 模型参数介绍及对比 2、本次测试需求 PRD 以及测试目标 3、三款模型的测试结果展示 4、测试总结 #AI编程 #DeepSeekV4 #Kimi #GLM5

126. 智谱GLM-5.1实测

127. Kimi K2.6正式开源上线,能力对标GPT-5.4,长文本与Agent全面升级

128. DeepSeek-V4和GPT-5.5第一波实测对决,结果出人意料!

129. DeepSeek V4即将问世,国产大模型再迎重磅升级

130. Kimi K2.6 发布并开源

131. 凌晨!Kimi K2.6 开源:12 小时连编,300 个 Agent 并行

132. Kimi K2.6,现在发布并开源!

133. 国产AI大模型GLM-5.1发布:编程能力距全球最强只差3分!

134. 实测DeepSeekV4:天下武功,唯快不破

135. Kimi K2.6 官方 API 上线:全面精进代码能力,更适配OpenClaw/Hermes框架

136. DeepSeek V4 vs GPT-5.5:真实项目实测! DeepSeek V4 今天发布,这期不只看官方 Benchmark。 我拿两个真实工程项目做实测:一个是图片生成项目的认证迁移,一个是把 CLI Agent 做成 Web 聊天界面。结论很直接:DeepSeek V4 官方上限很强,Apex、Codeforces、SWE Verified 都很亮;但真实项目里表现分裂,一个项目 7.0,一个项目 8.2。 一句话总结:长上下文、Agent 原型、工具调用链路值得试;多用户生产系统、安全边界和工程收尾,还需要 review 和补测。 #DeepSeekV4 #DeepSeek #AI编程实测 #大模型评测 #AI新星计划

137. DeepSeekV4亮相,代码能力碾压GPT?

138. Kimi 刚刚发布了 K2.6

139. GLM-5.1 重磅上线,编程能力剑指Claude Opus 4.6,Coding plan订阅再次火速售罄

140. 【清华代码熊】Coding 测评 GLM 5.1、DeepSeek V4,选哪个?

141. 主流编程大模型对比分析报告

142. DeepSeekV4即将在春节前后发布,有望超越OpenAI、GPT及Claude

143. 智谱GLM三连炸!从GLM-5到5-Turbo再到GLM-5.1,国产编程模型杀疯了

144. Kimi K2.6 三大能力实测:编码、多模态、10+ Agent 集群

145. 国产大模型横向评测报告:Kimi K2.5 vs MiniMax M2.5 vs GLM-5

146. Kimi K2.6与GLM5.1,编程长任务实测对比 本视频详细对比了在复杂系统开发上,Kimi-K2.6 与 GLM-5.1谁的效果更好,详细内容: 1、Kimi-K2.6 与 GLM-5.1 模型参数介绍 2、本次测试需求 PRD 以及测试目标 3、测试总结 #AI编程 #Kimi #GLM #AI编程技巧

147. 海外评测DeepSeek-V4:智能体任务排名开源第一 幻觉率上升、Token消耗大

148. DeepSeek V4 实测:从两个场景看看效果

149. OpenCode接入DeepSeekV4实现AI编程

150. DeepSeekV4实测翻车!高端乱杀,小事卡壳太离谱

151. DeepSeek V4轻量版内测,藏着哪些意外亮点?

152. GLM-5.1编程能力深度评测:基于真实数据

153. GLM-5.1 公测开放了

154. DeepSeek-V4将至!3大硬核突破,破解大模型3大痛点

155. DeepSeek V4 测评,与国产其他大模型相比怎么样?

156. 实测 DeepSeek V4 Pro,惊喜和不足

157. CoStrict 现已支持 Kimi K2.6,带来更强长程编码和自主执行能力

158. 绝了!DMXAPI推出Deepseek-v4最新大模型,代码生成超给力

159. DMXAPI平台实测智能模型,glm-5.1表现亮眼,比官方定价便宜不少

160. Kimi-K2.6 前端/后端/Agent编程能力实测! 给大家带来刚刚正式发布的 kimi-k2.6 的正式版本的实测! 本次为了考验它的长程Agentic Coding能力, 我用 kimi-k2.6-code-preview 写了个 harness 游戏自动生成框架, 它可以根据给到的人设/场景/数值设计等规则, 自动生成关卡, 背景图片, 甚至配音! 其中框架驱动和草稿模型使用 kimi-k2.6, 文生图和生成语音由 kimi-k2.6 生成 prompt 后调用其它大模型生成. 最好玩的是, 我做了个"无头"版本的游戏cli接口, kimi-k2.6 能像玩互联网早期Mud游戏一样, 使用纯文本玩这个游戏, 每当它生成关卡之后, 他就可以直接进入游戏游玩一下, 来验证关卡设计得是否正确. 而内部设计又分为了对话生成skill, 脚本生成skill, 关卡生成skill, 游戏测试大师skill, 游戏资深玩家skill(由于检讨游戏性) 等等, 从而实现了让大模型自己写游戏自己玩! 每个关卡大概需要一个小时生成和验证, 如果并行验证应该还能更快一些(做多线程BFS/DFS). 另外本次依旧使用大家都熟悉的测试项目进行了前端/后端/Agent能力测试, 从测试来看, 复杂项目前端能力(建模, 空间理解, 物理模拟等)略有下降, 但后端和 Agent 能力有明显提升. 不过如果你是纯做网站的话, 可以用 kimi 网站上的的 k2.6 Agent 模式, 由于 Agent 能力足够强所以可以在这个模式下多步来提升生成的网站质量和交互体验. #kimi #kimik26 #moonshot #月之暗面 #kimicli

161. TRAE 中国版内置模型已支持 GLM-5.1

162. Kimi K2.6深度评测:编程与Agent能力拆解 本视频深度评测开源大模型Kimi K2.6的核心性能。涵盖MoE架构解析、SWE-Bench Pro编程工程实测、长程推理及多智能体Agent协作能力,并针对开发者提供落地选型建议。#KimiK26 #大模型评测 #MoE架构 #AIAgent #软件工程

163. 大语言模型综合排行榜 26-03-15

164. 青云智算上线 GLM-5.1

165. AI一刻 | 特斯拉Optimus3迈步!Grok/Claude双升级 Qwen3.6/GLM-5.1齐发力

166. GLM-5.1 全面支持与 Gemini CLI 集成:HagiCode 的多模 - 哔哩哔哩

167. GLM-5.1 全面支持与 Gemini CLI 集成:HagiCode 的多模型进化之路

13
扫一下,分享更方便,购买更轻松
3评论

  • 精彩
  • 最新
  • 谁写代码用flash啊 肯定是开max模式的Pro啊 [高兴]

    校验提示文案

    提交
  • kimi的app用着比千问好多了

    校验提示文案

    提交
  • 什么时候lite 26了?

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章