免费的"追平GPT-6"编程模型扎堆上线:PixelCanary们的三本账,算清再把你代码递出去

源自319位全网作者

17:01

9月25日深夜,Vercel AI Gateway 上没有任何预告,悄悄多了一个带紫色光标的模型条目:stealth/pixel-canary。没有开发团队名字,没有发布会,只有一句"限时免费"。几天后,Cline 也宣布它在自己平台免费开放。 然后标题就来了——“免费,性能追平 GPT-6 Astra”。36氪

它还不是唯一一个。往前数两周:8月有个 OxAlpha 匿名上线,被中文社区叫作"牛来",猜了一阵后智谱揭晓它就是 GLM-5.3-Flash。 9月16日 OpenRouter 又上线了 UnionAlpha,平台披露其首日处理 Token 约20亿,到发稿时累计已超1000亿。 9月23日再冒出一只100万上下文的 SpaceBunny,上线后稳居 OpenCode 调用量榜第二、在 OpenRouter 调用量榜一度干到第一,OpenCode 官宣帖浏览量破百万。36氪36氪智东西

如果你是那种订着 Claude Code 或 Cursor、每月对着 token 账单叹气、看到"免费"就想接进工作流的开发者,这篇就是写给你的。刚经历过 ZCode"313MB 代码上传"风波、近400人维权、智谱单周跌掉20%的这拨人,对"免费"的态度早就变了:白嫖可以,但先把账算清。 这里以 PixelCanary 为主样本,算三本账:成功率账、时间账、数据账。知乎哔哩哔哩

第一本账:那个90.3%,不是你以为的意思

Next.js AgentEvals 是 Vercel 家的评测,考的是智能体完成真实 Next.js 开发任务:App Router 迁移、数据获取、图片和字体优化、缓存、页面过渡。常规设置下,PixelCanary 在 31 项任务里过了 28 项,成功率 90.3%,与 GPT-6 Astra(高推理强度)持平,高于 Kimi K3 的 84%。36氪

免费的

先把口径拆开:

  • 这项评测用的是 pass@4——每项任务最多允许试四次,有一次成功就算这项过了。所以 90.3% 不能读成"交给它十个任务,首次就能成九个"。36氪

  • 当评测通过 AGENTS.md 把 Next.js 文档喂给智能体后,PixelCanary 成功率升到 96.8%。但同一设置下,Kimi K3、GPT-6 Astra 也到约 97%——"追平"这个结论,是建立在"文档喂到嘴边"这个条件上的。

这反而是整场评测里对普通开发者最有用的信息:项目里的 AGENTS.md、代码规范、框架版本说明,对结果的影响可能和你选哪个模型一样大。免费模型效果差,先别急着怪模型,看看你的项目说明喂没喂。同样的道理也适用于 UnionAlpha:它的"前沿级性能"目前只是平台口径,没有 SWE-bench、Terminal-Bench 这类公开可复现的成绩,社区跑 SMF 157 项测试拿到 136/157、零错误、成本 0 美元,是个不错的参考,但都还够不上"结论"。36氪

第二本账:免费不收钱,收时间

榜单同一行还有另一列数字,被大部分标题裁掉了:PixelCanary 平均每个任务耗时 1015.80 秒,约 16 分 56 秒;同一榜单上 GPT-6 Astra 是 251.89 秒,Kimi K3 是 352.34 秒。 成功率持平的另一面,是速度只有对手的 1/4。36氪

社区实测就更劝退了:有人跑经典的"鹈鹕骑自行车"基准,跑了 5 个小时,中途各种报错,输出速度是个位数 TPS;有人等了 8 小时后直接放弃;还有人形容它的响应速度"让人想起电传打字机时代"。 UnionAlpha 那边也有同类反馈:速度极其缓慢,只是 DeepSWE 性价比略优于 Opus5 和 GLM-5.3。36氪36氪

免费的

要说公道话:这些都是个人测试,延迟到底是模型本身还是上线初期的服务资源挤兑,目前没有定论,不能当成统一性能指标。但榜单上 17 分钟的平均任务耗时,和 Reddit 上"读代码库慢到没法判断能力"的反馈指向同一件事——能做完,和能高效地做完,是两件事。 一个你等 20 分钟出结果的模型,跑下班前挂机的评测任务可以,卡在你的 CI 或结对编程工作流里,省下的订阅费会以更贵的方式还回去。

第三本账:同样叫"免费",条款是三六九等的

这是三本账里最该先看的,也是最容易被"免费"两个字糊过去的。Vercel 在发布说明里白纸黑字:PixelCanary 不提供零数据保留(ZDR),发给模型的提示词和回复可能被用于训练及模型改进;提供方可能保留输入与输出。 翻译一下:当你把代码仓库接进智能体,代码、配置文件、项目上下文,都可能随任务进入模型请求,并且对方不承诺删。36氪

但同一批匿名模型,条款并不一样:OpenCode Zen 渠道接入 UnionAlpha 时,明确说服务商遵循零数据保留政策、不会使用用户数据训练模型。 SpaceBunny 在 OpenCode 免费使用期间,也被报道不做用户数据留存。 也就是说,免费浪潮里真正该比的是渠道条款,而不是模型名字——同一只"兔"换个入口,数据命运可能就不同。放在两个月前这也许只是条款里的一行小字;放在 ZCode 风波之后,开发者听到"不承诺保留"这几个字的敏感度,已经完全不同了。36氪智东西

所以"什么能喂"要分层,一刀切就亏了:

  • 可以玩:一次性前端玩具、练手 Demo、公开素材的二次开发、下班挂机跑的评测任务——反正不心疼。SpaceBunny 被玩出花的前端和 3D 场景就是典型用法:有开发者一句简单提示词,让模型花了四十分钟左右做出简易版《我的世界》,能破坏和放置方块,不过他自己也承认改了很多轮才成。智东西

  • 别碰:公司代码库、私人仓库、带密钥和连接串的配置、任何用户隐私数据。渠道没有 ZDR 承诺时,对这些数据说"不"的方式只有一个:不发。

  • 换主力?不划算。这轮免费模型的价值是"多一个测试选择",不是"替你续订"。

猜马甲游戏:神秘感是有保质期的

社区竞猜照例很热闹:PixelCanary 被拿泰语、印地语文本的切分方式测出"貌似 Qwen 系",有人从"Pixel"和"Canary"的命名猜 Google,还有人说自己 80% 确定这款模型是 Kimi K3.1。 Reddit 上为上下文窗口争过一轮——26.2 万 token 不像支持 100 万的 Gemini,立刻有人反驳谷歌部分编码应用就是 16.8 万、Pro 约 26.2 万。SpaceBunny 被猜是 MiniMax 新模型,Up 主直接做了一期"它真的是MiniMax的新模型吗"的实测视频,UnionAlpha 则被猜是 GLM-5.3 Flash 系。 全部是推测,没有一条有官方证实。36氪哔哩哔哩

免费的

匿名上线有它的合理性:去掉厂牌,先动手测,比官方跑分表更早暴露真实能力。但一个月四轮"神秘上新",注意力已经从"这模型能干什么"滑向"这次又是谁在制造悬念"。目前没有证据表明哪家的匿名发布是刻意炒作,可"牛来"的故事在厂商认领那一刻就结束了——免费窗口关闭之后还留不留得住人,靠的是稳定、速度、可重复的表现和数据条款,不是代号和紫色光标。别忘了反例:SpaceBunny 吹爆的帖子里,也有开发者用相同提示词测出结果差很大、直言"没那么好用"。

这周值得继续盯的四个信号

  1. 厂商是否正式认领(牛来已经演示过一次剧本);

  2. 各家免费窗口具体到几号——这轮"白嫖期"没有义务给你打招呼,窗口一关一切照旧;

  3. 速度是否随资源扩容改善:同一评测环境复测任务耗时,比看新跑分有用;

  4. 条款是否变化:只要 PixelCanary 还是"无 ZDR",第三本账的分层建议就一直有效。

一句话收尾:这波免费匿名模型不是不能用,是不能"不看 pass@4 口径、不看任务耗时、不看数据条款"就用。你的订阅可以等等再续,你的代码不行。

(数据与口径均来自 Vercel AI Gateway/Next.js AgentEvals 公开信息、OpenRouter/OpenCode 公告、Cline 公告及 InfoQ/36氪、智东西 9 月中下旬报道;社区实测均为个人样本,只代表各自接入条件下的体验。)

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章