11. 天变了。
DeepSeek Harness团队公众号刚刚完成注册,Logo是一只黑色鲸鱼,这是DeepSeek首次为Harness业务线单独设立官方发布阵地。从模型到智能体,DeepSeek这一步,到底要多大?
公众号注册时间是7月6日,7月7日就完成了认证,一个月过去了,账号里一个字没发。但这一个月,外面已经沸腾了。
7月31日,DeepSeek-V4-Flash正式版API悄悄上线公测,什么叫悄悄?没有发布会,没有通稿,就更新了一条API日志,Agent能力暴涨6倍。
在权威的Terminal Bench 2.1测试里,Flash正式版拿了82.7分,把自家V4-Pro预览版的72.1分远远甩开。逼近Opus-4.8的85分。
更狠的是什么?第三方评测机构Artificial Analysis当天就把Flash放上了榜单,智能指数50分。比自家V4-Pro还高6分。一个Flash版,把Pro版反超了。而Flash版的总参数2840亿,激活参数才130亿,一个轻量模型,把旗舰预览版摁在地上摩擦。
最让人细思极恐的是另一件事:模型结构和尺寸跟预览版一模一样,只把后训练重做了一遍。三个月前官方自己承认Flash在复杂Agent任务上跟Pro有差距,三个月后同一个身子把Pro给反超了。后训练的优化空间,远比我们想象的更大。
这帮人到底在憋什么大招?
Harness团队负责人叫崔添翼,90后,浙大计算机毕业,大学拿了6枚ACM亚洲金牌。然后在全球顶尖量化机构Jane Street干了9年。2022年联合创办量化交易公司TSY Capital。今年3月加入DeepSeek。
他不是传统AI学术派,他是搞量化交易出身的,玩的是真实系统、低延迟交易、模型输出落到执行层会遇到什么坑。DeepSeek找他来带Harness,说明什么?说明这家公司清楚一件事,光有模型不行,得让模型真的能干活。而让模型干活这件事,需要的是懂真实系统的人,不是只会写论文的人。
现在市面上绝大多数大模型都是“嘴炮型”,你说它懂,它什么都懂;你让它干,它什么都干不了。不会读写本地文件,不会调用第三方工具,代码报错不会自己修。Harness要干的事,就是补齐这些短板。把AI从一个“会聊天”的东西,变成一个“能干活”的东西。
这一步,比大多数人想象的要大得多。
中信证券的研报点得很透:拥有成熟Harness的厂商,同时握着两项稀缺资产,一是从任务入口到结果交付的商业闭环,二是长程任务轨迹和纠错反馈这类高质量数据。这两样东西互为强化,先发者的优势很难被追上。
换句话说,谁先把Harness做出来、跑起来、形成数据飞轮,谁就在下一代AI竞争里卡住了身位。
DeepSeek这次对标的是谁?Claude Code。
Anthropic的Claude Code年化收入已经超过25亿美元,周活用户翻倍增长。OpenAI的Codex周活用户在15天内从300万涨到400万。全球智能体代码市场规模约80亿美元,远期中美总潜在市场合计4000亿美元。这不是小打小闹。
DeepSeek的Harness团队现在什么状态?缺人,非常缺人。崔添翼自己说“我每天都在面试,在各个渠道发布招聘小广告”。目标宏大,工作繁重,人手仍然紧缺。
8月1日他面向全球开启内测用户征集,优先招募有Agent开发实战经验的开发者。结果一条内测帖发出去,评论区秒变“开源Agent路演”,截至8月3日上午,769位报名者、712个开源仓库、合计超过120万Stars。
开发者们排队往里冲。
但也得泼盆冷水。Harness这个东西,DeepSeek自己都还没正式发布,V4-Flash的测试分数是在DeepSeek Harness“极简模式”下跑的,自家框架测自家模型,这分数得打个折。而且官方技术报告也承认,模型在超过128K上下文后性能就开始往下掉。从测试到产品,从内测到大规模商用,中间的坑一个都不会少。
还有一个潜在风险:崔添翼在社交平台上说过,DeepSeek招人需要能用中文工作。这话被外界解读为“不招外国人”。在全球化的AI竞争里,人才池子主动收窄,会不会影响团队的技术视野和工程速度?这事值得盯。
但无论如何,DeepSeek这一步已经迈出来了,从公众号注册到内测招募,从V4-Flash的Agent能力暴涨到Harness框架的首次亮相,这家公司正在做一件很多人想做但没做成的事,让AI真正能干活。#DeepSeek智能体要来了吗##上头条 聊热点#