8. 硅谷慌了。
DeepSeekHarness这只“黑鲸”正式浮出水面。公众号独立注册、全球内测招募、V4-Flash同步公测,当一家中国AI公司开始自己造“马具”的时候,大洋彼岸的巨头们还坐得住吗?
8月11日,“DeepSeekHarness团队”微信公众号完成注册。Logo是一只黑色鲸鱼,认证主体为北京深度求索公司。账号7月6日注册,次日即完成认证。
Harness到底是什么?绝大多数人压根没搞懂。
DeepSeek内部有一个核心公式:Model+Harness=Agent。模型是大脑,负责推理、理解需求、生成代码。Harness呢?是执行神经系统,负责调度工具、管理任务状态、执行闭环。大白话:模型只会“说”,Harness让AI真正“动手干”。
这玩意儿能干什么?自主读取解析代码仓库、批量修改源码文件、自动化运行单元测试、精准定位漏洞、自主修复bug。从需求对接到代码开发再到测试运维,端到端,全流程。
Harness为什么重要?因为2026年,Harness直接带动了VibeCoding成为“GPT时刻”以来首个成功商业化的杀手级应用。
最知名的两款Harness,OpenAI的Codex和Anthropic的ClaudeCode。ClaudeCode有多猛?Anthropic在2026年2月完成300亿美元G轮融资后透露,ClaudeCode年化收入已经来到25亿美元。东方证券研报显示,2026年全球智能体代码市场规模约80亿美元,CR4高达86%,远期中美总潜在市场合计达4000亿美元。
DeepSeekHarness一上来,就直接对标ClaudeCode。
更狠的是,DeepSeek资深研究员陈德里早就在社交媒体上放了话,“简单来说就是对标ClaudeCode,做DeepSeekCodeHarness”。
8月7日,FloatboatHarness在五项第三方基准上发布完整评测数据。底座用的是DeepSeekV4-Flash,输入$0.14/百万token、输出$0.28,混合价$0.175/M。对面是ClaudeOpus4.8,混合价$10/M,贵57.1倍。
结果呢?$0.175的底座,五项全部超过$10的旗舰。
赢它的不是模型,是Harness。同一个DeepSeek-V4-Flash,跑在官方自己的Harness上和跑在别人家框架上,效果天差地别。Harness做得好,模型能力就能被十倍、百倍地释放。
AnthropicClaudeCode还有一个致命问题,闭源。
上个月,部分AI社区用户发现,当用户指向非官方端点时,ClaudeCode客户端会把代理域名、系统时区等信息隐写回传给Anthropic服务器。工信部网络安全威胁和漏洞信息共享平台已经发布了风险提示。
你的代码库目录结构、系统时区,正在被悄悄传回硅谷。
而DeepSeekHarness团队秉承什么理念?开放。明确组建多个模型接口方向的工程师团队,不限于接入自家模型。模型团队与Harness团队分离,Harness可能独立运作,甚至与其他模型厂商合作。
这场仗打到这个份上,DeepSeek要的已经不是API调用量了。
行业价格战打到什么程度?国产大模型在OpenRouterToken调用量月榜前十中占据七席,DeepSeekV4Flash位列第二。但单纯卖算力的模式,天花板已经到了。
Harness的战略价值在于,从“卖算力”转向“交结果”。客户付费依据从模型调用量变成实际完成的工程任务。价值创造和收益直接挂钩,彻底跳出低价竞争的红海。
硅谷慌的不是DeepSeek又发布了一个模型。
慌的是,一家中国公司开始自己定义“模型之外的一切”。慌的是,当行业竞争从“底层模型比拼”转向“落地能力与工程体系的较量”时,DeepSeek已经悄悄把Harness这条战线铺开了。慌的是,贵57.1倍的对手被打趴下,靠的不是更贵的模型,而是一套更好的Harness。
更慌的是,如果Harness真的开源,行业统一脚手架这个位置,它就有机会先占住。
梁文锋曾经说过,DeepSeek现阶段最重要的是CodingAgent。Harness就是这句话的落地,不是模型,不是论文,是能跑、能干、能交付结果的系统。
硅谷慌了。因为这次浮出水面的,不是又一个大模型参数榜单,而是一整套能让AI真正“干活”的底层系统。黑鲸才刚露头,水面下的动静,才刚刚开始。
信息来源:界面新闻《DeepSeek智能体要来了?公众号已完成注册认证》(2026-08-12)#DeepSeek智能体要来了吗#