DeepSeek Harness内测刚开,第一批开发者已经踩了这些坑

源自26位全网作者

08:26

内容由AI生成

精选参考来源

1. 黑鲸出水!DeepSeek Harness公众号正式上线

2. 的微博

3. deepseek-harness上线并重磅开源

4. 官方Harness还没出,民间大神已经让DeepSeek省了99%的钱!

5. deepseek的最佳搭档居然是zcode opencode的开发人员dax公布了一个有趣的事情。用他们家opencode go套餐来使用deepseek的客户端多种多样。 但是根据他们的数据,缓存命中率最高的居然是智谱的zcode,达到惊人的98.60%,比opencode自家的客户端还高。 dax表示他也无法解释这一现象,只能说智谱的harness确实有点东西,也表明deepseek开发自家harness的紧迫性。

6. DeepSeek生成的内容会编造数据吗?

7. Is DeepSeek's AI compliant with international data protection regulations?

8. DeepSeek,重大发布

9. 08|Harness 安全设计:命令执行、文件修改、密钥和权限

10. 尴尬!你的deepseek挂在了别人的电脑上 Deepseek 手机端和网页端的操作管理不互通。手机上的登出所有设备对电脑端并不起效[伤心] 如果用别人电脑,使用了自己的deepseek一定要记得退出登录。 当然,如果不介意别人看到你和D老师的沟通内容,那就直接忽略吧[偷笑] #deepseek# #隐私#

11. 天变了。 DeepSeek Harness团队公众号刚刚完成注册,Logo是一只黑色鲸鱼,这是DeepSeek首次为Harness业务线单独设立官方发布阵地。从模型到智能体,DeepSeek这一步,到底要多大? 公众号注册时间是7月6日,7月7日就完成了认证,一个月过去了,账号里一个字没发。但这一个月,外面已经沸腾了。 7月31日,DeepSeek-V4-Flash正式版API悄悄上线公测,什么叫悄悄?没有发布会,没有通稿,就更新了一条API日志,Agent能力暴涨6倍。 在权威的Terminal Bench 2.1测试里,Flash正式版拿了82.7分,把自家V4-Pro预览版的72.1分远远甩开。逼近Opus-4.8的85分。 更狠的是什么?第三方评测机构Artificial Analysis当天就把Flash放上了榜单,智能指数50分。比自家V4-Pro还高6分。一个Flash版,把Pro版反超了。而Flash版的总参数2840亿,激活参数才130亿,一个轻量模型,把旗舰预览版摁在地上摩擦。 最让人细思极恐的是另一件事:模型结构和尺寸跟预览版一模一样,只把后训练重做了一遍。三个月前官方自己承认Flash在复杂Agent任务上跟Pro有差距,三个月后同一个身子把Pro给反超了。后训练的优化空间,远比我们想象的更大。 这帮人到底在憋什么大招? Harness团队负责人叫崔添翼,90后,浙大计算机毕业,大学拿了6枚ACM亚洲金牌。然后在全球顶尖量化机构Jane Street干了9年。2022年联合创办量化交易公司TSY Capital。今年3月加入DeepSeek。 他不是传统AI学术派,他是搞量化交易出身的,玩的是真实系统、低延迟交易、模型输出落到执行层会遇到什么坑。DeepSeek找他来带Harness,说明什么?说明这家公司清楚一件事,光有模型不行,得让模型真的能干活。而让模型干活这件事,需要的是懂真实系统的人,不是只会写论文的人。 现在市面上绝大多数大模型都是“嘴炮型”,你说它懂,它什么都懂;你让它干,它什么都干不了。不会读写本地文件,不会调用第三方工具,代码报错不会自己修。Harness要干的事,就是补齐这些短板。把AI从一个“会聊天”的东西,变成一个“能干活”的东西。 这一步,比大多数人想象的要大得多。 中信证券的研报点得很透:拥有成熟Harness的厂商,同时握着两项稀缺资产,一是从任务入口到结果交付的商业闭环,二是长程任务轨迹和纠错反馈这类高质量数据。这两样东西互为强化,先发者的优势很难被追上。 换句话说,谁先把Harness做出来、跑起来、形成数据飞轮,谁就在下一代AI竞争里卡住了身位。 DeepSeek这次对标的是谁?Claude Code。 Anthropic的Claude Code年化收入已经超过25亿美元,周活用户翻倍增长。OpenAI的Codex周活用户在15天内从300万涨到400万。全球智能体代码市场规模约80亿美元,远期中美总潜在市场合计4000亿美元。这不是小打小闹。 DeepSeek的Harness团队现在什么状态?缺人,非常缺人。崔添翼自己说“我每天都在面试,在各个渠道发布招聘小广告”。目标宏大,工作繁重,人手仍然紧缺。 8月1日他面向全球开启内测用户征集,优先招募有Agent开发实战经验的开发者。结果一条内测帖发出去,评论区秒变“开源Agent路演”,截至8月3日上午,769位报名者、712个开源仓库、合计超过120万Stars。 开发者们排队往里冲。 但也得泼盆冷水。Harness这个东西,DeepSeek自己都还没正式发布,V4-Flash的测试分数是在DeepSeek Harness“极简模式”下跑的,自家框架测自家模型,这分数得打个折。而且官方技术报告也承认,模型在超过128K上下文后性能就开始往下掉。从测试到产品,从内测到大规模商用,中间的坑一个都不会少。 还有一个潜在风险:崔添翼在社交平台上说过,DeepSeek招人需要能用中文工作。这话被外界解读为“不招外国人”。在全球化的AI竞争里,人才池子主动收窄,会不会影响团队的技术视野和工程速度?这事值得盯。 但无论如何,DeepSeek这一步已经迈出来了,从公众号注册到内测招募,从V4-Flash的Agent能力暴涨到Harness框架的首次亮相,这家公司正在做一件很多人想做但没做成的事,让AI真正能干活。#DeepSeek智能体要来了吗##上头条 聊热点#

12. deepseek的最佳搭档居然是zcode opencode的开发人员dax公布了一个有趣的事情。用他们家opencode go套餐来使用deepseek的客户端多种多样。 但是根据他们的数据,缓存命中率最高的居然是智谱的zcode,达到惊人的98.60%,比opencode自家的客户端还高。 dax表示他也无法解释这一现象,只能说智谱的harness确实有点东西,也表明deepseek开发自家harness的紧迫性。

13. DeepSeek Harness:AI Agent 开发提速神器

14. DeepSeek的Harness,为何是一头黑色鲸鱼?

15. How does DeepSeek ensure compliance with data protection regulations?

16. DeepSeek Harness开启内测?看来V4正式版也不远了

17. DeepSeek Harness 上线:一切皆为插件,一切皆是可能

18. 试玩Deepseek-v4-flash正式版【哪款herness最适配】

19. 官方Harness还没出,民间大神已经让DeepSeek省了99%的钱!

20. 【分享】DGXSpark部署DeepSeek常见问题

21. 同一道题,成本省 8 倍!我们做了最省钱的 Harness「Maka」

22. DeepSeek开设「Deepseek Harness团队」账号

23. AI斩杀线更新!DeepSeek V4 Pro正式版发布,马斯克成最大受害者

24. DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建

25. AI工具怎么选?深度使用豆包、DeepSeek半年,真实体验差距曝光

26. 试玩Deepseek-v4-flash正式版【哪款herness最适配】

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章