张大妈

字节前员工复盘:中美AI差距在扩大,底层逻辑与迭代速度成关键

源自新浪微博:信号与噪声001

04-28 10:39

精选参考来源

字节跳动前员工爆料国产头部AI公司内幕:1)他认为中美 AI 差距在扩大不是缩小。2)蒸馏走捷径很普遍。3)训练用的都是英伟达的卡。4)国产的AI Agent完全不实用。~~~~~~~~~张驰,浙大本科,UCLA 博士(导师朱松纯),2025 年加入字节 Seed 做数学推理,干了一年后离职去北大当助理教授。最近上播客 Into Asia 回顾了在字节的一年,不少判断跟目前的公开叙事直接冲突。他的核心观点:1. 字节跑完一轮完整迭代(预训练+后训练)要大约半年,谷歌据传三个月。他认为迭代速度差距是追不上的根本原因。2. Seed 内部 benchmaxxing 严重。领导按 benchmark 分数考核,大家都在刷榜,但他说纸面追平了不等于真的好用,「实际体验不行」。3. 2024 年底 Seed 自认追平了 GPT-4o,结果 DeepSeek 一出来才发现差距还在。他入职时全组紧急转强化学习。4. 他认为中美 AI 差距在扩大不是缩小。原话:「我甚至不同意国内在追赶这个说法,我们仍然远远落后。」同事和学生同意,但智谱、MiniMax 这些上市公司的领导层不会同意。5. 蒸馏走捷径很普遍。很多公司直接调 Claude/GPT/Gemini 的输出当训练数据。不过他也承认 DeepSeek 在 V3/R1 上有真正的架构创新。6. 字节主力芯片是 NVIDIA H20,最快的卡留给预训练和后训练团队。国产芯片有但没人用于训练。字节在海外采购新一代 NVIDIA 芯片,但「肯定不在大陆」。7. 美国公司有用户反馈飞轮,模型好用→用户多→反馈好→模型更好。国内模型起步差,没人愿意用在重要工作上,数据拿不到,恶性循环。8. 他在谷歌实习时觉得基础设施「太好了」,跟字节差距巨大。不只是芯片,训练框架和整个基础设施都差一截。9. 国内AI 从业者普遍用美国 Agent 工具。他自己用 Claude Code 和 Copilot,国内模型的编码 Agent 他评价「完全不实用」。字节海外团队直接用 Cursor。10. Claude Code 好用到让他在想还要不要培养博士生,但又怕不培养下一代,以后没人做研究。背景补充:张驰在字节只待了约一年,所在的数学组他自己说偏宣传性质,不在核心的预训练/后训练团队。他的观点是个人视角,不代表字节全貌。
内容由AI生成

精选参考来源

字节跳动前员工爆料国产头部AI公司内幕:1)他认为中美 AI 差距在扩大不是缩小。2)蒸馏走捷径很普遍。3)训练用的都是英伟达的卡。4)国产的AI Agent完全不实用。~~~~~~~~~张驰,浙大本科,UCLA 博士(导师朱松纯),2025 年加入字节 Seed 做数学推理,干了一年后离职去北大当助理教授。最近上播客 Into Asia 回顾了在字节的一年,不少判断跟目前的公开叙事直接冲突。他的核心观点:1. 字节跑完一轮完整迭代(预训练+后训练)要大约半年,谷歌据传三个月。他认为迭代速度差距是追不上的根本原因。2. Seed 内部 benchmaxxing 严重。领导按 benchmark 分数考核,大家都在刷榜,但他说纸面追平了不等于真的好用,「实际体验不行」。3. 2024 年底 Seed 自认追平了 GPT-4o,结果 DeepSeek 一出来才发现差距还在。他入职时全组紧急转强化学习。4. 他认为中美 AI 差距在扩大不是缩小。原话:「我甚至不同意国内在追赶这个说法,我们仍然远远落后。」同事和学生同意,但智谱、MiniMax 这些上市公司的领导层不会同意。5. 蒸馏走捷径很普遍。很多公司直接调 Claude/GPT/Gemini 的输出当训练数据。不过他也承认 DeepSeek 在 V3/R1 上有真正的架构创新。6. 字节主力芯片是 NVIDIA H20,最快的卡留给预训练和后训练团队。国产芯片有但没人用于训练。字节在海外采购新一代 NVIDIA 芯片,但「肯定不在大陆」。7. 美国公司有用户反馈飞轮,模型好用→用户多→反馈好→模型更好。国内模型起步差,没人愿意用在重要工作上,数据拿不到,恶性循环。8. 他在谷歌实习时觉得基础设施「太好了」,跟字节差距巨大。不只是芯片,训练框架和整个基础设施都差一截。9. 国内AI 从业者普遍用美国 Agent 工具。他自己用 Claude Code 和 Copilot,国内模型的编码 Agent 他评价「完全不实用」。字节海外团队直接用 Cursor。10. Claude Code 好用到让他在想还要不要培养博士生,但又怕不培养下一代,以后没人做研究。背景补充:张驰在字节只待了约一年,所在的数学组他自己说偏宣传性质,不在核心的预训练/后训练团队。他的观点是个人视角,不代表字节全貌。

8
扫一下,分享更方便,购买更轻松
7评论

  • 精彩
  • 最新
  • 再训练下去,收益不能覆盖成本了,所以差距没法多大,接下来看应用场景了,应该会越来越多的免费服务,跑马圈地开始。

    校验提示文案

    提交
  • 软硬件协调一体化很重要,国内要走自己的技术栈,华为手机最开始自研芯片时候也是被批的满头包,但现在软硬件深度结合其他手机厂家想追赶也没办法,华为可以让芯片去适应需求,而其他家只能去适应芯片。

    校验提示文案

    提交
  • 盘盘还有5秒钟到达评论区

    校验提示文案

    提交
  • 这些认为"中美AI差距在拉大"的人,本质上还是把大模型当成了真正的智能体。
    但真相是:今天所有的大模型,无论GPT还是其他,本质上都是高级统计拟合器——它们在做的事情,不过是通过海量数据训练,学会用概率来"猜"下一个最可能出现的词。中美之间的差距,充其量是"猜得更准一点"和"猜得稍差一点"的区别,而不是"有智能"和"没智能"的鸿沟。
    更关键的是,这种"猜得更准"未必是线性的进步。模型的能力提升并不保证每一次迭代都是正向的优化——有时候参数堆上去了,幻觉反而更多了;有时候训练数据扩大了,偏见和错误模式反而被强化了。你看到的"差距拉大",可能只是在一条错误道路上比谁跑得更快而已。

    校验提示文案

    提交
    不管怎么说 也不管你承不承认 事实始终是事实 国外顶尖模型就是比所有国产模型更优秀 美国也一直是人类创新阵地的最前沿 ***

    校验提示文案

    提交
    陆炮上舰,确实很会创新 [不说话]

    校验提示文案

    提交
    还有1条回复
    收起所有回复
提示信息

取消
确认
评论举报

最新文章 热门文章