字节训练十万亿参数大模型,张一鸣禁蒸馏硬磕自研

源自63位全网作者

18:11

内容由AI生成

精选参考来源

1. 纳米Work跟友商比,有5大技术亮点。 #大有学问 #职场干货 #创业 #企业管理 #红衣聊AI

2. #张一鸣 字节不走模型蒸馏捷径# 这里先科普一下什么叫模型蒸馏,就是拿一个训练好的巨型大模型(教师 Teacher),去指导训练一个结构更小、速度更快的轻量模型(学生 Student),让小模型学到大模型的判断逻辑,实现“瘦身不降太多效果”。强烈支持张一鸣这个决策。

3. 【字节跳动拟训练超5万亿参数模型,或成国内规模最大】8月6日,据《晚点 LatePost》报道,字节跳动正讨论训练一个参数规模超5万亿的大模型。这一规模将远超阿里的Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数),成为国内已知参数规模最大的模型。核心信息:计划由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。计划仍处早期阶段,最终不一定会发布。决策源于Seed团队反思:与其在现有尺寸上追赶,不如一次将参数规模推到同行的数倍以争取领先。两周前的Seed全员会上,张一鸣明确表态反对模型蒸馏,认为这只是在复制已有能力,无法实现真正超越。他同时安抚团队不必过度焦虑,可接受一段时间内落后,目标直指世界第一梯队。观察:字节跳动正试图用“规模换时间”的策略,在国内大模型竞赛中实现弯道超车。张一鸣“不蒸馏”的表态,标志着字节从跟随者向引领者角色转变的决心。#字节跳动 #大模型 #5万亿参数 #张一鸣 #Seed

4. #字节讨论训练国内最大模型# 昨晚看到一条关于字节的深度报道,信息量太大了。字节跳动正在讨论训练一个参数规模超过5万亿的模型。这个数字什么概念?目前国内最大的Kimi K3是2.8万亿,阿里的Qwen3.8-Max是2.4万亿。字节直接翻倍。但比参数更值得关注的是张一鸣的态度。他在Seed全员会上说了几个关键的话:第一,"团队可以暂时落后,但目标是把模型能力推进到世界第一梯队"。第二,明确反对模型蒸馏。他认为蒸馏"本质上是在复制Claude已有的能力,最多只能逼近,很难超越"。第三,字节内部已经禁止蒸馏开源模型,甚至通过API检测来追溯排查疑似蒸馏行为。CEO梁汝波在全员会上的态度更直接:"接受短期落后,坚持自研和优化长期。"翻译一下就是:宁可慢,也不抄捷径。说实话这个态度在当下的大模型行业挺罕见的。别的公司都在疯狂蒸馏、追排名、刷榜,字节选择了一条最难走的路。而且字节不是没能力走捷径——它有国内最充足的算力储备、最多的卡、最多的人才。它是不愿意走。但5万亿参数模型也不是闹着玩的,涉及完全不同量级的系统工程和数据处理。接近Seed的人说:"像一场赌博。"字节从来不缺"大力出奇迹"的勇气。当年抖音就是这样出来的。就看这次赌不赌得赢了。

5. 从 DeepSeek V4 Flash 的表现对比 DSV4 预览版的提升来看。。。如果 DeepSeek V4 Pro + DeepSeek Harness ,表现会无限接近,甚至有机会超越 Kimi K3 + Kimi Work 。。。但是,价格会更便宜。GLM5.2 之后,Kimi 也要变成牛夫人了吗。。。

6. 赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

7. 【#字节跳动训练10万亿参数超大模型##字节训练模型或接近Anthropic最先进系统#】据英国《金融时报》报道,字节跳动正在训练一个AI模型,其规模可能接近Anthropic最先进的Mythos系统。目前,中国公司正继续缩小与美国顶尖实验室的差距。据三名知情人士透露,字节跳动正在训练一个超大模型,参数量最高可达10万亿个,目前正处于早期阶段,这比迄今为止中国已发布的最大模型、月之暗面的Kimi K3还要大三倍多。(凤凰网科技)外媒:字节跳动训练10万亿参数超大模型 堪比Anthropic最先进系统

8. DeepSeek-V4-Flash 正式版确实牛逼,相比 Preview 版本,正式版的模型结构和参数规模并没有变化(总参数量为284B,激活参数量为13B),主要是重新进行了后训练。但从实际结果来看,这次升级非常明显,尤其是 Agent 能力大幅增强,多项基准测试成绩远超 V4-Pro-Preview。在核心评测中,DeepSeek-V4-Flash 正式版的表现已经超过 GLM-5.2,并进一步逼近 Claude Opus 4.8。

9. 8GB 内存也能跑 Kimi K3?2026 本地部署大模型配置全指南

10. 字节跳动创始人禁止员工蒸馏领先前沿模型字节跳动创始人张一鸣在上个月的一场员工会议上表示,公司不会将模型蒸馏作为提升其 AI 模型能力的捷径,哪怕这会导致公司目前暂时落后于国内竞争对手。“为了更长远的目标,我们要甘于牺牲一些短期利益。严禁蒸馏,哪怕输掉比赛也在所不惜。”#人工智能#

11. #字节跳动内部严禁蒸馏开源模型#张一鸣罕见表态:不做模型搬运工,不拿别人输出换榜单排名 🤖8月6日,据字节跳动内部人士透露,创始人张一鸣在Seed团队内部会议上明确表态:字节跳动“不会把蒸馏当作提升AI模型能力的捷径”,即便这意味着当下落后于国内竞争对手。字节内部对开源模型严禁蒸馏,甚至通过API检测等方式加强限制。张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。拒绝蒸馏,不是清高,是算过账的。用别人的输出换榜单排名,是短视的“抄作业”逻辑;字节选的是虽然慢、但能真正迭代底层能力的“笨办法”。张一鸣说“愿意为长期目标牺牲短期收益”,翻译过来就是:在大模型这场长跑里,真正拉开差距的,不是谁先追上,而是谁能走出自己的路。被美国指摘蒸馏,和主动放弃蒸馏,是截然不同的两个姿态。字节这一局,不是不想赢,而是不想赢在别人划好的赛道上。放弃近路,走远路,往往才是最坚定的赶超信号。

12. 苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍?

13. 大模型行业出现了一个新词:"月抛"什么意思?一个月内9款旗舰模型扎堆发布从月初腾讯混元Hy3开源到月末Anthropic发布Claude Opus 5中间还有Kimi K3、Qwen3.8-Max、Grok 4.5……这节奏基本是"你刚发布我追上,我刚追上他超了""最强模型"的位置越来越难坐稳两个关键变化👇1️⃣ 模型之间的差距在缩小Artificial Analysis最新指数显示头部模型的分差已经明显收窄各家不再追求"全面碾压"而是围绕不同任务找优势2️⃣ 开源模型杀入第一梯队Kimi K3在Code Arena编程榜单排名第一超过了GPT-5.6 Sol和Claude Fable 5以前开源是"追赶者"现在开源在部分场景已经直接竞争了所以"月抛"时代意味着什么?对用户:好事,模型又强又便宜还更新快对行业:残酷,追赶者越来越近,领先者越来越焦虑对投资人:头疼,你刚投完这个月的新王者下个月可能就换人了!

14. 昨天晚点报,字节正在训练一个超 5 万亿参数的模型,今天 FT 报,3 位知情人士透露,字节在训练一个 10 万亿参数的模型。按照前段时间梁文锋的分析,DeepSeek 眼下不会去做这样的规模,算力资源无法支撑,即使训出来了,研究所需的算力也是远远不够的,还不如优先做好几千万激活的模型。

15. 字节跳动被曝训练10万亿大参数模型 规模超Anthropic

16. 豆包智商拉满 国产大模型将超越5万亿规模:需百万显卡算力

17. 我滴妈,字节在训练10t模型?梁圣秒成弟弟

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章