字节跳动5万亿大模型曝光:张一鸣罕见拍板,不蒸馏不跟风赌什么?

2026年8月6日,科技圈被一条重磅消息点燃。《晚点LatePost》独家披露,字节跳动内部正在讨论训练一个参数规模超过5万亿的大模型。随后英国《金融时报》跟进报道,称这一数字最终可能高达10万亿参数。作为参照,当前国内最大规模的阿里Qwen3.8-Max为2.4万亿参数,月之暗面Kimi K3为2.8万亿参数。更令行业震动的是,字节跳动创始人张一鸣罕见亲自拍板:不蒸馏、不跟风,直接从零开始训练。这意味着字节跳动正将AI大模型的赌注,一口气拉到了万亿级别的新高度。

一、事件背景:大模型军备竞赛的白热化

2024年至2026年,全球大模型竞赛进入深水区。OpenAI的GPT系列、Google的Gemini、Meta的Llama系列轮番刷新纪录,参数规模从千亿级跃升至万亿级。中国大模型阵营同样不甘落后:阿里的Qwen系列、百度的文心大模型、月之暗面的Kimi系列、DeepSeek的R1系列,各家都在争相追赶国际前沿。

在这场竞赛中,字节跳动一直被认为是"追赶者"而非"引领者"。尽管字节旗下的豆包大模型在C端用户量上表现亮眼,日活用户数在2026年初突破8000万,但在基础模型能力上,业界普遍认为字节与第一梯队仍有差距。字节跳动的大模型战略一直以应用层见长,通过抖音、今日头条等超级App的场景优势快速落地,而非在底层模型上押下重注。

然而,这次5万亿乃至10万亿参数的曝光,彻底改变了外界对字节AI战略的认知。据知情人士透露,该项目在字节内部被列为最高优先级,由张一鸣直接过问。这一决策背后,是字节对AI未来格局的深层判断——在AI的终局之战中,模型能力的上限将决定一切。

二、核心内容:为何选择"不蒸馏不跟风"最难的路径

在大模型训练领域,业内通行做法主要有三种路径:一是"从零训练",即完全使用原始数据从头训练模型,这是最正统也最昂贵的路径;二是"蒸馏训练",即利用已有的强大模型(如GPT-4)生成的数据来训练新模型,成本低、速度快,但能力上限受限于"教师模型";三是"微调与对齐",在开源基础模型上进行针对性优化。

张一鸣拍板选择的第一条路——从零训练,是三条路径中最艰难的一条。从零训练5万亿参数的模型,意味着需要从海量原始互联网数据中学习,不依赖任何现成模型的"知识灌输"。这种做法的核心优势在于:模型没有继承任何"教师模型"的认知偏差和能力天花板,理论上能够达到更高的智能上限。但代价同样巨大:训练成本预计超过数十亿美元,需要数万张高端GPU持续运行数月,且失败风险不可忽视。

所谓"不跟风",指的是字节没有选择当前行业流行的MoE(混合专家架构)路线来"注水"参数规模。许多厂商通过MoE架构将总参数做大,但实际激活参数远小于总参数,以此在榜单上获得好看的数据。字节选择的是密集参数架构(Dense Model),意味着所有参数在每次推理中都会被激活,这代表了更真实的模型能力,也意味着更恐怖的算力消耗。

这一决策的逻辑链条清晰:如果字节的目标是打造一个真正能与GPT-5甚至GPT-6匹敌的基础模型,蒸馏和MoE注水都无法触及智能的真正天花板。只有从零开始的大规模密集训练,才有可能在底层智能能力上实现质的飞跃。张一鸣的判断是——在AI这条赛道上,中间路线没有未来,要么不做,要么就做到极致。

三、关键数据指标

5-10万亿
目标参数规模
2.8万亿
Kimi K3参数(对比)
8000万+
豆包日活用户
数十亿$
预计训练成本

四、全球万亿级模型对比

模型/项目 所属公司 参数规模 架构类型 训练方式
字节新模型(曝光) 字节跳动 5-10万亿 密集架构(Dense) 从零训练
Kimi K3 月之暗面 2.8万亿 MoE混合专家 从零训练
Qwen3.8-Max 阿里巴巴 2.4万亿 MoE混合专家 从零训练
DeepSeek R1 深度求索 约1.5万亿 MoE混合专家 从零+蒸馏
GPT-5(推测) OpenAI 未公开 密集+MoE 从零训练

从对比表中可以清晰看出,字节跳动一旦完成5万亿参数的密集模型训练,将在参数规模上直接超越国内所有竞争对手,成为全球除OpenAI之外参数规模最大的单一大模型。如果最终达到10万亿参数,则可能在绝对规模上挑战全球第一的位置。

五、影响分析:万亿赌注背后的深层逻辑

字节跳动押注5-10万亿参数大模型,其影响远超技术层面,将深刻改变中国乃至全球AI产业格局。

第一,重新定义中国大模型的天花板。长期以来,中国大模型被认为在规模上落后于美国。阿里Qwen3.8-Max的2.4万亿和月之暗面Kimi K3的2.8万亿已经是国内最高水平,但与OpenAI和Google的顶尖模型仍有差距。字节如果成功训练出5万亿甚至10万亿参数的密集模型,将首次在绝对规模上与全球顶尖模型站在同一梯队,这对中国AI产业信心是巨大提振。

第二,字节AI战略从"应用驱动"转向"底层驱动"。过去两年,字节的AI策略是"用应用倒逼模型"——先在抖音、今日头条等场景中快速落地豆包大模型,通过海量用户反馈迭代模型能力。这一策略在C端用户增长上极为成功,但在模型能力上限上始终受限。张一鸣此次拍板,标志着字节正式承认:仅靠应用层优势无法赢得AI终局之战,必须在底层基础模型上建立真正的技术壁垒。

第三,将引发新一轮算力军备竞赛。5万亿参数密集模型的训练需要极其庞大的算力支撑。业内估算,训练这样一个模型至少需要5万张以上的H100级别GPU,或者等效的国产算力集群。这对英伟达、AMD等芯片厂商是利好,但也将进一步加剧全球AI芯片的供需紧张。对中国企业而言,如何在芯片出口管制下获取足够算力,是字节必须解决的现实难题。

第四,"不蒸馏"路线可能引发行业效仿。当前国内不少厂商选择蒸馏路径以快速缩小与GPT-4的差距。字节公开选择从零训练,等于宣告蒸馏路线存在能力天花板。如果字节最终成功,将证明"从零训练"才是通往AGI的正确道路,可能带动整个行业回归基础研究。

六、FAQ常见问题

Q1:5万亿参数和10万亿参数有什么区别?为什么报道中有两个数字?

字节跳动5万亿大模型曝光:张一鸣罕见拍板,不蒸馏不跟风赌什么?

A:《晚点LatePost》报道的5万亿是字节内部讨论的初始方案,英国《金融时报》跟进后透露最终规模可能扩大到10万亿。两个数字的差异可能反映了项目仍在推进中,参数规模在训练过程中可能根据效果动态调整。也可能是分阶段计划:先训练5万亿版本验证可行性,再扩展至10万亿。参数规模越大,模型理论上能学习到的知识越丰富,但训练难度和成本也呈指数级增长。

Q2:什么是"蒸馏"?为什么张一鸣反对蒸馏训练?

A:蒸馏(Distillation)是指利用一个已经训练好的强大模型(教师模型)来生成训练数据,再用这些数据训练一个新模型(学生模型)。这种方法成本低、见效快,但学生模型的能力上限受限于教师模型——无法超越"老师"。张一鸣认为,如果目标是打造超越GPT-5的顶级模型,蒸馏路径从逻辑上就不成立,因为你无法从一个你想超越的模型中蒸馏出更强的能力。因此必须从零开始,让模型从原始数据中自主学习。

Q3:密集架构和MoE架构有什么区别?为什么字节选择密集架构?

A:MoE(Mixture of Experts,混合专家)架构将模型分为多个"专家"子网络,每次推理只激活其中一部分,因此总参数可以很大但实际激活参数较小。密集架构(Dense Model)则是所有参数在每次推理中都参与计算。MoE的优势是推理成本低、参数规模好看,但模型能力密度不如密集架构。字节选择密集架构,意味着追求单位参数的最高效率,但也意味着推理算力消耗远大于MoE模型,对推理基础设施提出极高要求。

字节跳动5万亿大模型曝光:张一鸣罕见拍板,不蒸馏不跟风赌什么?

Q4:这个模型什么时候能训练完成?

A:根据行业经验,5万亿参数级别的密集模型从启动训练到完成,通常需要6-12个月甚至更长时间。考虑到字节可能需要先完成算力集群搭建、数据清洗准备等前期工作,预计从2026年中启动的话,最早可能在2027年上半年看到初步成果。但大模型训练存在不可预见的失败风险——训练中途崩溃、效果不达预期等情况时有发生,因此实际时间可能更长。

七、结语

字节跳动5万亿大模型的曝光,不只是一则新闻,更是一个信号。它标志着中国科技巨头中最擅长"快速跟随、大力出奇迹"的字节跳动,在AI领域做出了最具野心的战略选择。张一鸣拍板"不蒸馏不跟风",本质上是对AI产业终局的判断:在通往AGI的道路上,没有捷径可走,唯有最硬核的技术投入才能赢得最终胜利。无论这个5万亿乃至10万亿的赌注最终结果如何,它都已经将中国大模型的竞争维度提升到了一个全新的高度。接下来的关键问题是:字节能否在算力受限的环境下完成这一史诗级训练?这个答案,可能在未来12到18个月内揭晓。

字节跳动 大模型 张一鸣 5万亿参数 AI训练 2026AI新闻