巨人天成
产经 科技 企业 数据 峰会 快讯 商业

十万亿参数豪赌:字节跳过“捷径”死磕底层,张一鸣的长期主义底气何在?

2026-08-08来源:快讯编辑:瑞雪

近日,字节跳动创始人张一鸣在公司内部全员会上明确表态,拒绝通过“蒸馏”技术追赶前沿大语言模型。他强调,公司应着眼于长远目标,即使需要牺牲短期利益,也要坚持自主训练大模型。这一决策引发行业广泛关注,尤其是在中国大模型竞争格局加速演变的背景下。

当前,中国大模型领域竞争激烈。最新全球LLM排行榜显示,月之暗面Kimi K3 Max位列第二,阿里Qwen 3.8 Max位居第四,智谱GLM 5.2 Max和DeepSeek V4 Flash分列第七、第八。相比之下,字节跳动的Seed 2.1 Pro仅排在第21位,与国内其他领先模型存在明显差距。尽管字节跳动在资金、人才、算力和数据等方面具备显著优势,但其大模型发展却未能达到预期水平。

据了解,字节跳动内部曾多次就是否采用“蒸馏”技术展开激烈讨论。这种技术通过借鉴其他大模型的输出结果来训练自身模型,被视为快速提升性能的捷径。然而,张一鸣三次否决了相关提议。第一次是在2025年1月,面对DeepSeek-R1的强势崛起,他坚持Seed模型应学习“如何思考”而非模仿他人;第二次是在英伟达Blackwell芯片部署后,尽管算力差距扩大,他仍选择追加2000亿元投资建设智算中心;第三次则是在Kimi K3等模型带来竞争压力时,他再次强调榜单排名是虚的,商业主权才是实的。

“蒸馏”技术虽能快速提升模型在基准测试中的分数,但存在显著缺陷。牛津、剑桥等机构的研究表明,反复使用AI生成的数据训练模型会导致“模型坍缩”,即原始数据分布中的尾部信息逐渐消失,最终引发能力退化。这种“近亲繁殖”效应会使模型变得越来越狭隘,虽然基准测试分数可能持续上升,但处理未知问题的能力却会下降。对于字节跳动而言,其拥有的抖音、TikTok等平台产生的海量原生数据,才是训练大模型最宝贵的资源。

从技术架构层面看,字节跳动坚持从头训练大模型还有更深层次的考虑。词表作为模型的“眼睛”,决定了模型对语言的切分和理解方式。使用他人词表意味着接受其语言偏好和认知颗粒度,这在多模态领域尤为致命。字节跳动的Seed系列模型专注于原生多模态能力,如Seedance 2.0已实现原生音画同步的视频生成,支持60秒2K分辨率视频和8种语言唇形对齐。这种能力的前提是模型在底层就实现文本、视频帧、音频信号的原子级映射,而“蒸馏”技术会破坏这种自主性。

在硬件层面,字节跳动面临特殊挑战。受美国芯片出口管制限制,公司无法采购英伟达最新旗舰芯片,只能使用性能受限的H20芯片。这迫使字节跳动通过扩大集群规模、提高资源利用率和极致工程优化来弥补单卡性能差距。目前,字节跳动已在内蒙古乌兰察布、山西大同、河北怀来等地建设多个智算中心,形成数万张卡规模的分布式算力网络。2026年,公司AI基础设施资本开支超过2000亿元,导致净利润同比明显下滑。

张一鸣本人将一半精力投入到Seed团队,推动公司自主研发从底层算子优化到训练故障恢复的全栈工程体系。这种“重工业”级的技术积累,正是字节跳动拒绝“蒸馏”路线的底气所在。当模型参数规模持续攀升时,竞争门槛将从算法转向工程能力,只有掌握完整基建能力的玩家才能留在牌桌上。

据《金融时报》报道,字节跳动正在讨论训练一个参数规模达10万亿的大模型,远超国内其他领先模型的参数规模。这一项目由Seed Foundation负责人项亮主导,仍处于早期探索阶段。如果成功,这将是国内参数规模最大的模型计划。选择如此激进的路线,字节跳动旨在通过规模跃迁直接进入下一技术梯队,同时规避潜在的知识产权和合规风险。

在全球化布局和长期技术竞争中,全链路自研模型的优势愈发明显。当DeepSeek被OpenAI指控“蒸馏”,美国立法将模型数据窃取纳入国家安全范畴时,字节跳动的选择展现了其战略远见。张一鸣在内部会议上明确表示,希望Seed模型能力能跻身世界第一梯队,而技术主权和定义智能上限的机会,正是这条艰难道路的最终回报。

新规拟细化“数字守门人”条款,互联网巨头个人信息保护迎新挑战
此前两稿中,“大型网络平台服务提供者”的核心认定标准之一为“注册用户5000万以上或者月活跃用户1000万以上”,同时带有“业务类型复杂,网络数据处理活动对国家安全、经济运行、国计民生等具有重要影响”等标准…

2026-08-08

聚焦三井触摸屏维修:上海仰光电子服务解析与场景适配攻略
三井触摸屏作为船用及工业设备中常见的显示终端,其维修需求通常出现在屏幕破损、触控失灵、通讯中断等场景。 主营产品与应用说明围绕三井触摸屏维修,上海仰光电子科技有限公司将其纳入工控自动化设备维修板块,对应触摸屏…

2026-08-08

古田一小在全国青少年无人机大赛总决赛中斩获佳绩 科创教育结硕果
本次大赛是教育部官方白名单科创赛事,由中国航空学会主办,以“十年砺翼·津彩未来”为主题,汇集全国8000余所学校、2万余名选手参赛,赛事含金量高、竞争激烈,全方位考验学生编程实操、团队协作与临场应变能力。 …

2026-08-08

华为深圳全场景发布:尊界V800领航 国产豪华MPV迈入百万新赛道
本次发布会的核心车型为尊界品牌两款旗舰MPV。 行业观察人士表示,尊界V800的核心意义不在单车销量,而在于验证国产汽车能否靠智驾底盘、情绪座舱、全场景互联重写百万级豪华市场的规则。当豪华的评判标准从进口车…

2026-08-08

诺基亚押注AI-RAN技术布局6G,联合英伟达戴尔开启增长新篇章
这一技术路径不仅缓解了当下的AI数据负载压力,也为2030年左右商用的6G网络奠定基础。 对于英伟达和戴尔而言,无线网络仅是其庞大AI版图的一小部分;但对于诺基亚,AI驱动的移动流量增长对其收入影响更为显著…

2026-08-07

光猫、路由器、交换机功能大揭秘!搞懂这些,告别家里网速慢的烦恼
它的处理器性能弱、散热差、带机量极低,如果直接用光猫拨号、连WiFi,多设备同时联网极易出现网络拥堵、频繁掉线、网速跑不满等问题,这也是我不建议大家使用光猫自带WiFi的核心原因。 它的作用很简单:承接光猫转…

2026-08-07

昇腾算力赋能互联网:全链路协同创新加速AI业务规模化落地
在笔者看来,昇腾A5系列以芯片到集群的全链路协同创新,为互联网AI业务提供从极致能效到超大规模的无缝算力底座,加速智能生产力落地。其中,互联网推荐系统已获头部电商平台采用,效果比肩全球领先水平;LLM预训练…

2026-08-07

字节押注超5万亿参数大模型:张一鸣力挺创新,拒绝蒸馏与短期热点裹挟
过去半年,Seed的多模态模型取得了显著成绩:今年 2 月上线的视频生成模型 Seedance2.0和图片生成模型Seedream 5.0Lite声量一度超过业内其他同类模型,迅速引发关注。据The in…

2026-08-07

OpenAI全新大模型Astra或下周登场 具强大数学解题与多智能体协同能力
【太平洋科技】据 IT 之家报道,8 月 6 日,消息源 @synthwavedd 在社交平台 X 发布爆料信息,OpenAI 全新大模型Astra 有望最快于下周正式推出,该模型内部研发代号为 mew…

2026-08-07