曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声
AI资讯 2026-08-08 19:36
+8470 阅读

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声


张一鸣内部表态:反对蒸馏,不走捷径。


智东西8月7日报道,今天,英国《金融时报》援引知情人士报道,字节跳动正在训练一个参数量高达10万亿的AI模型。而这一数字,在昨日晚间的晚点LatePost独家报道中还是“超5万亿”


即使是5万亿,这一模型的规模也已经超过目前中国已发布的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10万亿,那字节的新模型规模将超越约有8万亿参数的Mythos 5


截至文章发表前,字节跳动未对此发表回应。


曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声


▲英国《金融时报》报道


据外媒报道,其中一位知情人士透露,字节的这一模型还处于早期阶段,目前正在进行为期3到6个月的预训练,如果一切顺利,之后会进行微调并发布,具体的模型尺寸将在后期阶段才能确定。


另据晚点LatePost报道,字节的新模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。


字节这一“巨无霸”大模型的爆料,引起了不少外网网友的关注。


有网友化用了漫威电影《蜘蛛侠》中的经典台词“With great power comes great responsibility.(能力越大责任越大)”,说“能力越大,竞争越大。(AI)走到这一步并不让人意外,如果他们的模型能像Kimi K3那样持续进化,那就会逼着所有人都得加速追赶,否则只能出局。”


曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声


▲网友评论(来源:X)


还有网友认为:“10万亿参数(的模型)还没正式推出,就已经改写了推理的算账逻辑。”


曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声


▲网友评论(来源:X)


此前,字节跳动将飞书团队一分为二,产品团队并入豆包,销售线划归火山引擎。


对这一拆分决定,晚点LatePost报道,字节跳动创始人张一鸣在与Seed负责人吴永辉共同召开的Seed全员会上解释称,把火山引擎、飞书和豆包的资源整合到一起,是为了构筑在算力和数据上的优势


曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声


▲字节跳动创始人张一鸣(来源:36氪)


在会上,张一鸣认可了编程(Coding)的关键地位。这一点,字节跳动CEO梁汝波在8月6日召开的字节年度全员会“All-Hands”上再次强调,据财新报道,他坦承豆包大模型在AI Coding方面并不算突出,还用Anthropic的Claude Code举例。


但张一鸣也提醒称,编程只是眼下的热点之一,要着眼其他领域。


同时,张一鸣反对模型蒸馏,蒸馏能在短期内改善模型表现但本质上仍是在复制已有的能力。沿着这条路走,模型能力最多只能不断逼近对方,很难真正实现超越。张一鸣表态,即使不蒸馏意味着字节在技术上会短暂落后国内竞争对手,但也不想走捷径


模型蒸馏(Model distillation)是将一个大型、复杂的AI模型压缩为更小、更快模型的过程,即通过训练小型模型复制大型教师模型的知识和输出。


张一鸣还透露,过去几年,字节已经在AI方向投入了很多,未来还会投入更多


结语:国内大模型迎来窗口期


字节跳动“双线”进攻


Anthropic的Mythos 5因安全顾虑被暂时禁用,目前仅对经批准的组织开放;Fable 5此前也因安全问题被美国政府勒令"停服"。近期,OpenAI的模型同样频繁爆出不受控的安全问题。


大洋彼岸的接连“暴雷”,给国内大模型的发展“撕”开了一个难得的窗口期。


过去几周,月之暗面的Kimi K3和阿里巴巴的Qwen 3.8 Max在基准测试中表现抢眼,仅在某些领域落后于Anthropic的Fable 5,国内外开发者的反馈也相当积极。


跑分之外,更值得关注的是下一阶段的动作。英国《金融时报》报道,业内人士透露,多家中国实验室正在训练Fable 5规模的模型,而字节跳动几乎是在这条赛道上押注最激进的一家。


与阿里、腾讯等同行不同,字节跳动的AI大模型大多为闭源,但其最新的SeeDance模型在视频生成领域已跻身全球最先进之列,面向消费者的AI应用豆包月活已达3.24亿,是国内最受欢迎的AI应用。与飞书合并后,豆包也开始向B端市场冲刺。


一边是产品端的B端加速,一边是训练端的激进规模与对Coding的强调,字节跳动开始“双线进攻”。


来源:英国《金融时报》、晚点LatePost、财新



文章来自于微信公众号 “智东西”,作者 “智东西”

1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群