00后浙大博士把4D世界模型首次塞进手机!

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

00后浙大博士把4D世界模型首次塞进手机!
AI资讯 2026-10-05 23:27
+9709 阅读

这个假期,当大家在朋友圈晒国旗、晒旅行、晒美食的时候,华为选择在国庆节这一天扔出了重磅产品——


华为Mate 90系列正式发布,全系搭载新一代麒麟芯片,鸿蒙7加持!


发布会上有太多值得聊的东西,但有一个细节——一款叫「摸小宠」的鸿蒙独占应用,惊艳地亮了个相。


它能干啥?你掏出手机,拍几张你家猫的照片,上传。


几秒钟后,你手机里就多了一只「猫」。


00后浙大博士把4D世界模型首次塞进手机!


不是那种只能转圈圈的3D模型猫,而是一只有空间结构、会动、能从任意角度看、你走近它它还在摇尾巴的4D数字猫。


你可以绕着它转,它就在那里,在你的手机屏幕里,像真的一样。


听着是不是有点科幻?


这是4D世界模型第一次真正跑进了手机应用。


而做到这件事的魔芯科技,也成为全球范围内率先将4D世界模型推进到产业应用落地的公司。背后的技术叫MoWorld。


一张照片,「走进去」的世界


过去我们说AI能生成图片,比如你给Midjourney一句话,它给你一张图。


后来AI能生成视频了,Sora们开始造出能动的画面。但本质上,那还是一段录像带,它的视角是选定的,不会变,你不能走过去看看那栋建筑背后长什么样。


而MoWorld做的事情,是把一张照片变成一个「可以走进去」的世界。或者用更技术的话说,叫原生重建4D世界模型,它从一开始「原生」生成的就是一个4D空间。


你给它几张普通手机拍的照片,甚至几段随手拍的视频。MoWorld不会简单地「复制」画面,而是去理解这些画面背后的空间结构——那堵墙在哪儿?那张桌子离镜头多远?桌子后面被挡住的部分长什么样?


然后,它会基于这种空间理解,把平面的图像扩展成一个三维空间。你可以在这个空间里前进、后退、转弯,看到照片里没有直接展示过的角度和区域。


这就是「摸小宠」这个小应用背后真正厉害的技术底座。


你上传几张猫的照片,MoWorld先理解猫的三维形体结构,真正从有限的视角信息里推算出猫的空间结构、毛发纹理、体型比例。


然后,它还理解猫正在做什么。


猫在摇尾巴?好,当你切换到侧面视角的时候,尾巴的摇晃动作依然是连续的、符合空间逻辑的。你绕到猫的背后,猫不会突然僵住。它该怎么动还怎么动,只是你观察的角度变了。


00后浙大博士把4D世界模型首次塞进手机!


这就是所谓的「4D」——三维空间加上时间和变化的维度。


模型不仅知道物体在哪里、长什么形状、从不同角度看应该是什么样子,还知道物体正在怎么运动、动作在不同视角下怎么连续呈现、场景随时间发生了什么变化。


如果用一个更直观的比喻:以前的AI生成内容是「给你看一部电影」,而MoWorld生成的,是一个「你可以走进去逛逛的片场」。


最能展示这种能力的,就是所谓的「子弹时间」效果。


就像《黑客帝国》里Neo躲子弹那个经典镜头:模型根据少量图像恢复场景和物体的空间关系,从不同角度生成连续、稳定的环绕视图。


不同的是,这里不需要几十台摄像机,几张手机照片就够了。


不只是宠物:


应用落地才是真正的护城河


魔芯科技最值得关注的一点,恰恰是它在应用落地上的领先——摸小宠只是其中一个消费级入口,MoWorld已经在多条产业线上同步推进,多个合作项目进入技术验证和具体实施阶段。


影视和游戏。传统的影视制作流程中,一个场景需要经历建模、贴图、灯光、动画等多个漫长环节。


MoWorld可以把前期场景搭建周期大幅压缩,快速生成场景资产,支持自由运镜、天气切换、物体编辑。


00后浙大博士把4D世界模型首次塞进手机!


天气切换


一个场景可以生成多个故事走向的版本,分镜预演和概念验证的成本陡然下降。


在游戏产业,500FPS以上的资产渲染能力和移动终端的高帧率运行,有望降低互动世界对高端显卡的依赖。


00后浙大博士把4D世界模型首次塞进手机!


室内空间4D建模


具身智能训练。 以前训练一个机器人抓取、避障、搬运,需要在真实环境里反复试错。设备损耗、场地成本、还有碰撞伤人的安全隐患。


MoWorld搭建的数字仿真训练场,可以让机器人在虚拟空间里完成所有动作演练,碰撞和失误只产生虚拟损耗,支持高频次复盘迭代。


加入物理属性后,机器人还可以在仿真环境里体验重力、碰撞反馈和物体交互。


自动驾驶。 MoWorld可以在3D空间中调整道路环境、交通参与者和物体运动状态,特别适合生成那些现实中成本高、风险大、难以重复采集的长尾场景。例如雨雪天气、坑洼路面、突发事件。3D/4D资产可以方便地调整、复用和重新渲染,提高训练数据的生产效率。


00后浙大博士把4D世界模型首次塞进手机!


自动驾驶训练场景


工业数字孪生。 工厂产线、矿山等场景中,MoWorld可以将真实环境快速转化为空间资产,用于设备布局调整、改造方案预演、远程培训和异常场景模拟。


不再需要反复人工建模,现实场景到仿真数据的转化效率大幅提升。


00后浙大博士把4D世界模型首次塞进手机!


矿山建模


城乡规划与文旅。虚拟游览、沉浸式内容生产、方案展示、空间重建,这些以前需要大量人工搭建的工作,MoWorld可以用算法来加速。


00后浙大博士把4D世界模型首次塞进手机!


文旅场景重建


MoWorld的价值不是单纯地「画面更好」或「帧率更高」,而在于它能以低成本方式生成高质量、可复用的3D/4D空间资产,让这些资产真正流入产业系统被反复使用。


这是一条从「技术能力」通往「产业效能」的桥梁。


端云协同:


6亿参数模型怎么塞进手机的


这些产业应用能铺开,离不开一个前提:MoWorld跑得动、跑得起。


听到这儿你可能会问:这种级别的AI运算,不得在数据中心里烧几百张GPU才能跑?手机?开什么玩笑?


确实不全是手机在算,摸小宠背后是一条端云协同的链路:照片上传到云端,昇腾NPU上的扩散模型先生成高质量3D高斯模型——这一步算力需求大,交给服务器。


然后魔芯科技做了一个「瘦身版」MoWorld-2.0-Flash,约6亿参数,经过量化裁剪和算子适配,直接跑在Mate 90的麒麟芯片上。最终渲染呈现也在手机端完成。


国产算力训练,云端生成,端侧渲染。


说着轻巧,做起来极难。


把一个大型服务器上的世界模型塞进手机,不是压缩打包那么简单。


算子要适配麒麟架构,量化要保效果又降开销,延迟、功耗、发热全是硬骨头。


但这么做有个很实际的好处:省钱。


一部分计算搬到手机上,云端负载就下来了,运营成本随之降低。对一个面向普通消费者的应用来说,这一点决定了它能不能大规模铺开。


还有个细节值得注意:这整条链路从头到尾跑在国产硬件上。


训练用昇腾NPU,云端推理用昇腾平台,端侧跑麒麟芯片。


这条路线让MoWorld的推理成本只有同等进口GPU方案的30%。降本70%,这才是世界模型能规模化落地的真前提。


不止是看着真:它开始懂物理了


跑得动、跑得起之外,MoWorld还在持续拉高技术上限。


如果它只是能生成逼真的3D场景,那不过是个高级建模工具。真正让它配得上「世界模型」四个字的,是它开始理解物理规律。


今年7月MoWorld 1.0发布时,主打一个「快」——全国产NPU,最高约50 FPS实时交互。那时候它已经证明自己不是论文demo,而是真能跑起来的系统。


之后的迭代速度很猛。到9月底,几个关键能力已经质变:


物理属性进来了。重力、弹力、刚性、外力,这些真实世界的规则被显式融入模型。


踢一脚足球,球沿地面滚动弹起;碰一下花草,花草会摆动;同一场景可以切换晴天雨天雪天。


模型不再只管「世界看起来什么样」,开始回答「世界被碰了一下会怎么变」。


渲染帧率提高了。3D/4D高斯资产渲染突破500 FPS,手机端侧也能跑到100 FPS。不需要高端显卡,普通手机就能流畅呈现三维交互世界。


输出的东西能用了。MoWorld生成的不再只是「好看的3D视频」,而是标准化的3D/4D高斯资产,可以直接导入游戏引擎、影视制作系统、数字孪生平台、机器人训练环境。生成一次,到处调用。


场景还能改。增删物体、调整位置、切换天气,同一条街可以一键从晴天变暴雪,同一个影视场景换道具换镜头,不用从头重建。


把这些能力叠在一起看,MoWorld更接近于在模拟一个遵循物理规律的平行世界。


而摸小宠恰恰是这个看着最「轻」的场景,证明了一件最「重」的事——4D世界模型可以跑在每个人的手机上。


过去,世界模型一直漂在实验室和论文里,从Sora到Atlas,大家讨论的都是能力多强、效果多好,但很少有人认真回答一个问题:普通人什么时候能用上?


魔芯科技用摸小宠回答,现在就可以。


全球坐标系下的MoWorld:


应用落地上的领先身位


把MoWorld放到全球竞争格局里看,它的差异化就更清晰了。


2026年9月,李飞飞创立的World Labs发布了Atlas——一个多模态世界模型,核心能力是使用少量照片生成可交互的3D世界。


00后浙大博士把4D世界模型首次塞进手机!


这个产品在业内引发了巨大关注,某种程度上甚至标志着世界模型赛道正式进入国际主流视野。


Atlas和MoWorld有不少共同点:都可以用少量普通照片作为输入,都能输出三维场景结构,都支持自由浏览和新视角合成,都利用大模型来补全有限观测之外的空间信息。


但差异同样显著:


动态4D理解。 Atlas目前主要聚焦于静态3D空间的生成与理解。MoWorld则已经做到了动态4D——不仅理解空间,还理解时间。


物理交互能力。 MoWorld已经将重力、弹力、刚性等物理属性引入生成空间,物体能够对用户动作做出基于物理逻辑的响应。而Atlas目前更侧重于空间结构和多模态理解。


推理效率与成本。 MoWorld在推理速度和成本控制上具有优势。基于国产昇腾NPU的部署路线让它的推理成本只有进口GPU方案的30%,并且已经探索出了手机端侧运行的能力。


可以说,如果Atlas代表了世界模型在「空间理解深度」上的国际标杆,那么MoWorld的核心优势不仅在模型能力上不遑多让,更在应用落地上全面领先——


从4D动态理解到物理交互,从云端到端侧,从实验室到真实产品和产业流程,它已经跑出了一条完整的路。


00后博士和他的百亿征途


最后,聊聊这家公司。


魔芯科技的创始人陈天润是一个00后。浙江大学博士在读,师从中国工程院院士潘云鹤。


陈天润在Science、Nature Photonics、IEEE TPAMI等顶级期刊,以及ICCV、CVPR、ICML、SIGGRAPH等顶级会议上发表高水平论文50余篇。2022年获得共青团中央科技创新最高奖项「中国青少年科技创新奖」,是浙江省高校唯一获奖者。


他在央视的采访中说过一段话:「世界模型更像是给机器提供一个理解世界的大脑,让机器去理解它所在的环境,就像人一样,给机器提供了预测下一个世界状态的能力。这是一种冒险,但是冒险背后是我们真切地拿着这把舵在开这艘船,所以我相信既然这个舵掌握在我们手上,希望能够把这艘船开得很远。」


00后浙大博士把4D世界模型首次塞进手机!


这不是一句空话。


从2025年底到2026年9月,魔芯科技在9个月内连续完成5轮融资,最新一轮融资规模达10亿元量级,公司估值已经逼近100亿元。投资界的评价是,这是世界模型赛道上跑得最快的中国选手之一。


如今,华为手机发布会上给了他们展示位。


从全国产算力训练到鸿蒙应用端的完整链路,魔芯科技已经成为4D世界模型领域的基础设施构建者。


文章来自于微信公众号 “新智元”,作者 “新智元”

添加客服微信openai178,进AITNT官方交流群