大家好,我是袋鼠帝
昨天躺床上刷手机,突然看到阿里计划发布他们目前最新的生视频模型:Wan3.0
在千问创作PC端(c.qianwen.com)公测,逐步开放

并且,全能参考,相比sd的视频、文本、图片、音乐4个基础模态,Wan3.0还支持了网页链接、word等文档。
时长也达到了30S,和sd拉平,是目前唯二的两个模型。
关键是价格感人:
480P/720P/1080P 分别 0.3/0.6/1.2元/秒
换算成时长单位,大约是sd2.5的40%~50%
看到这里,我直接不困了,从床上弹起来,找阿里的朋友要了个内测,开整~
卷起来吧,卷起来好啊。

利好我们大众~

这次为了测试Wan3.0的效果,我准备了10个案例(附提示词),其实跑了20多个案例,主要是公众号文章最多只能放10条视频。。
干货满满,建议收藏(这些提示词一定有你用得上的)
为了不粉饰模型的表现,每个Case只取一次正式生成结果,不反复抽卡。
另外,补充一下,手机端可以在千问app体验,已经开启公测了。位置是AI生视频里面,模型选择Wan3.0即可。大家可以看看有没有灰度到😄。

好了,话不多说,开始实测!
1、霓虹粒子城市 MV
提示词:
生成一支30秒、16:9、电影级赛博朋克电子音乐MV。色彩以洋红与青蓝为主,黑色高反差背景,画面运动严格跟随稳定的四拍电子节奏;所有空间连续、摄影机路径物理可实现,不出现可读品牌文字。0-6秒:俯瞰一座沉睡的数字城市,建筑轮廓随低频鼓点从黑暗中逐栋点亮,摄影机沿高楼峡谷缓慢下降。6-14秒:镜头无缝俯冲到湿润街道,跟随一名由发光粒子构成的奔跑者向前冲刺,路面积水反射霓虹,粒子尾迹遵循惯性与空气阻力。14-22秒:奔跑者在一次强拍上跃起并散成粒子旋涡,粒子沿连续轨迹重组成一只巨大的霓虹凤凰;禁止瞬间变形、肢体穿模或随机爆闪。22-30秒:摄影机跟随凤凰穿越云层回到城市上空,全城灯光先随休止拍依次熄灭,再在最后一个重拍由中心向外同步点亮;凤凰掠过镜头形成自然运动模糊,最后定格在完整城市天际线。要求24mm广角、流畅FPV飞行感、节拍驱动但不靠随机快切;建筑结构前后一致,粒子数量和颜色连续,无字幕、无logo、无画面闪烁。
如果满分10分的话,这个视频
视觉冲击力 9分;提示词遵循 9分;连续性与运镜 8.5;粒子与变形 9分;光影与材质 9;文字与品牌 9。
没有硬切,粒子人到凤凰再到城市远景都挺连贯的。整个视频质感不错。
我感觉Wan 3.0 在抽象视觉和长距离空间运动上表现还挺棒的。
2、液态金属芭蕾
提示词:
生成一支30秒、16:9、超现实高级艺术短片:一名芭蕾舞者与液态金属在黑色镜面舞台上共舞。舞者始终是同一位短银发女性,身穿无文字的哑光黑色连体舞衣;身体比例和面部保持一致。单镜头连续拍摄,35mm镜头,摄影机以稳定的顺时针轨道环绕。0-7秒:舞者独自站在中央做缓慢 plié。她脚边一小池水银般液态金属随低音脉冲泛起同心波纹,准确反射舞者与上方一束冷白顶光;液体不离地漂浮。7-15秒:舞者旋转,液态金属被离心运动带成一条连续丝带,沿她手臂的真实运动轨迹上升,在不穿透皮肤和衣服的前提下形成半透明金属袖套。摄影机继续匀速环绕,镜面倒影方向正确。15-23秒:她完成一次 grand jeté。金属丝带在起跳瞬间分成十二枚坚硬的镜面薄片,按连续轨迹展开成机械花瓣;落地冲击使花瓣逐片变软并落回地面,不能凭空增殖或消失。23-30秒:舞者做最后一次 pirouette,地面的液态金属受旋转牵引形成环形浪墙,随后下塌落并凝固成一枚完整银色圆环。摄影机在她正面精准刹停,舞者伸手触碰圆环,灯光熄灭,只留圆环边缘余辉。要求:无剪辑、无瞬移、无多余肢体、无物体穿模;液态、薄片、圆环三种状态之间连续可追踪,整体金属体积基本不变;无文字、无logo、无随机闪烁,声音只使用脚尖触地、金属流动与低频脉冲。
这个提示词的要求,其实挺复杂,但最终完成的视频还挺不错的。
舞者动作连贯且稳定、最终银环也清楚的展示了;符合超现实高级艺术短片的感觉。
3、深夜便利店:多给的一串鱼丸
提示词:
生成一支 30 秒、16:9、电影级写实都市微短剧。必须是同一位男主角和同一位女店员贯穿全片:男主约 28 岁,短黑发,消瘦脸型,深灰西装与白衬衫被雨淋湿;女店员约 24 岁,黑色马尾、圆框眼镜、米色围裙。35mm 电影镜头,冷雨夜与室内暖黄光形成克制的冷暖对比,真实皮肤、自然微表情、同步环境声。0-5 秒:一个连续镜头从雨夜街道低机位缓慢横移,霓虹倒影在湿地面上流动;摄影机跟随男主推开便利店玻璃门,风铃清脆响起,玻璃上的水珠和人物倒影物理正确。5-12 秒:斯坦尼康从男主肩后缓慢推进到关东煮柜台。男主盯着热气发呆,女店员不说话,先看他湿透的袖口,再默默多放一串鱼丸进纸碗。蒸汽从前景掠过形成自然遮挡,两人外观保持一致。12-20 秒:切到中近景,男主抬头愣住。女店员只轻声说一句中文:“今天,也辛苦了。”口型自然、声音克制。摄影机极慢推进到男主眼睛,只有一次吞咽和眼眶微红,不嚎哭、不夸张表演。20-27 秒:摄影机从窗外隔着雨珠拍摄,男主坐在窗边吃关东煮,室内暖光像一座孤岛;背景里女店员继续整理货架,人物身份、服装、发型不能变化。窗外雨势逐渐变小,远处车辆柔和掠过。27-30 秒:摄影机沿轴线缓慢后拉到街道大全景,便利店在深夜中安静发光,雨停,屋檐最后一滴水落下。只保留雨声、风铃、热汤轻响和极弱弦乐。

男主,女主的特点,服装,都遵循指令完整生成了
雨夜冷暖光、男主克制表演和结尾便利店远景成立;“今天也辛苦了”这句台词也在。
Wan 3.0 能把 30 秒都市微短剧的完整情绪表达出来,人物稳定、雨夜氛围也很到位。
该说不说,男主有点像井柏然啊。只是多给一串鱼丸那里,并没有很好的演绎出来。
4、香水瓶里的沙漠风暴
参考图:

提示词:
严格锁定参考图中的无品牌香水瓶:透明长方体厚玻璃、微圆四角、厚底座、哑光黑色短圆柱瓶盖、瓶颈单圈拉丝黄铜环、瓶内琥珀色液体约三分之二。生成一支30秒、16:9、电影级超现实高端香水广告。瓶身外形、液面高度、瓶盖比例和玻璃厚度全程不变,正面始终无文字、无标签、无logo。
0-6秒:85mm微距从瓶底倒影缓慢上移,金色轮廓光掠过玻璃棱线;液体保持平静,完整展示产品正面与三分之四侧面。
6-14秒:液体中逐渐显出一片微缩沙漠。风吹动真实沙粒形成低矮沙丘,不凭空出现建筑或人物;瓶形仍能通过折射边界被感知。
14-22秒:沙漠中形成一股受风场驱动的小型沙尘涡旋,沿瓶内顺时针移动;每颗可见沙粒遵循惯性和重力,涡旋不能穿过玻璃壁,也不能改变外部液面高度。
22-27秒:涡旋在一次低频脉冲后塌落,沙粒沉入液体并逐渐化成细密金色气泡;气泡上升,沙漠景观随之自然消散,不能瞬间切换。
27-30秒:镜头回到参考图同一产品机位。最后一枚气泡在液面破裂,金色轮廓光熄灭,定格完整无品牌香水瓶。
我感觉Wan3.0指令遵循很强。而且在单图产品稳定性上表现不错:瓶型、玻璃、瓶盖和琥珀液体贯穿 30 秒都比较稳定,还能把“瓶内沙漠—沙尘涡旋—金色气泡”做成完整广告叙事。
5、火星快递品牌片
参考图(4个分镜):




提示词:
按四张参考分镜顺序生成一支30秒、16:9、写实又轻松的火星快递品牌片。锁定同一矮小快递员:白色轻型宇航服、圆形透明头盔、左肩唯一青绿色无字三角色块、背部橙色生命支持包;锁定同一辆六轮哑光白色快递车和同一青绿色无字三角色块;锁定同一个牛皮纸方盒与青绿色织带;锁定同一只红褐色圆石生物、两只青色发光眼睛、四条短腿。所有标识只有纯色图形,不生成文字或近似真实品牌。
0-7秒:从分镜1开始,八轮快递车沿火星峡谷道路稳定行驶。摄影机低机位平行跟拍,八个轮子真实转动并压过小石块,尘土受轮胎推动后落回地面;包裹固定在车尾货架。
7-14秒:到达分镜2,快递员抱同一包裹下车走向半埋圆顶基地。远处沙尘暴逼近,镜头绕到他侧前方,头盔反射、橙色背包和青绿色肩部色块保持一致。
14-20秒:基地门没有响应。快递员把包裹举高,门旁地面轻微拱起,同一只岩石生物从沙中探出,达到分镜3。它先看包裹再看快递员,四条短腿逐一落地,不能瞬移或变大。
20-27秒:岩石生物钻到包裹下方,快递员把盒子轻放在它头顶。门识别到收件者后真实滑开,生物驮着包裹开心跑向门内;快递员退后挥手,快递车位置连续,达到分镜4。
27-30秒:沙尘暴刚好掠过基地外墙,门安全关闭。镜头停在快递员头盔反射中的青绿色三角形,声音里只出现一声克制确认提示音,不显示文字。成片按火星行车、基地送件、岩石生物出现、包裹交接和结尾品牌镜头完成了完整 的30 秒叙事,人物、基地、锚点清楚。

能把四张电影分镜准确扩成一支结构完整的 30 秒品牌短片,人物、包裹、岩石生物和色彩标识都较稳定,非常棒。
唯一不足的可能是最后一个镜头,反射中的青绿色三角形,不太看得出来是反射,像是印在上面了。
6、折纸鲸穿过纸上城市
参考图:




提示词:
按四张参考分镜的顺序生成一支30秒、16:9、精致手工折纸定格动画。锁定同一只靛蓝色折纸鲸:鲸头轮廓、背部折痕、白灰腹部和左侧胸鳍尖端的小块金色三角纸片始终一致。锁定同一座白色纸上城市、蓝色无字纸河与三栋标志性高楼。所有材质都必须保持有纤维纹理的彩纸,不转成真实动物、真实水或塑料。
0-6秒:从分镜1的城市全景开始。摄影机以微缩模型尺度缓慢推近,靛蓝折纸鲸在纸河边轻轻摆尾,动作采用每秒12帧的手工定格节奏;城市与纸河位置不变。
6-13秒:进入分镜2,鲸沿蓝纸河向前游动。每次摆尾都由可见折痕连续改变形状,左鳍金色三角始终朝镜头一侧;纸河只产生轻微折叠波纹,不变成液体。
13-21秒:达到分镜3,鲸蓄力后从纸河跃起,穿过两栋纸楼之间。蓝色半透明薄纸逐片展开形成水花弧线,纸片受重力下落但不割裂建筑;鲸的尺寸逐渐放大,不能瞬间跳变。
21-27秒:鲸在空中展开成分镜4的大型形态,尾部牵引一条连续蓝纸河带。摄影机从侧后方跟随向城市上空抬升,夕阳暖光逐渐出现,三栋标志楼仍可在下方对应位置辨认。
27-30秒:鲸向右上方飞去,金色左鳍被夕阳照亮,画面在完整城市与鲸的剪影上停住。
指令遵循依旧很强
这条说明 Wan 3.0 对“多参考分镜+单一视觉”的控制有明显提升:
同一只折纸鲸、同一座纸城和同一条蓝纸河能够连续跨越 30 秒,金色胸鳍与三栋地标也没有漂移。
7、末班地铁的第二个自己
参考图:


提示词:
以首帧和尾帧为严格视觉锚点,生成30秒、16:9、电影级写实悬疑短片。始终保持同一位约28岁东亚女性:短黑发、深蓝风衣、苍白疲惫的脸;保持同一节深夜地铁车厢、座椅、车窗、灯带和摄影机轴线。全片采用24mm广角稳定器长镜头,不剪辑、不改变空间结构。
0-7秒:摄影机从空荡车厢尽头缓慢向女主推进。她坐在车窗旁,列车在黑暗隧道中行驶,顶灯偶尔轻微闪烁;车窗反射与本体动作完全同步,只有轨道摩擦声和呼吸声。
7-15秒:女主抬眼看向玻璃。她本体保持不动,反射却延迟半秒才抬头;摄影机继续沿过道推进并微微侧移,以真实视差同时看清本体和反射。禁止反射变成另一张脸或出现额外乘客。
15-23秒:本体慢慢站起,反射却仍坐着;随后关系反转——本体重新跌坐,反射中的她独自站起并向玻璃靠近。车厢冷青灯逐盏熄灭,远处应急灯变红,所有动作连续,不通过剪辑隐藏变化。
23-30秒:反射中的她把手贴在玻璃上,而本体惊恐回头。摄影机绕女主肩后半圈,车窗在空间上像一道深门;远处车门自行打开一条缝。最终严格落到尾帧构图,反射保持站立、本体仍在座位旁,切黑前只听到一句极轻的中文耳语:“轮到我了。”
要求:镜面左右关系正确,身体和手指无畸形,服装发型全程一致;无字幕、无logo、无随机跳切、无多余人物。声音只使用列车、灯管、电流、呼吸和指定一句对白。

这条展现了Wan 3.0超强的的首尾帧控制力:
不仅复现了开场的空地铁与车窗倒影,还能在 30 秒内保持同一人物、同一服装和同一车厢轴线,最后把“反射站起来、本体仍在座位旁”的关键尾帧稳定落地。分身逻辑和长镜头连续性都很强。
8、电商后台 AI 商品助手功能发布片
参考图:

提示词:
以 Image1 为严格页面锚点,读取参考功能说明 TXT,生成 30 秒、16:9 的电商后台 AI 商品助手功能发布视频。
0-6秒:完整展示 NOVA COMMERCE 后台,鼠标从左侧导航移动到“AI 商品助手”,当前高亮状态保持不变。
6-13秒:鼠标点击“开始创建”;紫色按钮产生一次压下反馈,页面中心出现上传区域,一张无品牌白色跑鞋商品图拖入。
13-21秒:四个步骤按顺序高亮:上传商品图、识别核心卖点、生成商品内容、人工确认发布;每一步只高亮一次,不改变原文字。
21-27秒:系统生成“夏季轻量跑鞋”任务,状态从处理中变为“已完成”,语言列显示“中 / 英 / 日”,更新时间显示“12:42”。
27-30秒:镜头轻微拉远,回到完整页面,停在“人工确认发布”步骤,强调人保留最终决策权。

9、机械腕表:城市机芯
参考图:



提示词:
严格锁定三张参考图中的同一块无品牌机械腕表:42mm圆形拉丝钛表壳、12点位三角凹槽、右侧单枚六角表冠、黑色一体橡胶表带、六颗等距表圈螺钉、深蓝太阳纹无字表盘、12枚银色时标、10点10分银色镂空时分针、指向6点的橙色细秒针,以及背面同一机芯与半圆钛色摆陀。生成一支30秒、16:9、高端产品广告。
0-6秒:从正面参考角度开始,85mm微距绕表壳顺时针移动约30度。冷白侧光扫过拉丝纹理,橙色秒针连续走动;表盘、螺钉、表冠和表带不能变形或增加。
6-14秒:镜头穿过透明表镜进入机芯内部。银色时标与深蓝表盘沿真实轴向分层升起,平滑对应爆炸结构参考;三根指针、表盘、机芯、表壳和底盖均可追踪,不凭空复制。
14-22秒:机芯齿轮逐渐转化为夜间微缩城市:齿轮齿成为环形道路,摆轮像中央广场往复运动,橙色秒针化为一条贯穿城市的单一光轨。转换保持金属材质与结构映射,不出现真实品牌建筑或文字。
22-27秒:城市结构沿原路径收拢还原为完整机芯,摄影机从背面透明底盖退出,达到背面参考图的三分之四视角;半圆摆陀受重力轻微摆动。
27-30秒:腕表沿垂直轴旋转回正面,准确回到同一产品外观。橙色秒针停在6点方向,背景熄暗,只留钛金属边缘光。

Wan 3.0 的多参考生成在产品广告上挺强的:
三张腕表正面、背面与爆炸结构图被真正组织成了“外观展示—轴向拆解—机芯城市—回装复原”的 30 秒连续广告,产品身份、机械结构和橙色光轨都能前后对应。
已经能把静态工业设计参考扩成高完成度概念片了。
10、黑洞如何吞噬恒星(科普视频)
参考图:

提示词:
以参考 PDF 的科学解释为事实边界,以结构图的四阶段顺序为镜头结构,生成一支30秒、16:9、电影级天体物理科普片。不要把黑洞画成实体黑球直接吞下完整恒星;必须表现潮汐力梯度、拉伸破碎、物质流和吸积过程。
0-6秒:广角展示一颗类太阳恒星沿偏心轨道接近超大质量黑洞。用简洁旁白说:“当恒星靠得足够近,近端和远端受到的引力不再相同。”不显示复杂公式。
6-14秒:恒星被沿轨道方向逐渐拉长,表层物质形成连续细流;近端先被剥离,远端随后响应。摄影机侧向跟随,保持物质连续和质量基本守恒。旁白:“潮汐力压过恒星自身引力,它开始面条化并被撕裂。”
14-23秒:部分物质绕黑洞返回、碰撞、升温,形成旋转吸积结构;另一部分沿轨道逃逸。黑洞中心保持无光,亮度来自周围热物质。旁白:“部分碎片返回并形成炽热吸积流,释放高能辐射。”
23-30秒:镜头拉远展示吸积盘;仅以较弱、克制的双极喷流作为“可能情形”,不能暗示所有事件必有喷流。最后显示四个清晰标签:“接近|拉伸破碎|吸积|高能辐射”。

Wan 3.0 的“全能参考”能够很好的读取科普 PDF 和确定性结构图,把黑洞潮汐瓦解压成四阶段、带中文标签与旁白的解释动画,结构清晰。适合作一些科普视频的片段。
另外,这次千问创作端还上线了一个很有意思的新功能:叫Agent Team 模式
也就是可以拉多个专业 Agent 协同创作


根据不同创作需求,自动组建由编剧、导演、美术、视频师、剪辑师等等组成的专业 AI 团队。
每个 Agent 各司其职,模拟真实内容团队的分工方式,让复杂的视频创作从“一个模型单点生成”升级为“多个专家共同完成”。在提出创意后,可以自动组队。
目前Agent Team还需要邀请码(不过我给大家争取了一些,感兴趣的朋友在评论区回复:邀请码)
「最后」
我发现Wan3.0在视频生成的效果上真实物理世界、光影、运动、表情等方面的表现,还是可圈可点的。
人物一致性、稳定性,BGM、配音都很不错。
不过,有个问题,就是视频里面的一些小字,还是有小部分容易崩。
但是拿来做漫剧,做短剧是完全没有问题。
我觉得这波阿里的Wan3.0模型最大的优点就是能生成30秒 1080P的音画同步视频,并且效果还挺棒的。关键是价格感人!
其实,市场上出现越多强大的 AI 视频模型,对我们普通用户就越有利。只有厂商之间形成良性竞争,AI 视频生成的价格才会越来越便宜,我们才有机会真正薅到羊毛。😄
所以,至少从这个角度来说,我非常希望阿里的视频模型能够卷起来。甚至我希望国内能够出现更多有实力的AI视频厂商,大家你追我赶。在这样的竞争环境里,国内 AI 视频模型才能进步得更快。
反观国外的 AI 视频模型,最近似乎已经没有太大的声音了,甚至让人怀疑他们是不是准备放弃这一块了。
如果国内厂商能够继续保持现在这种良性竞争,把视频模型能力越做越强、价格越打越低,那么我们与国外 AI 视频模型之间的差距,肯定会进一步拉开。
直接把国外视频模型按在地上摩擦!
我是袋鼠帝,一个致力于帮你把AI变成生产力的博主。我们下期见。
能看到这里的都是凤毛麟角的存在!
如果觉得不错,随手点个赞、在看、转发三连吧~
如果想第一时间收到推送,也可以给我个星标⭐
谢谢你耐心看完我的文章~
文章来自于微信公众号 “袋鼠帝AI客栈”,作者 “袋鼠帝AI客栈”
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0