3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
AI资讯 2026-08-14 16:39
+8999 阅读

视频模型这个月很热闹。


7 月 31 日,MiniMax H3 和字节跳动 Seedance 2.5 同日发布。3 天后,MiniMax H3 正式开源;8 月 7 日,Seedance 2.5 开放 api。


H3 主打开源、便宜,生成最长 15 秒、2K 视频 API 定价每秒 0.8 元;Seedance 2.5 则把单次生成时长从 15 秒拉到 30 秒,一次最多接收 30 张图片、10 段视频和 10 段音频,共 50 份多模态参考素材,还加强了时间戳控制、定向编辑和白模参考。


模型越来越好了,但产品能把它用好吗?


某种意义上,7 月份发布的这两个模型,反向证明了一件事:视频模型越强,产品反而越能够创造更多的价值。


01


模型变强了,


产品层要做的事反而更多了


MiniMax 最近在 reddit 社区开了一场 AMA,分享了不少关于 H3 模型的信息。团队提到了一个在模型训练过程中发现的现象:模型的泛化能力在变强,一个只训练过「根据首帧和文字描述预测末帧」任务的模型,在没有接受图像编辑专项训练的情况下,也能在多个图像编辑测试中取得较好的结果。


换句话说,模型在训练一类任务的过程中,自发地学会了另一类任务。


这也意味着,一些过去需要专项模型或者搭配工作流才能完成的能力,已经开始被通用模型吸收了。只靠多接入几个模型形成的产品功能的差异,随着模型的泛化能力的提升,已经不复存在了。


抢先接入新模型,打时间差的优势,今天其实也没有了。


H3 开源后,主流的模型托管平台、开源工具和多家芯片厂商在几天之内就完成了适配。而作为业界瞩目的旗舰视频模型,Seedance 2.5  的同步接入已经是各类视频 Agent 产品的标配动作了。


3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?


LibTV 同步上线了 H3 和 Seedance 2.5


我们从 LibTV 了解到,H3 上线后,部分原本调用 Seedance 2.0 的电商和影视任务开始尝试 H3,主要考虑的是价格和具体任务表现。创作者会根据结果、价格和生产效率,在不同模型之间切换。


有些人已经摸索出一套跨模型工作流:先用 H3 打草稿,确认构图和节奏,满意后再换 Seedance 2.5 出终稿。草稿阶段可以确定提示词、参考素材组合和节奏。画面本身未必能直接带到下一个模型,但这套做法可以省下一部分试错成本。


很明显,模型选择本身正在成为一项需要产品来承接的能力


什么任务需要调更贵的模型,什么场景用便宜模型就够了,这些都需要判断。产品还要考虑已有项目是否需要迁移。换掉底层模型后,原有的角色、场景和历史素材能否继续使用,也会影响选择。目前,这些判断仍然经常由创作者手动完成。长远看来,选择合适的模型这件事不应该是创作者要掌握的能力,这应该是产品和模型编排层要解决的问题。


除了选择模型,随着模型的变强,创作者还要管理更多变量。


首先是素材,一支广告、短剧或 MV,可能同时需要不同角色的正面与侧面参考,以及服装、场景、道具等等。Seedance 2.5 一次可以接收 50 份素材。用户要先找到正确版本,再把它们放进剧本和提示词的正确位置。输入上限提高后,素材的管理成为了新的瓶颈。


3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?


一个测试视频的素材管理,复杂一些的任务,素材会更多


然后是任务返工。视频从 15 秒延长到 30 秒,修复局部错误的代价也会变大。重新生成整条视频,token 花出去了,原本正确的部分也可能发生变化。


单条视频变长后,一次返工浪费的时间和费用也更多。能否只改坏掉的几秒,能否在正式生成前用较低成本验证方向,会直接影响项目的实际花费。Seedance 2.5 已经支持按时间戳定向编辑,并会尽量保持修改前后的连续性。模型提供了编辑能力,但产品要把它变成一套顺手的修改流程。


生成长视频还有另一层复杂度。H3 社区里有开发者分享过自己的办法:先让模型生成一段,再把上一段的尾部作为下一轮参考。生成时,他会持续提供同一张主体图片,以此维持角色一致性,最终拼出约 60 秒的连续视频。


MiniMax 技术团队对此回应道,这种续写能力确实存在。模型目前还没有原生训练过由多段续写组成的长视频,真正的连续长视频生成仍未实现。


这意味着,现阶段使用 H3 或 Seedance 2.5 生成长视频,仍要由应用层拆分片段、管理前后衔接,并维持角色和场景的一致性。模型提供续写能力,应用负责把这些片段组织成一个完整项目。


模型扩大的是生成空间,模型能力提升带来的这些工程复杂度,本来就应该由视频 Agent 和产品层来解决。


02


比起更快接入模型,


更好驾驭模型才是壁垒


今天的视频 Agent,已经在尝试解决这些实际的生产问题了。


LibTV 上的 AI 短剧《被裁掉的女孩》上线不到 30 天,第一季累计播放量已破亿。前 6 集主要由 3 个人完成,每集平均需要 2 到 3 天。技术门槛已经很低了,但生产上出现了一些新的瓶颈。


导演菲菲飞在采访中说,最耗费时间的环节往往是场景、服装、妆造和视觉基调的建立。团队需要逐一确认光比、色彩搭配、场景元素和人物服饰,再反复测试不同方案,直到画面接近他们想要的状态。为了让同一批角色连续出演十余集,电脑桌面上经常堆着几千张图片、几百条视频。只是要去找到某套服装或者某个场景,就需要花费不少功夫。


项目一旦进入连续生产,核心的瓶颈就从「能不能更快生成」转向了「能不能更好管理」。


SD2.5 和 H3 发布后,LibTV 核心的产品动作,基本也是围绕这些生产问题展开的。


首先是生成前的素材组织。逐帧拉片 Shot Breakdown 可以分析参考视频中的画面风格、关键帧、运镜、叙事节奏和背景音乐,再整理成可继续使用的参考素材组,这一过程不会扣除视频生成积分。


AutoLink 会读取剧本和画布素材,尝试把角色、场景和道具对应的参考自动放进提示词。用户仍然可以检查和替换,但不必从几十份素材中逐个查找和手动引用。它们的作用很实际,先替用户准备好输入,再交给模型。


3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?


第二个环节是生成后的局部修改。Seedance 2.5 本身提供按时间段定向编辑的接口,LibTV 把这项能力封装成时间轴上的选区、修改和回填流程。用户选中需要调整的区间,重新描述人物、动作或画面要求,再把新片段放回完整视频。


如果 30 秒里只有 2 秒出错,就只用重做这 2 秒,不用整条视频重跑。单条视频越长,局部修改能力的价值就越明显,能够显著降低重复生成的成本。


第三个环节是把多个片段组织成一个完整作品。Seedance 2.5 的单次生成上限是 30 秒,官方也支持多轮延长。LibTV 则支持把长任务拆成多个片段,保留中间节点和生成关系。用户可以展开、修改某个镜头,再同步回最终作品,最终可生成时长 5 分钟的视频。


3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?


用户可以展开查看、单独修改任一镜头,再同步更新最终视频


Seedance 2.5 API 上线当天,LibTV 就交付了这些功能。之所以能够同步上线,是因为画布、节点关系、资产库和时间线这套底座早就准备好了,新模型只需要接入既有结构。


反过来看,如果一个产品只有一个对话框和一个模型下拉列表,那么新模型再强,最终呈现的变化也只是模型选项里多了一个而已。


模型之上的竞争,比起谁先接入新模型,更关键的是谁能在新模型发布时,就已经准备好配套的生产系统,让模型能力真正快速交付用户想要的结果。


03


视频 Agent 之间的竞争,


开始走向模型层之上


模型迭代这么快,行业里始终有一种担心,Agent 应用会不会沦为单个模型的二道贩子?现有能力会不会被模型逐步吸收?


H3 和 Seedance 2.5 从不同维度提升了模型的能力空间:更强的任务泛化、更长的视频时长、更多的参考输入、更细的编辑控制。这些能力让单个镜头的生成变得更强,也让完整项目的管理变得更复杂。从这个角度来看,视频 Agent 的竞争优势和壁垒,也在随之变化。


新模型上线后,平台需要尽快判断它适合什么任务,哪些流量应该迁移,什么场景应该继续使用旧模型。H3 上线后的任务迁移,考验的就是这层响应速度。快很重要,但快是可以被追上的。


模型真正进入生产后,许多摩擦才会暴露出来。Seedance 2.5 支持更多参考,产品就得处理素材组织和匹配的问题。视频时长更长,产品就要降低局部错误带来的返工成本。生成素材越来越多,产品还得继续承接混剪和交付。


第三层涉及的是项目资产和团队流程的持续积累。一个项目做完,会沉淀下角色、场景、道具和历史镜头。团队还会形成审核与修改习惯,积累不同模型在具体任务上的效果数据。这些信息可以帮助下一个作品更快完成,也更难被复制。


视频 Agent 的素材管理,不管是模态还是复杂度上,都比代码 Agent 要更难管理。代码有 Git,写到一半的项目 clone 一下就能整体搬走,视频生产至今没有通用的状态格式。主角的面部参考、不同情绪下的表情设定,以及十几集积累下来的服装和场景资产,很多时候都与具体工具绑定。单个功能可能随时被模型厂商吸收,但这套持续积累的生产状态很难在一夜之间被取代。


过去的视频编排,更多是在图像、视频、配音之间传递结果。H3、Seedance 2.5 这样的模型出现后,编排的内容扩大了。Agent 还要处理剧本拆解、模型选择、素材继承、镜头状态和局部返工,以及决定人应该在何时介入。


未来的模型一定会吸收今天的一部分产品功能,靠单纯接入模型形成的差异也会继续缩小。但创作者最终要交付的内容不会变,他们面临的那些难题,素材组织、成本控制、局部修改和项目管理,也不会随着模型升级自动消失。


模型在变强,但模型编排没有消失,只是编排的对象从模型转向了作品。


今天视频 Agent 之间的竞争,也真正进入了模型层之上。好的模型,能决定第一条片子有多惊艳。一款好的 Agent 产品,最终决定了作品能否准时、高质量地交付。



文章来自于微信公众号 “Founder Park”,作者 “Founder Park”

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群