深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季
AI资讯 2026-09-10 15:18
+5370 阅读

深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


Z Highlights


  • 一周之内大语言、图片、视频模型都迎来新赛季:OpenAI的GPT-6 Astra让编码 Agent更好地使用游戏引擎和Blender,自己改场景、自己跑、自己测;GPT-image-2.5上线,更快更强,图片编辑和关键帧动画显著提升;fal和Yoroll分别发布 H3 MaxTurbo和H3 Superfast后训练加速模型,5秒视频3秒内推理,实时生成和互动玩法纷纷涌现。


  • AI应用层反攻模型,“开源+后训练+推理加速”爆发新活力开源拉平模型的起跑线,应用公司可以围绕自己的场景做后训练,把速度、成本和交互体验做成产品优势。“拥有自己的智能”,开始成为应用层可以实践的路径。


  • 完整的AI游戏,需要一套让模型协同工作的Harness。预生成主线打磨故事,代码与3D工具承载玩法,实时生成响应玩家,状态与判断系统保证前后连贯。模型能力能否兑现为游戏体验,取决于这些环节能否接好。


01 一周之内,互动内容迎来了新赛季


9月4日,OpenAI正式发布GPT-6 Astra。官方强调的能力集中在编码、数学、电脑与浏览器操作、多步骤工作流的完成度,发布演示里就包含了游戏场景创建。随后几天,社区涌现出大量的游戏创作和Blender 3D绘制:有人用GPT-6 Astra 用HTML和Godot开源引擎复刻了《英雄联盟》和《索尼克》,有人用Blender绘制出3D的精细版颐和园。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


9月8日,OpenAI又发布了GPT-image-2.5。官方列的改进是生成延迟最多降低 50%、参考图一致性更高、多轮编辑之间保持一致、可以直接在图上写评论来指定修改。当天就有创作者拿它出角色图和背景图、做成关键帧动画,做出了一个唯美的2D横版游戏。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


文本模型和图片模型有了,视频模型的竞争也没闲着,基于MiniMax H3的各类社区后训练版本百花齐放。AI中转站和推理基础设施公司fal发布了H3 Max和 H3 Max Turbo,推理速度快,成本极低,在视频品质尚可接受的程度下,做到了低于Seedance2.0的十分之一的价格(限时折扣期间)。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

fal和Yoroll先后发布H3后训练的实时视频生成模型


而另一家AI互动视频和游戏公司Yoroll也发布了两样东西:自己后训练的视频生成模型Yoroll H3 Superfast,以开放权重的MiniMax H3为基座,推理10秒视频约需4秒;以及由它驱动的实时叙事产品YoLive,观众提案、投票,模型当场生成下一幕。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

YoLive 实时 AI 直播互动产品


而在实时交互式视频生成模型这里,字节跳动也刚放出了大消息。据彭博社报道,字节跳动正在研发面向实时空间场景的交互式视频生成模型:基于 Seedance架构、接收语音与动作输入、云端生成、目标每秒20帧、延迟约0.05秒,最快10月发布,首批场景是直播、短剧和轻量游戏,PICO Space Pro为它推迟到四季度。元宇宙复兴了属于是。


由此,AI互动内容的新赛季拉开帷幕,技术方案也逐渐清晰:


头部LLM负责玩法与系统的代码,图片和3D模型提供美术资产,头部视频模型提供可看的剧情内容,实时交互式视频模型/世界模型负责更高自由度的互动。


02 当AI应用拥有自己的模型


本周一我们发布了文章《喝点VC|红杉资本合伙人Sonya Huang:企业开始掌握自己命运,AI 应用层开始反攻模型》,其中红杉合伙人 Sonya Huang 的核心判断是:开放权重模型已经逼近前沿,后训练工具链已经成熟,综合考虑成本、速度、专有数据、以及是否能掌握自己的命运等因素后,越来越多公司开始为产品中的部分功能构建自有AI能力,通过纵向整合逐步拥有并塑造模型权重。应用公司正在成为新一代AI Lab。最优秀的AI产品公司需要自己的“小天才”:速度快、有自己的判断、专注于特定领域,并根据实际工作持续调优。


在另一篇文章《对话Fireworks CEO乔琳:为什么说找到PMF之后,第一件事不是买量,而是做后训练?》中,Fireworks AI CEO兼联合创始人Lin Qiao也有类似的判断,她认为:AI应用的壁垒正在从“做出产品”转向“拥有自己的智能”;后训练不是起点,而是产品找到PMF之后的下一步;数据的质量比数量更重要,产品团队必须进入训练闭环;后训练同时解决差异化和成本问题,进而会提高产品竞争力和公司商业价值。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


这些论点和判断,在H3的后训练版本中得到了充分的印证。极致的推理速度和低廉的成本,让H3 Max等系列模型快速获得了市场青睐,多家AI短剧公司连夜切换为使用H3 Max模型抽卡,而LibTV、OiiOii等视频Agent平台都已第一时间接入H3 Max。H3后训练家族已经成为了视频模型赛道和实时交互式赛道的重要力量。


这里有一个有趣的问题:H3开源一个月,几十个团队在同一个底座上做后训练,为什么fal和Yoroll这样的公司能交出不错的答卷?


开源拉平的是模型层的起跑线,没有拉平的是三样东西:推理栈、数据、产品


fal有的是推理栈和开发者数据。它本来就是做推理基础设施的,H3 Max的快,一部分来自后训练,另一部分来自把模型搬进自家推理栈。fal把高速视频生成做成了开发者可以直接调用的服务。


Yoroll占的是数据和产品。这也是它要做一个自己的版本、且能做一个自己的版本的原因。


首先是数据。Yoroll从做互动影游和3D游戏的第一天起,就在积累一类别人没有的素材:游戏内视频数据和玩家与创作者行为数据。第一方长内容,加上创作者平台上的作品,留下了大量带分支、状态和玩法标注的镜头。H3 Superfast的后训练,就是拿游戏内数据去补它:游戏美术风格的稳定性、长序列中的角色一致性、镜头与玩法节奏的配合,以及为世界模型预留的动作控制,让模型能根据玩家的操作而不只是文字提示来续写画面。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

《华君传》介绍和200万玩家


Yoroll平台上已经有超百款互动内容和游戏,既有上线抖音小游戏一个月就获得 200万玩家的《华君传》,也有登陆科隆游戏展的大型游戏《丧尸清道夫》。这些都是数据积累的重要来源。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

《丧尸清道夫》在科隆游戏展上的实机玩法录屏


其次是产品。推理提速只有进入实际玩法,才会变成体验优势。H3 Superfast发布当天就有三个地方在用它:创作者平台上生成视频,YoLive里接观众的投票,实时互动小游戏。每一次提速都直接落到玩家手里,玩家的反应又回来告诉模型团队该先修什么——角色没执行动作,道具前后消失,画面接不上。只做模型的公司难以拿到这些问题,只做应用的公司过去拿不到模型;开源解决了后一半,前一半只能靠自己做C端产品。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

实时生成和直播玩法已经上线Yoroll App和抖音直播间


03 新的实时模型带来了哪些玩法


Yoroll H3 Superfast解决的是从离线到运行时的那一步。Yoroll在H3基座上用游戏实机画面和美术风格数据做后训练,并在推理层面做了加速。官方数字:8×B200上,推理一段10秒视频约需4秒,生成速度约为播放速度的2.5倍。对互动视频来说,它意味着分支不必预先生成:观众选择之后现场生成,玩家拥有更高的自由度。


几天之内,社区开发者做出了无限刷的短视频流、由RSS和社区讨论喂养的24小时AI新闻台、实时你画我猜、约会模拟器、分支式文字冒险。9月7日,拥有74万粉丝的主播N3on宣布用AI分身开一场“永远不会结束”的直播,观众可以进直播间和它互动,上线时近两万人同时在线。它至少说明了一件事:观众已经准备好接受“内容按你的反馈实时生成”这种形态,供给端能不能跟上,取决于运行时生成的速度和成本。


而在此之前,Yoroll也发布了基于H3 Superfast模型的新产品YoLive(yo.live),产品形态非常直接:一部大家共同参与、持续向前发展的互动剧情游戏。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


进入YoLive,观众看到的是一个持续播放的AI互动剧情频道。任何人都可以提出下一幕应该发生什么——让机器人跳舞、来一场天台追逐、加一个谁都没想到的反转——其他人为这些提议投票,得票最高的方向被系统结合已经发生的剧情、人物关系、当前地点和任务状态续写成新的影像,由H3 Superfast模型当场生成。第一个开放的频道来自《丧尸清道夫》:机器人牛仔、模特、鸵鸟和那片原子朋克废土构成了稳定的角色与世界,观众在这个世界里决定故事往哪走。


比YoLive更能说明“实时生成是一种玩法”的,是平台上创作者正在孵化的一批小游戏。它们的共同点是:用Yoroll Code写玩法,用H3 Superfast的API生成画面,实时输入直接改变剧情。目前都在开发与探索阶段,但题材已经很鲜明。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

Yoroll平台上实时互动小游戏的活动页面


在这批小游戏里,“实时”已经被放进了具体的交互设计。《相亲战士》让玩家按喜好定制相亲对象,通过自由对话和行动推动约会:一句试探、一个大胆的举动,都可能把下一幕带向不同的方向。《Breaking Fake News》是款虚假新闻模拟器,在平行宇宙里体验当总统的快乐,里边藏了各种政治笑话。还有致敬《旅行青蛙》和《GTA》的实时小游戏,不同的是这一回目的地或者故事由你来选。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

根据玩家的输入和选择实时生成的GTA游戏


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

根据玩家的输入和选择实时生成的 Fake News 游戏


这些游戏体量都不大,但它们是我们见到的第一批把“下一幕由玩家的输入决定”当核心循环、而不是当宣传噱头的作品。


04 互动内容的Harness应该如何搭建


为了给玩家交付“好玩又好看”的完整游戏体验,仅靠单一模型的能力是不够,需要一整套Harness来配合。


第一块,预生成的主线剧情


无论游戏、短剧还是电影,故事本身是最为重要的一环,而好的故事离不开打磨雕琢,所以一定需要有预生成的主线。这里就需要LLM和RAG提供更好的剧本和分支故事线,也需要SOTA的视频模型和抽卡提供良好的画面表现。预生成负责打磨,实时生成负责回应。主线、角色和关键场景提前制作,玩家未被预设的提问与行动,由实时生成接续。规则和状态系统负责记住发生过什么,保证故事与玩法连贯。


推理成本也会决定两者的分工:多人共看、共同参与的实时流更容易分摊成本;个人化互动需要付费意愿支撑;可自由探索的持久世界,则有待控制能力与推理成本进一步改善。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


第二块,基于Coding和3D的玩法。在3D游戏的玩法和关卡部分,GPT-6之前,这是最难被AI替代的部分,建模、拓扑、UV、绑定、导进游戏引擎,视频生成再快也替不了。GPT-6 Astra把这个判断改了一半:它开始接手一部分原本需要人在Blender中反复操作的工作,自己写脚本、摆物体、打灯、渲预览、用视觉检查、改到对为止,再导出游戏引擎能直接用的格式。Yoroll Code已经把GPT-6的3D能力和Blender MCP接入,也就是创作者平台上用自然语言做玩法的那部分。


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季

创作者使用Yoroll Code和GPT-6创作的类《红色警戒》游戏,选择了Godot引擎,老玩家的回忆


第三块,实时生成主线定了、关卡有了,剩下的是玩家和观众自己长出来的部分:YoLive里投票决定的下一幕,平台上实时21点、AI新闻台这类小游戏和频道的画面。这类依赖现场输入的内容,可以由H3 Superfast在运行时生成。让现场算的画面接得上前面的故事,靠的是Harness的另外两层:状态系统维护道具、血量、任务进度和人物关系,规则系统判断玩家的行动可以产生什么结果;视频模型负责把这些结果表现出来,视觉模型辅助检查画面是否执行了指令、是否出现前后矛盾。通过校验的事件再写回状态,让后续剧情有据可依。模型负责“看起来对”,Harness负责“确实发生了”。


三块放在一起,边界就清楚了:主线使用头部视频模型,玩法使用头部LLM和 3D工具链,而运行时生成是值得优先投入自有优化的环节:它持续影响玩家等待多久、每次互动花多少钱,以及角色和场景能否按要求回应。是否需要自建模型,则取决于通用API的能力边界、实际调用规模,以及团队能否通过后训练和部署优化获得足够收益。


Harness把问题收集起来,自有权重把问题优化解决到更好。字节做交互式视频的世界模型可能也是类似的思路,但出口接的是自己的PICO头显。


05 新赛季:什么变便宜,什么变稀缺


在当前新的赛季里,游戏和互动内容的成本结构会重排成这样。


代码原型、美术资产和视频素材的制作成本都在快速下降:玩法和系统的代码,GPT-6进引擎自测和computer-use之后原型制作门槛进一步降低,两段提示词能出一个网页版《英雄联盟》;美术资产,GPT-image-2.5和Blender把原画、UI 图、3D场景压成了几轮对话;可看的剧情,H3 Max把价格做到了Seedance 2.0 的十分之一。这三块对大厂和创业公司同样成立,竞争会迅速拉平。


因此,游戏和互动内容的供给会进入爆发式增长。大厂纷纷开始搞自己的部署和分发渠道:B站Toy定向开放小游戏等作品的发布,快手招募AI互动内容创作者,抖音灰度测试互动空间,小红书也上线自己的Vibe coding和部署小工具等,互动内容是最近的行业风口。入口逐渐增多,内容供给爆炸,那什么会变稀缺呢?


变稀缺的是三样东西:


  • 一是运行时的画面。线性内容生成一次给一亿人看,运行时画面每个玩家的每次选择都要现场推理一次。按fal的H3 Max Turbo标准价(非折扣期)每秒 0.04美元算,10秒画面0.4美元,一个24小时实时频道一天花费3456美元,而广告小游戏的单会话收入以分计。推理速度就是毛利,生成快一倍,同一套硬件能扛的会话就多一倍;其次才是性能指标,这也是实时生成最好能自建的原因。
  • 二是真实产品里的交互轨迹。论训练数据,文本有整个互联网,视频有 YouTube和抖音,但“玩家想要什么、系统给了什么、玩家有没有留下”这种完整的轨迹,在公开数据集里都难以获取,它只在一个真的有人在玩的互动产品里产生。这类数据不好买不好爬,而既做模型又 C端产品的公司拿得到,而且它是复利的:用的人越多,正向飞轮越能转起来。
  • 三是流量和IP。Steam今年日均近70款新游戏上线,8月最后一周单周720款创下纪录,2026年新作里已有三成申报使用了生成式AI;头部1%的作品拿走约94%的收入。生产越便宜,渠道和题材只会越贵。


这一轮变化最有意思的地方,是做出一款AI游戏和互动产品需要的几块拼图,终于开始在同一个时间窗口里凑齐:AI能写玩法、造资产,视频也开始来得及实时回应玩家。但工具越强,“我也能做一个”的保质期就越短。


对于这个刚开场的新赛季,视频生成得更快只是发令枪。真正值得期待的,是玩家第一次觉得:这AI游戏,我竟然玩上瘾了。


最后,可以来看一段YoLive上直播实时生成的峰哥祝福,祝AGI顺利落地~


深度|GPT-6遇上实时视频,AI游戏和互动内容迎来新赛季


文章来自于"Z Potentials",作者 "Z Potentials"。

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

5
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales

添加客服微信openai178,进AITNT官方交流群