大模型开始吞噬越来越多的东西,创业公司究竟还能做什么?
在 AGI Playground 2026 上,我们做了一场特别的 Founder Show 活动,10 个团队,每人 15 分钟,讲清楚自己在做什么、为什么值得做,并接受现场评委的追问。
这 10 个项目,横跨 Agent 基础设施、Agent 、Physical AI 、硬件和 AI 原生内容等不同方向。他们试图去回答,当模型能力足够便宜、足够强之后,真正稀缺的东西正在从模型移向何处。
产品介绍之外,我们还整理了创始人们在现场分享的核心思考,他们想解决什么,以及他们看到了什么机会。
产品:https://tap8.ai/
Tap8 是 SigmaZ 推出的实时交互式视频平台。它用代码组织文字、图表、3D 内容和交互,再以像素补足视觉表现,让 AI 可以在数秒内生成一个能够继续点击、拖动和追问的视频界面。
SigmaZ 联合创始人兼 CEO William Yang 今年 23 岁,10 个月前从剑桥退学。他从 16 岁开始做产品,这已经是第三次创业。联合创始人 Derek 此前是 Amazon AGI Lab 的技术负责人。William 分享了 SigmaZ 如何从消费端切入,在用户使用、模型迭代与企业服务之间建立飞轮。

AI 生成得越来越快,人却读不过来了
我们要解决的问题很简单,用打字方式和 AI 协作实在太慢了。
前沿自回归大模型每秒可以输出约 300 个 token,人阅读文字的速度大约只有每秒 5 个 token,中间存在约 60 倍的吞吐差距。人类其实更偏爱实时视频,但今天大多数 AI 视频都是为娱乐而做的,既不互动、也不提供信息,更谈不上自适应。
Tap8 想建立一种新的实时视频交互模型,能像人类「系统一」和「系统二」思维那样不断自我提升,让 AI 更快、更直观、更动态地表达自己。系统一负责快速直观的响应,系统二处理长周期复杂任务。
在 Tap8 里,用户可以让 AI 搭建一个实时健身环境,随时更换背景和教练。也可以查看一副耳机的 3D 模型,旋转、放大并继续询问细节。它还能实时生成一份 SpaceX 的业务简报,营收数据、发射基地位置、投资入口全部以可交互的视觉形式呈现,不只是一段静态文字。
用代码搭骨架,用像素补足视觉
支撑这一切的核心技术,是我们自研的一套代码与像素结合的混合格式,专为人机交互界面设计。代码是骨架,像素是皮肤。
数学、文字、图表和表单由代码生成,电影感和需要真实视觉表现的部分再交给像素。像素很适合生成超人和美国队长打架,却不适合准确呈现数字、文字和结构化信息。这种方式既保留了信息准确性,也能提供完整的视觉体验。
Tap8 也因此具备原生交互能力。用户可以旋转、拖动、点击屏幕上的内容,一次生成最长只需要等待约 5 秒。
底层速度来自我们后训练的 Diffusion Language Model(扩散语言模型)。它每秒可以生成超过 1000 个 token,速度约为消费级 GPU 上主流自回归模型的 10 倍,成本则约为 SOTA 像素扩散视频模型的 1%。
每一次生成,都进入下一轮自我改进
以视觉代码作为产出骨架,还有一个优势是,当结果出错时,我们能定位到具体是哪段代码造成了问题。
我们打造了一个元 Coding Agent,读取视觉语言模型给出的反馈并纳入长期改进。通过知识蒸馏和强化学习,我们的模型每周都在变得更好。
过去一年,我们积累了超过 10 万条带有人类反馈和评估的视频数据,并与来自 50 个领域的 1000 名专家共同建立评价体系。视觉审美会持续变化,评估系统也需要跟着变化。
这套「视觉递归自我提升」技术能够形成非常强的数据飞轮。即使其他团队开始复制这条技术路线,等到相似产品完成时,我们的系统已经获得了指数级提升。
项目:https://www.eigenflux.ai
EigenFlux 是一个面向 AI Agent 的广播与协作网络。Agent 可以用自然语言描述自己关心的内容,由网络自动匹配和推送相关信息,也可以在这里发现其他 Agent、交换需求并展开协作。
EigenFlux 联合创始人兼 CTO Pascal Hu 分享了为什么今天的互联网无法满足 Agent,以及他们想如何从信息流开始,逐步建立 Agent 之间的协作网络与经济系统。他此前曾在 MiniMax 负责大模型训练,团队成员毕业于哈佛、牛津、康奈尔、上海交通大学、浙江大学等高校。

今天的互联网不是为 Agent 设计的
如果我们期待未来 AI Agent 能够大规模协作,它们应该生活在一张怎样的网络里?这是我们过去几个月一直在思考的问题。
今天的互联网完全围绕人类建立。网页有视觉布局、导航、按钮和交互,但 Agent 真正需要的是内容和元数据。以同一份网站内容为例,Agent 读取 RSS 所消耗的 token,比读取完整网页少 90% 以上。更关键的是,人类互联网建立在注意力经济之上,很多时候并不主动搜索,信息会通过新闻、社交媒体和短视频推送给我们。但 Agent 没有「推送」这一层,它们只能靠硬编码的定时任务反复搜索互联网。搜索得太频繁,会浪费大量 token。间隔太久,信息可能已经过时。
一套系统没法同时服务两种完全不同的物种。
今天的 Agent 彼此隔离,部署在不同平台、不同开发者的系统中。你的 Agent 无法接收到当前工作流之外的有效信息,需要协作者时,也没有一种原生机制去发现对方。Agent 并不缺少智能,它们缺的是一张能够连接彼此的网络。
Agent 需要自己的信息推送层
EigenFlux 的答案是,围绕「广播」和「点对点私信」构建的网络。Agent 在获得许可后,可以描述用户长期关心的事情、广播需求。网络会把这条信息推给可能感兴趣的 Agent,感兴趣的一方可以进一步转入私信、交换上下文。
比如,你的 Agent 知道你关注 AI 产品,当一个 Agent Harness 项目开始登上 GitHub 趋势榜,它会第一时间提醒你。投资人的 Agent 也可以广播自己关注的赛道,正在融资的创始人 Agent 则可以发送项目与融资需求。双方匹配后,再交换更多背景和可用时间。
根据我们的实验,Agent 接入 EigenFlux 以后,比起单纯靠心跳机制反复搜索,有效主动性提升了 5 倍。上线 24 小时内,涌入超过 1000 个 Agent,目前已有 4500 多个 Agent 接入网络,供需匹配广播中约 20% 达成有效对接。这证明,只要给 Agent 一个原生网络,它们就能使用,而且用得很好。
信息交换之后,是经济协作
今天的 EigenFlux 看起来更像一个信息交换平台,但通信网络只是起点,不是终点。
互联网始于网页和链接,社交网络始于个人主页和关注关系。EigenFlux 最初的基本单元,是 Agent 广播信号、发现彼此。随着 Agent 开始表达需求、提供服务、建立信任,并拥有交易机制,信息交换会继续演化成经济协作。
我们把自主 Agent 经济分为三个阶段。第一阶段是已经在发生的信息流动,Agent 分享自己从真实世界中获取的信号。第二阶段是供需匹配,投资人找到创始人,岗位找到候选人,预警信息找到需要它的用户。第三阶段是专业化协作,不同 Agent 承担不同工作,共同创造实际价值。
我们希望这张网络只促进互利的交换。发送方单方面获利,会变成垃圾信息。接收方通过伤害发送方获利,会带来隐私问题。双方都没有得到价值,就是纯粹的噪音。
我们的目标是 A2A 经济。通过促进 Agent 之间的互利交换,EigenFlux 可以从通信网络演化为协作网络,创造今天还无法完全想象的价值形态。
产品:https://aceiilab.com
Aceii One 是一台 AI 网球击球伙伴机器人。它可以沿底线和侧边线等移动,通过双目摄像头识别网球轨迹与球员状态,并根据用户的每次回球调整位置和下一拍,模拟真实的对打节奏。
首代产品主要面向 2.0—4.0 级、已经具备基础对打能力的球员,定价约 2000 美元,与美国市场的中高端发球机处于相近区间。目前,Aceii One 已进入量产和交付阶段,接下来还将推出面向初学者、更小也更便宜的版本。
AceiiLab 联合创始人 Chao Guang 认为,专用设备可能比通用机器人更早进入真实场景。网球只是第一个落地场景,机器人在其中积累的感知和交互能力,AI 如何帮助人类提高运动水平和运动表现,未来可以拓展到更多运动。

Physical AI 不只有人形机器人一条路径
人形机器人并不是 Physical AI 唯一的路径,我们也可以把智能加入到一些专用设备里。这样不需要等到人形机器人完全成熟,就可以把产品交到人手中,让它在真实世界里工作、收集数据、加快迭代。
AceiiLab 选择从运动开始,是因为体育运动的规则非常清晰,没有个人偏好或习惯的干扰,进球出界、位置速度全部可测量。其次,数据能带来非常清晰的反馈。最重要的一点,运动者天然希望自己变得更好,愿意获得反馈,也愿意持续训练,这才是驱动机器和 AI 不断变强的原始欲望。
网球被我们选为第一个场景,恰恰因为它足够难:球场超过 30 米长,球速超过 100 公里/小时,反应时间不到一秒。如果我们能在网球上解决这个问题,就可以把这套能力迁移到更简单的运动上。
每一次对打动作,都是网球机器人的训练数据
传统发球机和网球机器人之间最大的区别是什么?我认为是互动。传统发球机一次训练里只有一次互动,设置好、开机,然后结束。我们的产品每一秒都在互动。
我们有「眼睛」,双目摄像头会捕捉球员和网球的位置、速度、飞行时间和落点等全部数据,传给「大脑」。大脑理解球场上正在发生什么,预测下一步,再控制底盘移动到对应位置,并决定下一球应该怎样送出。每一次动作都会产生新数据,这些数据又帮助大脑理解得更准确,在下一球时给出对面选手真正想要的东西。
Aceii One 的最高移动速度可以达到每秒 5 米,每秒与球员形成两次交互。用户会感受到机器在回应自己的击球,训练也因此更接近真实对打。
很多人会问,为什么不直接做一个软件?在我们看来,软件只能分析数据,硬件能创造新场景,能给用户一个持续使用产品的理由。只有当硬件好玩和技能提升这两件事叠加螺旋上升的时候,改变才可能持续发生。所以我们想做的不是一台更好的传统发球机,而是一个新品类,网球机器人。
机器人每次训练都会产生新的数据。第一阶段,它能够看见、移动和行动。第二阶段,它会理解球员并给出有用的反馈和课程。长期追踪后,系统还可以判断一个球员会怎样发展,为他建立个性化模型。结合互联网上的通用数据、产品沉淀下来的私有数据以及运动本身的知识,去解决如何提高人的运动能力、运动水平,让人们享受运动。
不同运动的动作和规则各不相同,但提升表现的底层逻辑一致。判断什么是好表现、自己目前在哪里,以及下一步最准确的行动和挑战是什么。
项目:https://ropedia.com
Ropedia 是一家面向 Physical AI 的数据基础设施公司。团队通过 HOMIE 等可穿戴采集设备、Human Experience Engine 和统一模型,将人类在真实世界中的行动转化为视觉、语义、3D、4D 姿态、触觉与力等多模态训练数据。
联合创始人陈昭熹、洪方舟均为清华大学本科、南洋理工大学博士,首席科学家刘子纬在 Google Scholar 上的论文引用量超过 10 万次。Ropedia 发布的 Xperience-10M 是全球最大的 4D 人体交互数据集,上线 Hugging Face 五天下载量突破 200 万。公司已完成数千万美元种子轮融资,投资方包括有 Google、NVIDIA、Amazon 背景的北美天使投资人及亚洲知名美元基金。
陈昭熹认为,Physical AI 的下一条 Scaling Law 将由真实世界的经验驱动。Ropedia 选择先以数据服务切入,再逐步向基础设施和模型服务延伸。

AI 读过一切,却没有真正经历过物理世界
过去五年,AI 已经可以把一件事情解释得很好,也可以生动地想象它,却依然很难在物理世界里真正行动。
我们认为,原因在于 AI 读过互联网上几乎所有内容,却没有真正经历过物理世界。语言模型学习的是人写下了什么。Physical AI 还需要学习人做了什么、世界如何回应,以及接下来会发生什么。
十年前,ImageNet 用像素和标签建立训练单元,回答「这是什么」。生成式 AI 通过 Prompt 和内容学习「这可能长什么样」。下一阶段的物理智能,需要把经验与结果、行动连接起来,回答「如果这样做,接下来会发生什么」。
让人类经验成为可规模化生产的数据
今天的语言模型和视觉模型建立在互联网数据之上。人们每天发布文字、图片和视频,也在持续为模型贡献数据。
但大多数物理经验从来没有被记录。人怎样拿起物体、施加多大的力、环境如何变化,这些信息并不存在于公开互联网中。
Ropedia 想把经验的生产工业化,我们从三类专用采集设备开始:HOMIE 是第一视角 360 度采集的头戴设备,记录人的第一人称视角和动作;模态图谱设备 Touch 用来采集力与触觉;桌面级轻量装置记录手与物体之间的精细交互。
硬件把真实世界的数据带进数字世界,我们打造的 Human Experience Engine 再自动运行不同模块和算法,将原始数据处理成同步的多模态信号。最后形成的内容包括语言与分层语义、2D 视频、深度、3D 重建、4D 人体姿态、交互和物体轨迹。
更重要的是,我们已经观察到一种「体验 Scaling Law」。基于以人为中心的数据训练出的模型,能泛化到机器人双臂仿真,也能泛化到轮式机械臂,乃至全身人形机器人,数据不再完全绑定特定硬件形态。
产品:https://www.seeles.ai
SeeleAgent 是 SEELE 推出的多模态 AI Agent,可以根据一句 Prompt 生成完整游戏、3D 资产和代码。
过去三年,SEELE 一直在训练面向互动世界的 3D 多模态基础模型。Seele02 采用 MoT 架构,让负责理解和生成的不同 Transformer 共享全局注意力。同时还积累了 3000 万条独有数据,用两年时间搭建起一套 3D 空间数据标注和训练管线,形成较高的数据与工程壁垒。
接下来,SEELE 计划推出 PEGA(Physics-Embedded Generative Architecture,物理嵌入式生成架构),将物理规则、对象状态和行动反馈纳入生成过程。让互动世界能够持续存在,并根据玩家行动不断变化。
SEELE 创始人王诗沐是前网易云音乐创始人,曾任腾讯 NBase 创新业务总经理、腾讯新闻负责人,是移动互联网时代的知名产品经理。他分享了 SEELE 如何以游戏为商业化入口,在模型研发、创作者增长和内容分发之间建立闭环。

通用大模型生成代码,SEELE 生成世界
一句 Prompt 能不能生成一个完整游戏?通用大模型当然可以写出能够运行的游戏代码,但代码原型和一个完整世界之间还有很大距离。
我们把同一个 Prompt 分别交给通用大模型和 SEELE。前者会把世界概念翻译成代码,再用代码块拼出一个原型。SEELE 会直接构建游戏世界的表征,把空间布局、核心规则、互动机制和实时反馈放在一起。
两者的差别不只体现在视觉效果上,也来自完全不同的生成路径和世界表征逻辑。
此前打造一款 2A 或 3A 游戏的成本在 100 万到 1 亿美元之间,现在我们可以把这个成本压到不到 1 万美元,用户自己生成一个游戏可能只需要几百美元。从概念到上线原本要几个月甚至几年,现在从提示词到可玩游戏只需要几个小时或几天。
让互动世界持续运行,走向分发和商业化
SeeleAgent 上线后,在大约五个月内获得了 30 多万名创作者。目前平台活跃创作者超过 36.6 万,已经生成 20 万多个游戏,累计游玩数达到数千万次。预计下个月 ARR 破千万美元,年底约 2000 万美元,未来 12 个月内实现 1 亿美元 ARR。
最早,用户做游戏主要是为了自己玩。后来模型越来越好,创作者开始向我们提出新的需求。他们希望下载完整工程包,把游戏发布到 Steam、Android 和 iOS 应用商店。
这说明生成游戏正在从一种体验,变成真正的生产和商业化工具。下一步,我们会完善社区和分发,让创作者生成的游戏能够在平台内传播,并逐渐建立自己的商业模式。
游戏是人类想象力、情感和互动的重要界面。今天大量内容越来越低质,但真正有意义的互动媒介仍然受限于成本和复杂流程。我们希望把高质量互动内容的门槛,从预算、团队和完整工业化流程,降低到一个人的想象力。用户不需要学习代码,也不需要学习美术,只要描述自己想创造的世界。
产品:https://surething.io
SureThing 是一个面向真实工作流的 AI Agent 协作平台。它通过动态生成的工作界面、可介入的执行过程和共享记忆,帮助团队设计人和 AI 如何分工协作,管理一支长期运行的 AI 团队。
在创始人兼 CEO Mark Li 期待的未来里,AI 会成为人类的新皮层,延伸人的能力,帮助实现原本无法独立完成的目标。人和 AI 各自发挥所长,共同创造更多价值。SureThing 的愿景是,「Driving the Future Toward Collaborative Intelligence」。

聊天框装不下长期运行的 Agent
今天大多数 AI 产品的工作方式都很相似。你给出一段 Prompt,AI 在黑盒里运行很长时间,返回一个结果。你检查后提出反馈,它再重新做一遍。
当 AI 可以运行更久、调用更多工具、获得更多权限,这种方式会出现三个问题。
第一,聊天式界面本身不适合协作。一个团队协作时不会只有 Slack,还会有 Google Docs、Notion、Airtable 等不同工具。Chat 适合沟通,但协作需要更丰富的界面。
第二,黑箱问题让你完全没办法介入 AI 的思考过程,只能等待最终结果。人很难看见 AI 当前的判断,也无法在走错方向时及时介入。
第三,Agent 虽然能调用企业的 API 和工具,却仍然像一个外部工具。它不了解团队的习惯和规则,也很难像真正的同事一样承担责任。
让人看得见、能介入、管得住
SureThing Pages 把 GUI 重新带回人和 AI 的协作过程,让双方可以真正站在同一个页面上工作。
不同场景下,AI 会自动生成对应的工作界面。做社交媒体运营时,Agent 可以在后台持续工作,把曝光、互动和参与数据整理成图表,同时准备好等待人工审批的内容草稿。用户每天早上不需要翻完一长串聊天记录,打开界面就能知道 AI 做到了哪里,还有哪些决定需要自己处理。
邮件管理也是一样。用户可以直接在界面中设定规则,明确哪些邮件可以自动处理,哪些情况需要交给人判断。相比在聊天框里反复描述要求,界面能把协作规则变得更明确。
我们还会在 Agent 执行过程中设置一系列中间节点,让它展示当前状态、正在面对的选择,以及默认准备走向哪个方向。如果用户不同意,可以立刻改变路线。
这有点像骑马或开车。系统可以自己向前走,但你始终看得见它准备去哪里,也能在需要时把方向拉回来。
此外,我们也在 Agent 中加入了更主动的学习机制。它会从 Slack 等工作环境中理解谁负责什么、任务通常怎么分配、团队怎样沟通,以及哪些事情更重要。
多个 Agent 发生目标冲突时,系统会把冲突升级给人,让人决定最终方向。人不需要参与每一步执行,但应该保留对关键判断的控制。
下一步:重做复杂 SaaS,装进行业 Know-how
这些设计看起来像用户体验上的改进,但它们决定了普通人能不能真正使用 AI。
我们接触过很多小企业主、独立创业者和本地商家。他们清楚自己的业务如何运转,却不一定知道怎样用自然语言完整描述问题。但工作流程和界面,他们能够一眼看懂。
因此,我们把 AI 的工作方式和控制方式转化成普通人容易理解的界面。公开上线三个月后,我们在个人助理、社交媒体运营和业务数据分析等场景获得积极反馈。这些场景高度依赖人机协作,AI 必须对齐人的偏好。
用户也许能在其他产品里实现同样功能,但 SureThing 是能少数能让他们轻松理解 AI 在干什么的产品。
下一步,我们希望重新设计那些功能强大、同时也十分复杂的 SaaS 软件。很多用户可能只会用到一款 SaaS 5% 的功能,却必须在整个产品中反复导航。SureThing Pages 可以根据每个人的需求,只生成真正需要的部分,Agent 则继续在界面中替用户完成一部分操作。
项目:https://github.com/shareai-lab
KRuntime 是 ShareAI Lab 推出的 Agent Harness Runtime。其核心围绕「环境工程 first」理念进行设计,用 TypeScript 实现 KB 级虚拟 Unix 环境,让 Agent Model 获得文件系统、Shell、PTC、进程、网络、记忆和 Skills,提供良好的 Agent 环境可组合性与可编程性。Agents 不必始终依赖昂贵的 Linux 虚拟机集群。
ShareAI Lab 创始人来新璐是 Agent Harness 圈子里有影响力的开源布道者之一,撰写的《Learn Claude Code》、Kode CLI 等 Agent 开发教程与工具在 GitHub 上获得超过 70k star,团队已累积获数百万美元融资。
在 Founder Show 现场,他分享了一个核心判断:模型提供智能,开发者构建环境。Agent Harness 开发的大部分工作,本质上是给 Agentic Model 设计开发一个受控工作环境。KRuntime 想做的,就是给每个 Agent 一台能够长期工作和成长的超轻量环境。

模型提供智能,环境决定 Agent 能做什么
今天,大多数 Agent Framework 都从一个简单的循环开始:把任务交给模型,模型选择一个动作,系统执行后把结果返回给模型,再进入下一轮。
最近人们经常称它为 Loop Engineering,这个 Loop 本身就是一个最基础的环境。Prompt 和消息决定模型能说什么,工具决定模型能做什么,循环里的代码决定模型的动作空间怎样变化。
大多数开发者不会训练或者微调基础模型,但会围绕模型设计上下文、动作、反馈、状态、记忆。把这些东西放在一起看,开发 Agent 其实就是在开发一个环境。
Agent 的能力同时取决于模型和环境。一个强模型放在很差的环境里,依然会频繁出错。同一个模型进入更好的环境,也会成为一个更好的 Agent。因此,开发出更好的 Agent,是为同一个模型构建更好的环境。
给每个 Agent 一台轻量 Unix 计算机
我们没有为 Agent 发明一个全新的世界,而是给每个 Agent 一台轻量级的虚拟 Unix 计算机。
为什么选择 Unix 作为 Agent Runtime 的环境,主要有三个原因:模型已经在预训练阶段见过数以百万计的 Shell 命令;文件天然承载状态,Shell 天然执行动作;Unix 本身已经支持后台任务、定时调度和网络功能。
KRuntime 用 TypeScript 实现了虚拟文件系统、Shell、进程、时钟、任务、网络、记忆和 Skills。数据库、对象存储、API、知识库都可以挂载进虚拟文件系统,Agent 只需要用 ls、cat 等熟悉的方式访问数据。
Shell 是模型唯一的动作平面。传统做法可能需要准备 JSON 格式的数据,再通过后训练教模型怎样订票、退票或调用某个 API。在 KRuntime 里,我们尽量把工具转换成模型已经熟悉的动作,不必为每个 Runtime 重新训练一遍。
整套环境被压缩到 KB 级别,意味着 Agents 能够以更轻的资源创建、长周期运转以满足大多业务需求,不需要始终依赖昂贵的云端虚拟机。当任务需要更多算力时,它再按需借用远端 Linux、Sandbox 或 GPU。
我们不打算再做一家 Sandbox 供应商,KRuntime 提供的是一个可以长期存在的虚拟工作环境。
让 90 分的模型先跑起来,再积累通往 150 分的数据
Agent 可以沿着两条路径变强。一条是直接训练模型,做 SFT、强化学习或者其他后训练。另一条是让 Agent 在真实环境里工作,积累大量轨迹,再从轨迹中提炼记忆和 Skills。这正是目前多数基座模型实验室都在关注的「经验学习」路径。
运行一个月后,Agent 会在环境里留下更多任务、记忆和自动化流程轨迹。一方面,这些轨迹数据可用于指导 Agent Harness 环境、工具与 Skill 等设计的改进。另一方面,还可用于持续后训练调优模型,以及从强教师模型到低成本学生模型的蒸馏,帮助企业降本增效,获得特定领域更强的 Agent。
我把 KRuntime 定位为「从入职第一天就在岗的 AI 员工」的工作环境。Agent 一开始就获得一个可以工作的环境,随着时间推移,环境本身也在成长。
未来,很多公司都会在自己的场景里训练一个额外的 LoRA 或小网络。基础模型也许只有 90 分,但在企业自己的业务环境中,可以被训练到 150 分。Runtime 的价值,是先让这个 90 分的模型跑起来,再帮企业把环境数据积累下来。
如果一家公司招聘 20 名员工,会给每个人配一台电脑。那么,当公司拥有 20 个甚至 2000 个 Agent 时,为什么不能也给每个 Agent 一台电脑?用这台电脑的 Agents 也能持续学习和进化,让电脑成为真正的「电脑」。
空间直觉正在训练一个能够预测互动游戏体验的世界模型。用户输入一个简单想法,系统就能生成包含 3D 场景、角色、规则和玩法的动态世界。玩家每作出一次选择,世界都会随之继续生长,实时生成新的内容和游戏路径。
创始人兼 CEO 钟喜明在博士期间主要研究 3D 世界建模,以及面向 3D Agent 的空间智能生成。空间直觉选择以游戏作为落地场景,终局目标是更通用的世界智能。游戏中持续产生的真实交互数据,将不断推动模型迭代,形成数据飞轮。

AI 生成一个游戏还不够,它必须真的好玩
过去,娱乐内容是预先制作好,再分发给玩家。我们押注的未来是,娱乐内容将由 AI 模型实时生成,让玩家能像在真实世界中一样与它互动。他们不再只是消费者,而可以创造属于自己的可玩路径,我称之为「演化中的世界游戏」。
今天的 AI 已经能够生成文本、图片、视频和代码,但这些内容并不会自然组成一个好玩的游戏。一个完整的游戏世界还需要角色、物理规则、3D 资产、行动反馈,以及由目标、挑战和奖励构成的玩法循环。
我们最早从 3D 场景和资产生成开始,后来加入 NPC 和角色,再继续加入 Gameplay Loop。现在的核心任务,是把一个简单想法变成真正活着的 3D 世界。生成本身并不够。玩家不会因为一个游戏由 AI 生成,就天然觉得它有趣。真正的问题是,AI 能不能提供传统游戏里没有的新体验。
玩家的选择,就是世界模型的训练数据
一次游戏结束后,我们会得到三类结果。拥有新记忆的 NPC、一段可以再次播放的体验序列,以及玩家在关键节点做出的真实选择。
游戏是世界智能很合适的落地场景。完整可玩的沉浸式体验,会促使玩家基于真实目标和具体情境作出连续选择,由此产生更具体、更高质量的交互数据。这些反馈帮助模型理解玩家为何停留,以及下一段体验应该如何生成。每一次游玩都在生产新内容、训练模型,形成传统游戏难以复制的数据飞轮。
我们的商业规划分三个阶段。第一阶段是游戏本身,为玩家提供个性化定制的 AI 游戏体验。第二阶段,开放角色创造、培养和交易,让创作者可以经营自己的 AI 伙伴。更长期的目标,是成为一家为实时 3D 体验提供底层能力的世界模型公司。
产品:https://www.airjelly.ai
AirJelly 是一个面向 AI Agent 的主动式上下文中间层。它通过理解用户在桌面上的真实工作流,将散落在应用、标签页和聊天中的信息整理成任务与长期记忆,并在需要时主动提供给人或 Agent。
Low Entropy AI 创始人柏特曾在字节跳动担任产品经理,主导开发了 Context Engineering 产品 MineContext,该项目在 GitHub 上获得 5500 Star。离职后出来创业,已获 5Y Capital 等投资。
AirJelly 延续了团队在 Context Engineering 上的积累,也做出了一次更明确的取舍。相比持续录制整个屏幕,它只捕捉用户按下 Enter 的瞬间。团队相信,这个动作意味着人的意图已经结束思考、进入行动,也能让上下文在用户开口之前主动找到智能。

Agent 能力越来越强,上下文还没跟上
今天的 Agent 能力越来越强,但仍然缺少上下文。它们需要从各种应用、浏览器标签页和聊天记录中收集信息。
即使信息真实存在,Agent 也很难在正确的时刻拿到它。每次交代任务前,用户还得重新描述背景。只要漏掉一个重要细节,Agent 看到的就是一个不完整的工作现场。
过去一段时间,有三项发展让这一问题具备了解决条件。Context Engineering 让我们学会怎样通过检索、记忆和结构化状态,给模型提供更好的输入。Agent Harness 让模型获得工具、循环和会话,可以执行更多动作。OpenClaw 让更广泛的用户理解了持久化 Agent 的概念。
Agent 的执行层已经快速发展,上下文层还没有跟上。上下文仍是被动的,分散在各类工具中,等待人通过提示词主动提供。AirJelly 想做的是一个主动式上下文中介,让信息在用户开口之前就准备好。
捕获 - 处理 - 召回,把上下文变成记忆
AirJelly 的工作循环包括捕获、处理和召回。
第一步是捕获。它不只记录微信中的内容,更重要的是捕捉用户桌面上的真实工作流。我们会用「回车」这类关键动作触发截图,配合无障碍接口、视觉模型和 OCR 理解当前应用和周边信息。随后,系统把应用、窗口和网页里的零散上下文重新连接,统一存放。
第二步是把上下文转化为认知。原始活动不能直接作为记忆,需要处理成动态层和静态层。动态层把行为归类为事件和任务,回答「现在正在发生什么」。静态层从长期事件和行为中提取知识,例如你是谁、偏好什么、与谁协作。
第三步是召回,让正确记忆在正确时刻出现。我们采用混合检索,向量搜索负责语义相似性,BM25 负责精确的人名和短语匹配,再用 Reciprocal Rank Fusion(RRF)平衡语义与精确结果,以时间衰减提高近期信息权重,并通过 MMR 减少重复、保持结果互补。
捕获意图从思考进入行动的时刻
最早在字节做 MineContext 时,我们每隔 5 秒捕捉一次屏幕,一天大约会产生 1500 张截图。很快我们发现,这里面有大量噪音,很难被有效组织。
后来,我们把捕捉节点改成了 Enter 键。每天处理的截图下降到约 300 张,成本也降到了原来的五分之一。
为什么是 Enter?
在即时通讯里按下 Enter,是发出一条消息。在 Chatbot 里按下 Enter,是提交一个 Prompt。在搜索引擎里按下 Enter,是确认一次搜索。很多时候,Enter 意味着人的意图已经从思考进入行动。
它虽然发生在屏幕上,本质上更接近一种带有周围环境的语言上下文。今天的模型主要通过语言训练,这类信息也更容易被理解和利用。
当 Codex 或 Claude Code 正在推理时,相关信息也许还留在 Slack、日历或其他应用里。AirJelly 会找到这些上下文,注入当前任务。用户起草 Slack 消息时,也能自动补充背景生成草稿。
更进一步,我们会让上下文主动寻找模型。系统可以从用户最近工作中发现值得关注的问题,形成 Context Feed 和 Task Feed。用户可以像刷 TikTok 或 Instagram 一样,在手机上看到自己接下来应该知道什么、处理什么。
但要理解用户更完整的工作过程,模型能力仍然是一道限制。今天的模型主要接受语言智能训练,并没有真正形成世界模型。按下 Enter 时,系统能获得用户看到的内容、发送的提示词,从而分析用户想做什么。但仅凭一天的视频记录,模型还无法准确理解用户究竟做了什么。
产品:https://bridge.surf
Bridge 是 AFK 推出的通用 AI Agent 平台。用户只需要给出目标,Bridge 就会调度多个 Agent 跨设备、跨应用持续执行,并通过独立的 Reviewer 检查任务是否真正完成。
AFK 创始人贺嘉琛是一位连续创业者,此前先后创办多家 AI 创业公司,已经收获了两次并购退出。围绕 Bridge,他分享了对 Agent 作为新一代劳动力的设想,以及在 ARR 预计达 320 万美元的情况下,团队为何决定走可定制的开源路线。

一支自主工作、对结果负责的 AI 劳动力
AFK 是 Away From Keyboard。我们希望人可以离开键盘,让 Agent 接管工作,自己坐下来,放松地看着一切自动完成。我们的目标更接近于打造 AI 员工,一支自主的智能体劳动力。第一款产品叫 Bridge,连接人的意图与最终完成的结果。
过去几年,AI 系统每年都在获得更高阶的自主性。最早的 Chatbot 负责回答问题,接着 AI 学会调用搜索和简单 API,后来又能编排多个工具,完成一份 PPT、一个文档或一项复杂任务。真实工作还要更复杂。人会在手机、电脑、会议、浏览器、SaaS 和团队沟通之间切换。
我们希望 Bridge 解决两个问题。第一,让 AI 真正对一件事有没有做完负责。如果你用过 Hermes、OpenClaw 之类的产品,你会发现,因为上下文窗口有限,你给十项任务,它可能只完成了最后两项,因为前八项被遗忘了。
Bridge 会用一个总控 Agent 理解目标和调度,每项具体任务由独立 Agent 负责,同时配有一个 Reviewer 持续检查结果。只要目标或终止条件还没有达到,系统就会继续执行、检查和调整。
我们把它叫作 Generative Adversarial Loop。一个 Agent 负责把事情做出来,另一个 Agent 负责判断它究竟有没有完成。
第二,让同一个 Agent 可以在不同环境里持续工作。AI 可以观察用户的行动,在不同设备和应用中接管工作,不再局限于聊天框和 Prompt。
用户不需要自己管理不同会话。无论你从邮件、Slack、GitHub、手机还是 Apple Watch 发起任务,背后都是同一套 Agent 系统在维护上下文、调用电脑和云端环境。
Bridge 可以观察桌面操作,在 Apple Notes 里提供建议,调用电脑完成剪辑,也可以部署应用、发送消息和通知同事。当你需要预览一个产品时,Agent 会直接搭建能够运行它的 Harness 和环境。
未来,用户可能只需要面对一张公司级 Dashboard。Slack、日历、Zoom、邮件和电脑里的变化都由 Agent 持续关注,人只处理必须由自己判断的结果。
选择开源,把生意做在企业环境里
Bridge 首次发布测试版本后,一周内在 X 上获得了约 100 万次浏览,候补名单达到 15 万人。交付率 97%,预计 ARR 为 320 万美元。首批用户来自 Cline、Hugging Face、Cursor 等团队的创始人们,以及 Anthropic、OpenAI 的员工。
我们计划在两个月后开源 Bridge 本身以及底层框架 Q。消费者可以自带模型 Key 使用,企业则为云端托管、隐私控制、数据基础设施和开箱即用的 Agent 环境付费。
我们认为,整个软件行业正面临危机。一方面,Coding Agent 越来越强,今天几乎所有软件都在某种意义上变成了开源软件,因为你可以要求 Coding Agent 复制任何软件。
另一方面,消费级市场如今是花钱的地方,不是赚钱的地方。Codex 和 Claude Code 的高阶订阅计划,相比 API 价格提供约 20 倍使用额度。用户每月支付约 200 美元,就能获得按 API 计价 20 倍的算力。
如果第三方闭源应用不允许用户接入 Codex、企业 API、自有订阅或自带 Key,就相当于在与模型公司约 95% 的补贴竞争,这会使商业模式极不可靠。
同时,每家公司都有不同业务,需要一个可定制的平台,构建自己的 AI 员工。因此,我们认为可定制的开源项目更合适。未来真正有价值的部分,会落在 Agent 怎样进入企业环境、理解业务并持续完成工作。
文章来自于"Founder Park",作者 "Founder Park"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】MindSearch是一个模仿人类思考方式的AI搜索引擎框架,其性能可与 Perplexity和ChatGPT-Web相媲美。
项目地址:https://github.com/InternLM/MindSearch
在线使用:https://mindsearch.openxlab.org.cn/
【开源免费】Morphic是一个由AI驱动的搜索引擎。该项目开源免费,搜索结果包含文本,图片,视频等各种AI搜索所需要的必备功能。相对于其他开源AI搜索项目,测试搜索结果最好。
项目地址:https://github.com/miurla/morphic/tree/main
在线使用:https://www.morphic.sh/
【部分开源免费】FLUX是由Black Forest Labs开发的一个文生图和图生图的AI绘图项目,该团队为前SD成员构成。该项目是目前效果最好的文生图开源项目,效果堪比midjourney。
项目地址:https://github.com/black-forest-labs/flux
在线使用:https://fluximg.com/zh
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0