Z Potentials|专访Efflora,蒸馏收归内部、合成数据失效,安全极客去真实世界最深处为AI“探矿”

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

Z Potentials|专访Efflora,蒸馏收归内部、合成数据失效,安全极客去真实世界最深处为AI“探矿”
AI资讯 2026-09-23 17:14
+8954 阅读

Z Potentials|专访Efflora,蒸馏收归内部、合成数据失效,安全极客去真实世界最深处为AI“探矿”


推荐语


过去一年,AI数据市场经历了几轮剧烈的主题切换:从标准Coding到垂直行业,从合成蒸馏到真实场景,从任务够长就是好数据到什么任务值得解。需求每两个月刷新一次,供给侧的生存法则也在同步重写。在这个过程中,一些原本隐身于产业链深处的角色开始浮出水面——数商,就是其中之一。


王泉是这个群体里一个非典型的样本。他出身网络安全,团队核心成员来自中国第一代安全极客社区“乌云”,公司取了个拉丁文名字Efflora,中文名叫“平等智能”。今年年初,团队完成了过千万元种子轮融资,由Lollapalooza Capital(王慧文家办) 领投、蔚来资本跟投。拿到钱之后,这支不到十人的团队把自己定位成真实世界的采样器”——在合成数据之外,也更专注于采集真实应用的环境与任务,做成模型公司强化学习需要的专属数据,卖给模型公司做强化学习。用王泉自己的话说,真实世界有无限的分辨率,采样精度高,看到的就是4K;做得粗,可能只有720P。


在这次访谈中,王泉拆解了当前数据市场的真实交易结构:一些头部厂商倾向于内部完成标准化数据生产,外部采购需求更多集中在非标场景;蒸馏和合成也正在收归模型公司内部,真正的窗口属于那些产出周期最长、场景定义最难的非标数据。他也给出了一个尖锐的判断——训下一代模型本质上不是research问题,甚至不是工程问题,而是一个go-to-market问题:你的token卖给谁,决定了你需要什么数据,也决定了你能不能转起数据飞轮。卖不出token,致命之处不在收入,在于收不回用户数据。


关于为什么押注网络安全数据,王泉的解释层层递进,但最打动人的是最后一层:安全攻防天然沉淀了一类极其稀缺的决策数据——在充满迷雾和噪声的环境中综合判断、排兵布阵,而这恰恰是当前AI最薄弱的能力。没有人能给AI搭一个“如何开公司”的训练环境,但安全领域里,这样的环境每天都在真实发生。


访谈末尾,话题从商业滑向了更远的地方。AI用人类几千年的公共知识训练而成,生产力的提升却不会自动惠及每个人。王泉把那种默认“技术红利自然下沉”的乐观叫作“生产力的便车”。他做了几年文学播客,常和朋友聊一个问题:当下整个世界的结构,正在面临着巨变。而他现在想做的事情,某种程度上就是对这个问题的一个回应——在数据这一环,就开始回答:我们到底想要什么样的 AI。


Z Highlights


  • 蒸馏和合成数据未来基本会收归到模型公司内部;真正的窗口期是真实的非标场景数据——它产出周期最长,因为场景和环境一开始根本没被定义好,你得先找上游真实用户,一起把场景慢慢定义清楚才能产出。也正因为它门槛高、周期长、别人一时半会做不了,反而给了我们更长的窗口。
  • 市场原本的共识是,要真正达到AGI一定不能靠蒸馏、得靠RL,这个共识其实对我们做数商最有利。但我越想越觉得:如果领先模型对普通用户已经接近无感,那单靠蒸馏蒸出一个八九十分的AGI,是真有可能的——当然前提是让不让蒸。
  • 大家对“做下一代模型是什么问题”的认知一直在升级:最开始以为是research问题,后来共识说它是工程问题,是infra和data。但我觉得它本质上是一个go-to-market问题——要么你全方位SOTA,要么你极致性价比,否则哪怕是第二名、第三名,token都卖不出去,这非常残酷。
  • 最开始判断数据好不好,标准很简单:任务足够长、步数足够多、reward稳定客观,但那个标准里从没提这个任务“是什么任务”。现在光长已经不够了,更重要的是它得是一个“值得解”的任务——甚至也不能靠专家直接标,因为哪怕是专家,他访谈时说出来的任务,和他实际做事过程中产生的任务,往往完全不一样。评判标准,从供给侧转到了需求侧。
  • Grok买了Cursor之后推理能力突然上了一大截——因为Cursor里有大量用户的真实场景和数据。你反过来想,Cursor凭什么值那么多钱?产品的壳不值钱,它自己训的模型也不值钱,真正值钱的是用户的真实数据。
  • 手工做数据谁都能做,招几个人就能做出几条来;但一旦要大量的、高质量的数据就非常难。所以我们把自己定位成“真实世界的采样器”,本质是因为做数据的核心难点就是scaling
  • 真实世界有无限的分辨率——分辨率取决于你用什么角度去采样:采样精度高、任务做得真实,看到的世界就是4K的;做得不好,可能就是720P。更关键的是,真实世界让verify变得可规模化:真实的淘宝就摆在那,模型做得对不对,拿去和真实淘宝比一下就知道了。
  • 搞安全的人最大的特点是特别擅长reward hacking——这本身不是好事,但它意味着你习惯用非常规的、有点奇技淫巧的办法解决问题,而不是走大家都会走的常规路径。这也是我们敢去讲、去探索这个新范式的原因——它本来就是一件跳出常规的事。
  • 现在很多团队会默认,只要把生产力提上去,大众自然就能享受红利,我把它叫“生产力的便车”。但今天AI取代工作、裁员都在发生,生产力提升并不会让所有人都搭上便车。所以我们常说:你想要什么样的AI,就做什么样的数据。


01 蒸馏和合成正在收归内部,留给外部数商的窗口越来越窄


ZP:从你这一年的观察来看,模型公司对数据的需求到底在发生什么变化?


王泉:变化非常快,基本每两个月就有一次比较大的变化。但要看清楚,得先理解需求正在分层:一头是还在大量采购的标准化Coding数据——给一个需求,怎么写feature、怎么fix bug;另一头是越来越多厂商开始要的真实、完整的环境数据,同样是Coding,他们关心的是这个需求怎么来的?这个软件的整个供应链、整个生命周期是怎样的?你最开始和客户谈了什么合同、聊天记录是什么、需求怎么讨论、怎么开发,开发完客户到底验收不验收、买不买单、结果好不好。在我们接触的范围内,后一类需求目前仍集中在少数先锋厂商,大多数客户还没进入这个阶段——因为它是非标数据,得我们和模型厂商一起去定义数据的标准、格式,以及怎么定义场景和任务。


如果把过去半年的节奏捋一遍,是这样一条演进线:Coding一直都要,但难度、长度、复杂度在不断往上走;最近几个月开始冒出垂直行业的诉求,比如法律、金融、医疗这些信息化程度高、数据比较好弄的领域;再到现在出现了 Agent和AI for Science的需求。最近新一代模型出来后,GUI很可能又要火起来。所以这个市场不是线性增长,而是一直在换主题。


ZP:那从整个市场来看,现在交易的数据主要是哪几类?分布是怎样的?


王泉:我不确定大家是否了解这个市场的真实结构。过去一段时间,比如过去三个月,市场上交易额的大头其实是那些可被规模化复制、边际成本较低的数据——单笔订单金额比我们这种环境数据大得多,一笔就非常高;我们这种数据单个项目的价格没那么高,但单条价格会很高。


还有一个也许大家不太了解的点:不同厂商对外采数据的态度差别很大。有些团队已经把标准化数据生产内部化,自己搞定大部分常规需求;但对真实环境、尤其是非标场景数据,往往需要跟外部一起定义场景、共建环境。Efflora之所以坚持做真实环境,是因为在我们看来,真实世界的reward是合成不出来的。比如一个真实软件供应链的数据、一个软件做出来客户到底下不下单,这种信号只可能来自真实世界。


ZP:那把数据分类拆开看,未来这个分布会怎么变?哪一类才是真正的窗口期?


王泉:我把数据分成三类来看:合成数据、专家数据、真实的非标场景数据,这三类的命运完全不同。


先说会收缩的。蒸馏数据会越来越少,现在已经在减少了;合成数据也在减少——一是它对模型的边际提升在变弱,二是厂商自己就会合成。所以蒸馏和合成,未来基本会收归到模型公司内部。


再说会长期存在的。专家数据一定持续需要,但越来越难做:现在说的“专家”打引号,其实是各行业入行两三年的一线人员;下个阶段就得要五六年、七八年经验的人去做更复杂的问题,项目难度和成本都越来越高。


真正的窗口期,是第三类——真实的非标场景数据。它的产出周期最长,因为场景和环境一开始根本没被定义好,你得先投入资源、找上游的真实用户,一起把场景和环境慢慢定义清楚,才能产出数据。专家数据和真实数据解决的是不同的问题,可以这么粗暴地划分。也正因为它门槛高、周期长、别人一时半会做不了,反而给了我们这样的团队一个更长的窗口。


ZP:既然一线厂商很多东西自己做,那用蒸馏这条路还能走多久?


王泉:这个很难说。市场上原本有个共识:真正要达到AGI或SOTA,一定不能靠蒸馏,蒸馏顶多是冷启动,甚至完全不蒸、尽量做RL,像字节Seed就不蒸馏。如果这个共识成立,其实非常有利于我们这种做数商的。


但我最近跟很多朋友聊下来,意识到一个反共识的可能:蒸馏会不会是可以永远蒸下去的?也就是说,不靠RL、单靠蒸馏达到AGI,有没有可能?我觉得不能排除,它真的有可能。这取决于怎么定义AGI。我的定义是:对一个普通用户来说,模型几乎能让他无感使用、能回答他几乎所有问题——除非他是某个领域的专家、问特别复杂的问题,否则日常大部分需求都能解决,我就认为它基本到 AGI了。按这个标准,ChatGPT对普通用户可能已经八九十分了。那如果领先模型已经到这个水平,再过半年对普通人基本无感,去蒸馏它、蒸出一个八九十分的模型,是真有可能的——当然前提是让不让蒸。


ZP:需求这么快地变,头部公司对高质量数据的定义,是不是也在变?


王泉:变化很大,而且方向很关键。最开始大家判断数据好不好,标准很简单:任务足够长、步数足够多,reward稳定客观,就是好数据。因为长程推理是过去半年大家一直在攻克的点,有些厂商到现在都还做不到。


但你注意,那个标准里没有提这个任务“是什么任务”。现在越来越发现,光长已经不够了——海外SOTA模型现在又快又好,你看Codex、Claude实际用起来非常快,一会儿代码就写好了,想找到足够长的任务反而不容易。所以除了长,更重要的是这个任务本身得是一个“值得解”的任务。什么样的任务值得解,是个很有意思的问题。大家希望从真实世界的应用环境里去找任务,而不是靠合成,甚至也不是靠专家直接标——因为哪怕是专家,他访谈时说出来的任务,和他实际做事过程中产生的任务,往往完全不一样。换句话说,评判标准从供给侧转到了需求侧。


这里还有个关键差别:已经有产品化Agent的厂商,能从真实使用里搜集任务和场景,逐渐形成数据飞轮;但不少团队还没形成稳定的真实用户数据回流机制,所以他们其实很难判断什么任务是好任务、什么场景值得解。


ZP顺着什么任务值得解,其实引出另外一个本质问题,训模型到底是个什么问题?


王泉:对,这是我经常跟人讲的一个判断。大家对“做下一代模型是什么问题”的认知一直在升级:最开始以为是research问题,是训练算法、预训练、后训练的问题;后来形成共识,说它是工程问题,核心是infra和data,数据质量够高、infra够好,就有理由做出好模型。


但我觉得它甚至不是工程问题,本质上是一个go-to-market问题。因为要么你全方位SOTA,要么你极致性价比,否则哪怕是第二名、第三名,token都卖不出去,这非常残酷。国产模型以前打性价比,但现在DeepSeek谁都比不过,其他厂商就得想清楚:我凭什么卖token、别人为什么用我?比如某个模型做网页前端效果特别好,在新一代通用模型出来前它就是最好的,那想创业的独立开发者就都愿意用它,因为大家创业第一步不是做App就是做Web,都想把页面做漂亮。它在“做漂亮页面”这个场景是SOTA,token就卖得出去。


卖不出去token,还有个更致命的问题:不是收入多少,而是你收不回用户数据。某个模型在某个场景最好→更多人用→数据回流更多→这个方向更领先,这就是数据飞轮。所以训下一代模型,得先想清楚token卖给谁、要解决什么问题;想清楚要解决什么问题,才知道需要什么数据。


这正是我们作为数商的位置。我们的方法是反过来的:先从真实世界找到AI真正的应用场景,不管是垂直领域的企业侧,还是有大量真实用户的AI应用侧,从这些场景拿到真实数据,再倒推去定义rubrics(评分标准)、把它变成可评估、可验证、可训练的环境。因为AI最终一定会落到这些场景里。现在模型厂商的市值虽然锚定的是模型能力而不是收入,但能力也好、落地也好,终点都在具体场景里。我们干的这一环,就是“从场景到环境、到数据”;接上厂商那一环,就是“从数据到模型、再让应用变好、用户变好、数据继续回流”。这个闭环一旦转起来,就是模型在某个场景持续摸高的飞轮。


02 真实世界的reward无法合成,数商的第一性原理是规模化


ZP:你为什么会从一个安全的人,跳到做AI数据?


王泉:有两个触发点。一个很现实:24年开始跟企业客户聊,我明显感觉大家 IT和安全的预算越来越少,同时都想做AI转型却不知道怎么转,我就开始琢磨 AI到底怎么在企业侧落地。另一个偏价值判断——我平时看书多,还做过几年文学、哲学、社科的播客,在那个过程里想清楚了一件事:现在很多硅谷和国内团队会默认,只要把生产力提上去,大众自然就能享受红利,我把它叫“生产力的便车”。但今天你看,AI取代工作、裁员都在发生,生产力提升并不会让所有人都搭上便车。真正要让AI惠及普通人,需要从业者有意识地去影响行业方向所以我们常说一句话:你想要什么样的AI,就做什么样的数据——这就是我们做数商的初心。


ZP:请你介绍一下Efflora,公司现在主要在做什么?


王泉:Efflora是个拉丁文名字,意思是涌现、涌现生长。


我们核心做AI的数据,尤其是后训练数据。我们不做蒸馏数据,做的基本都是 To B的环境和任务。数据方向很多,我们主要聚焦三块:一是Coding,因为市场需求量最大,也最适合我们做;二是Cyber,就是网络安全数据,它是AI摸高绕不开的高地,至于AI for Science那块不太适合我们团队;三是多模态,因为我们本身一直在做GUI。除此之外,我们也在探索真实场景数据,比如企业端B 端、C端的真实数据。


客户主要两类。一类是各种模型公司和实验室,这是主力;另一类是垂直行业的应用厂商,现在有些垂直领域的公司想训自己的模型。不过我们不提供训练服务,只提供数据。


ZP:如果用一句话来定位Efflora,你会怎么说?


王泉:我觉得应该是真实世界的采样器。这个定位可以从两个层面理解。


第一层,是为什么定位在这。做数商的很多,但数商的第一性原理、核心难点其实是scaling。手工做数据谁都能做,招几个人、知道厂商需求,就能做出几条来;但一旦要大量的、高质量的数据,就非常难——首先要持续找到有价值的种子任务,其次要让任务构建和结果验证也能规模化。尤其到了后训练、RL这个阶段,只有任务数量上去还不够,任务的复杂度、真实性和反馈质量都得跟上。所以定位在“采样器”,本质是因为做数据的核心难点就是scaling。


第二层,是我们凭什么能scaling。我们搭建了一套覆盖任务采集、环境构建到结果验证的完整pipeline,这套数据infra是我们的核心技术能力。从真实世界的业务场景出发,我们采集有价值的任务,梳理任务目标、操作流程和约束条件,再将这些任务转化为模型可以交互、训练和评估的环境,并配上相应的验证机制。


这里面难的,是把整条链路规模化。真实世界里的任务形态很多,业务逻辑和复杂度也各不相同。我们需要把它们转化为可执行的任务、可运行的环境和可检验的结果,同时保留那些真正决定任务难度的细节。只有把这些环节打通,才能在扩大数据规模的同时,保持任务的真实性和验证的可靠性。


我们一直说,真实世界有无限的分辨率。同样是一个购物流程,你可以只看到搜索、下单,也可以继续往下看商品规格、库存变化、优惠规则,以及各种异常情况。采样精度高,任务做得真实,看到的世界就是4K的;做得不好,可能就是 1080P甚至720P。真实世界提供足够丰富的任务来源,而这套infra让我们能够持续把它们转化为模型训练所需要的数据和环境。


ZP:真实数据真的这么值钱吗?有没有直观一点的例子?


王泉:我个人觉得有个近期的例子:Grok买了Cursor之后,推理能力突然上了一大截。为什么?因为Cursor里有大量用户的真实场景和数据。你反过来想,Cursor当下凭什么值那么多钱?产品的壳不值钱,它自己训的模型也不值钱——真正值钱的是数据,尤其是用户的真实数据。这就是我们为什么笃定要做真实世界的采样。


ZP:这套从真实任务到训练环境的数据基础设施,是怎么积累起来的?


王泉:这条路一脉相承。我们最早做的是GUI Agent,安全背景让我习惯从底层拆解系统——面对一个应用,让AI从注册账号开始,把主要功能和业务流程完整走一遍,理解用户在不同条件下做什么操作、系统怎么反馈、步骤之间什么依赖。


做GUI Agent的过程中你会发现,真实任务的复杂度藏在整个流程里。一个按钮能点到只是起点,点完之后状态变没变、下一步能不能继续、异常怎么处理,才决定任务能不能完成。我们积累的,就是让Agent在这些复杂流程里稳定操作、理解系统行为的能力。


真正的转折点是今年年初。当时我们围绕一款很火的AI产品做了一次技术验证,有朋友看到后说:这套能力其实可以直接用来服务模型训练——因为做GUI、做 RL都需要对应的任务和环境,让模型能实际操作、获得反馈、验证结果。这一下把我们接到了一个更底层也更大的需求上:如何持续为模型提供有真实业务复杂度的训练环境之后我们把任务采集、环境构建、测试和验证打通,变成一套能规模化交付的pipeline。


这也是年初融资被认可的核心。2026年初拿到王慧文老师的投资,当时做GUI 的团队很多,他评价我们是其中最接近落地、也最“不直给”的一个。这种“不直给”跟安全背景有关——我们习惯先理解系统底层有哪些能力,再选路径。比如让模型点准一个按钮,常见方案是识别图像输出像素坐标,但布局一变、弹窗一挡就不稳。我们会结合系统接口、无障碍能力和界面结构信息来操作。对底层的理解最终体现在任务链路的稳定性上:一次操作的小误差,放到几十步、上百步的任务里就可能决定成败,也直接影响训练环境的质量。


03 给AI一个没有提示的仿真系统,让它从零开始摸索


ZP:这套pipeline具体怎么运转?从真实世界采集到的任务,如何变成可以交付的训练环境?


王泉各类数据很不一样,但整体上都要经过任务采集、环境构建和结果验证这几个环节。我举两个例子。


第一个是Coding。比如客户需要一批复杂度高、操作链路长的电商网站开发任务。我们首先要理解客户希望提升模型的什么能力,再从真实业务场景中采集相应的任务,把用户目标、功能要求、业务约束和完成条件整理清楚。


接下来,是把这些任务组织成模型可以实际执行的训练环境,配好初始状态、必要的上下文和测试条件。模型在里面写代码、运行和调试,我们再通过相应的验证机制,判断它有没有把任务完成。


比如加购物车,看起来只是一个功能,但选了什么规格、加了几件、库存够不够、重复添加怎么处理,都会影响结果。如果只要求页面上有一个按钮,任务就很浅;把这些业务条件放进去,模型才需要处理真实开发中会遇到的问题。


验证也要跟着业务逻辑走。页面有没有显示是一层,操作之后的数据和状态是否正确、不同条件下的行为是否符合要求,也是需要检查的部分。交付之前,我们还要跑测试,确认任务描述、环境行为和验证标准是一致的。这套pipeline 的价值,就是把这些环节串起来,持续产出有真实复杂度、能够稳定评估的任务和环境。


第二个是网络安全。有一类常见的benchmark,是“我告诉你某系统有个漏洞,你写代码复现它”。这能测一部分能力,但和真实安全测试里的问题还有很大距离。


真实的场景是:在一家头部电商平台做授权的内部测试,前台谁都能访问、人人有账号,那你能不能从前台发现通往内部系统的攻击路径?攻击点在哪、漏洞是什么、怎么进去,都需要自己分析,任务不会提前把答案的方向告诉你。


所以我们提供的是一批仿真的业务系统环境,让AI从普通用户的访问条件开始探索,不预先告诉它漏洞位置或攻击路径。环境里有正常业务,也有各种噪声,它需要自己观察、提出假设、尝试和验证,走不通的时候还要调整方向。


这类任务对环境和评估的要求也更高:既要让业务系统能够正常运行,支持连续探索,也要能够判断模型最终达到了什么结果。我们希望通过这样的环境,训练和评估模型面对陌生系统时独立发现问题、解决问题的能力。


ZP:强化学习在这套流程里扮演什么角色?你们交付的是环境和rubrics吗?


王泉:对,我们的任务就是用来做RL的。整个数据、环境和任务,都是给模型厂商做RL用的,我们同时提供环境和verifier。现在有厂商买我们的环境,拿过去自己就能rollout出大量轨迹,这些轨迹又可以用于SFT、用于蒸馏。所以我们交付的核心,就是环境和rubrics。


ZP有没有已经跑通的、拿真实用户反馈signal反过来优化模型的案例?


王泉:我们现在在招聘这个场景做得比较多,其他方向还在探索。说实话,对模型厂商来讲,这种数据采购是非标采购,讨论半天,也没有现成的采购目录可以买,真实使用产生的signal,是合成不出来的,谁能把这个signal固化成可训练的环境,谁就有价值。


ZP:那回到战略,Coding、Cyber、多模态、应用场景数据这几块,现阶段你们最重点押注哪里?


王泉:现阶段最重点的是Cyber,下一阶段是应用场景数据。


ZP:Cyber相对小众,为什么它会是你们的重点方向?


王泉:有三个理由,层层递进。


第一,从叙事上讲。所有基模厂商现在都在讲“摸高”,而真正能摸高、又能让大众直观感知的只有两个方向——AI for Science和AI for Cyber发模型是go-to-market问题,需要面向大众、好的叙事。数学、科研是一个很好的叙事,编程是另一个,Claude和一些厂商一直在用,但国产厂商还没人用 Cyber 这个叙事。它确实有点讲故事,但我不回避——它是让大众直观感知模型能力的绝佳方式,因为大众就觉得安全极客厉害、数学家厉害,比如AI在对系统一无所知的情况下把它攻破、甚至做出让ATM吐钱这种效果,冲击力非常强。


第二,从事实需求上讲。AI的Coding能力会越来越强,强到有一天银行系统、重要基础设施可能都是AI写的。让AI写银行系统,你担不担心?大家都担心。也就是说AI写出来的东西越来越多,AI本身的安全能力就越来越被需要,这也是我们现在在做的。


第三,也是最本质的——它是一个极好的决策任务以前很多人做预测模型,但我们日常真正难的其实是决策问题:投资是决策,信息多、噪声多,要综合判断再行动;创业、开公司也是决策,每天各种市场反馈,你得决定做什么方向。AI 在决策问题上表现非常差,因为像如何开一家公司这种,谁也没法把数据固化下来、给AI一个能每天收到反馈、客户消息、市场信号的角色环境——这个环境太难搭、数据太难弄。


但网络安全里天然就有这样的数据。安全里有个词叫态势感知,是从军事里借来的。就像打策略游戏,地图全是战争迷雾,只有你标记过的点是亮的,你得从真真假假的情报里综合判断、再决定下一步怎么排兵布阵。安全也一样:像字节、阿里这样的公司,每天面对全世界几十亿、上百亿次攻击,来自各种组织和个人,你要判断哪些成功了、哪些失败了、下一步让谁去补救、要不要处理——比如平台被薅羊毛了怎么办。它本质上是一个极其复杂的决策问题,甚至已经不只是“安全”本身了。只有安全领域天然沉淀了这种高质量的决策数据,能真正提升模型的决策能力。


04 团队不到十人,底色是极客文化


ZP:能不能透露一下现在的订单量级和构成?


王泉:从构成看,我们最早做的是Coding数据,6月份才开始,在国内卖得不算特别多,主要是起步晚。Cyber数据目前跟几家主流模型都有合作,要么已经签单,要么在测试中,卖的是真实数据、环境更复杂。第三类真实场景数据,我们正在跟海外模型探讨怎么做成一个标准环境。交付周期其实不长,取决于产能,而产能取决于种子任务和verifier——只要种子任务和verify设计好,周期就不长。不管是Coding还是Cyber,我们应该是目前市场上单条价格、单价最高的。


ZP:你怎么看你们所在市场的竞争格局和玩家构成?团队又是怎么配置的?


王泉:从产业链看,我们和其他团队最大的不同在上游。我们定义的上游是对接真实应用那一侧,包括B端和C端;中游是各种agency团队;下游是模型侧。我们放在上游、对接真实应用的人比别人多,这直接对应了“真实世界采样器”这个定位。


也正因如此,我们目前是一支不到10人、但背景很互补的团队,大致分成“增长”和“技术”两条线。增长这条线的代表是我的联创天楚,她15年在阿里,17年到腾讯负责《PUBG MOBILE》的海外市场,长期做用户市场和增长,24年出来创业,最早也是做AI应用;我们25年年初认识,5月份一起在杭州成立了这家公司。另一条线是强技术、强研发背景,团队里有几位核心成员来自“乌云”那是 2010年创立、2016年关停的国内最具影响力的安全漏洞披露平台,当年聚集了一批最顶尖的安全研究者。所以我们从底子上就是一支既懂真实用户、又懂底层系统的团队。


至于招人,现在评价人特别难。大家都习惯用标签、用过去经验看人,但AI的变量太大,很多标签都失效了。所以我招人的核心原则是:找能在变化中受益的人,而不是变着变着就跟不上的人。这种人有两个特点,一是学习率特别高、斜率特别大,二是韧性足够强。人的成长其实跟RL一样——AI可以把一道题反复做一万遍,feedback不好也能坚持,因为它没有感情、能持续学到东西;但人做一道题失败三次可能就放弃了,而那三次很可能都只是噪声,所以韧性极其重要。


ZP:为什么有些数商公司,尤其是合成数据类的,会养一个庞大的researcher 团队,而你们的组织结构不一样?


王泉:这其实很好理解,本质逻辑和我们一样,模型要摸高,就得有人去定义什么是“高”。合成数据类公司靠大量researcher去定义和构造那个“高”;而我们的路径是从真实世界里采样那个“高”,所以我们把更多的人放在对接真实应用的上游。方法不同,组织形态自然不同。


ZP:你觉得你的背景,在这一批数商公司里带来的最大差异化是什么?


王泉:我觉得是搞安全的极客这个群体的特质。我们最大的特点是特别擅长reward hacking——这本身不是好事,但它意味着你习惯用非常规的、有点奇技淫巧的办法解决问题,而不是走大家都会走的常规路径。跟很多数商、AI应用的朋友聊下来,我最大的感受就是我们是“反常规”的,从背景到思维方式都是。这也是我们敢去讲、去探索这个新范式的原因——它本来就是一件跳出常规的事。


我们的组织文化也是极客文化。你来我们办公室,会看到同事日常就在破解各种东西。比如我们有一台咖啡机,它有个App,能通过蓝牙控制水温和研磨参数,我们把它破解后写成Agent的tool,接到 GPT 里。然后你想喝什么风味都行,跟 GPT说“我一点都不想苦、就想特别甜的咖啡”,它就会疯狂思考怎么把咖啡调甜、去控制咖啡机做一杯出来,你再给它feedback——这就很适合AI。这种把真实世界“破解”成可控环境、再喂给AI学习的劲头,其实就是我们做数据这件事的底色。


05 快问快答


ZP:过去一年,你最大的认知变化是什么?


王泉:最直接的一条是:不是先埋头造数据,而是先从真实世界找到值得解的场景,再倒推去做环境和rubrics。落到组织上,就是我们把人力的大头放在对接真实应用的上游,而不是放在中间的生产环节——这在同行里是个少数派配置。


ZP:你每天花最多时间思考的问题是什么?


王泉:什么样的任务是“值得解”的任务。这听起来很虚,但它其实是我们业务的核心——因为你定义什么是好任务、什么场景值得做成环境,就等于在定义下一代AI会长成什么样。


ZP:你现在最反共识的一个判断是什么?


王泉:蒸馏可能是可以永远蒸下去的。理由前面讲过了,这里只补一句:作为一个做安全出身的人,我倾向于认为,在“让不让蒸”这件事上,总归是有折中办法的。


访谈的最后,王泉聊起了他做了几年的文学播客,以及一个他常和朋友讨论的问题:马克思大概不会想到,从悲观的角度来看,有一天无产阶级也许会变成“无用阶级”。做AI早期,标数据的还是非洲、东南亚的低成本劳动力;而到今天,普通人的数据甚至都用不上了,工作也在被替代。当社会财富的增长越来越来自 AI的劳动、来自token和电,人的价值到底是什么?


在他看来,AI是用人类几千年沉淀的公共知识训练出来的,每个人、每个人的祖辈都有贡献,所以它本质上更像一种公共物品,收益理应由社会共享而这,也正是公司取名“平等智能”的原因——生产力的提升不会自动让所有人搭上便车,真正要让AI惠及普通人,需要从业者有意识地去承担一点责任。


“你想要什么样的AI,就去做什么样的数据。”这既是Efflora的方法论,也是王泉的初心。


文章来自于"Z Potentials",作者 "Z Potentials"。

1
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群