别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架
AI资讯 2026-07-28 14:51
+6903 阅读

传统的业务指标,正在让 AI Agent 产品经理陷入“打地鼠”式的优化困境。


在大模型与 Agent 框架高频迭代的当下,如何定义一个 Agent“好不好”?


在由 CSDN 与奇点智能研究院举办的 2026 奇点智能产品大会上,昆仑万维天工 AI 高级产品总监 Phoebe 带来了她的实战思考。


别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架

Phoebe 在奇点智能产品大会分享现场


她指出,当前的 Agent 处境更像是一个“顶尖实习生”,而非真正的“员工”。


Phoebe 基于天工 Skywork 的迭代实战,系统拆解了 Agent 在度量上的“三角困境”,分享了团队踩过的交付质量、速度、成本等三大深坑,并首次公开了六维“顶尖实习生”度量框架,为行业提供了一份硬核的 Agent 产品感知与评估指南。


Agent 度量的现实困境:单一指标的“打地鼠”游戏


做过 Agent 产品的 PM,手头大概都攥着一堆指标:任务完成率、任务耗时、用户赞踩、Token 效率、成功步长、正确率……


别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架

截图自 Phoebe PPT


但在实际业务中,你会发现单一指标往往是割裂且彼此冲突的:


  • 任务完成率高,并不代表产出质量达标,结果对错依然无法判断;
  • 任务耗时缩短了,但多长算快?基准不同,耗时如何定义好坏;
  • 用户点赞点踩数据极为稀疏,显式指标与隐式指标经常发生矛盾,极难归因;
  • Token 效率提高了,成本降下来了,但往往以牺牲产出质量为代价。


在这种状态下,团队很容易陷入“打地鼠”式的循环优化:


  • 这个月保速度,发现成本上升了;
  • 下个月砍成本,发现体验和质量下降了;
  • 再去专注优化质量,速度又变慢了。


究其原因,是因为短期指标只描述了 Agent 的当下截面,却没有告诉我们,它最终应该去往哪里。


我们需要一个能够描述 Agent “终态”的参照系。


实战中的三次认知升级


在天工 Skywork 从 2025 年 5 月发布至今的迭代过程中,


Phoebe 分享了他们


经历了三次关键的认知转折。


认知升级 1:别把一次性需求,当成 Agent 的舒适区


在 Skywork 上线初期,产品策略非常传统:通过赠送大量新用户积分、提供低额会员来降低门槛,期望用户在深入使用后转化为大额会员。


但数据揭示了一个让我们困惑的规律:新用户大多只购买小额 SKU,且呈现出“候鸟式”特征(有需求时订阅,没需求时退订,过段时间又回来)。


这说明,用户只是把 Agent 当成临时工具,来解决一次性需求,双方并未建立起持续的“雇佣关系”。


事实上,一次性需求(如写单篇报告、做单个 PPT)目标明确、交付边界清晰,但它很难发挥 Agent 的核心价值(上下文沉淀、偏好记忆等),极易被后续的模型升级所内化,产品难以建立起差异化壁垒。


Agent 的真正潜力,在于服务“成长型任务”——即围绕长期项目持续推进、能够产生“复利”的任务。


随着用户持续使用,信息积累产生效应,后续的解释与返工成本不断下降,同时,Agent 越来越懂用户,收益增长与成本下降之间形成正向的“剪刀差”。


在优化过程中,Phoebe 他们曾发现有 20% 的用户在给出质量好、速度快的评价后,依然会选择点踩,但点完踩之后他们还会跑去充值。


分析后发现,用户点踩的不是质量,而是“积分消耗”。在用户的实际感知里,每一次任务都有一个性价比感知:


别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架


产品团队往往容易陷入自我感动的盲区(产物质量高、任务效率快就是好产品),但用户在算账:这个产出虽然好,但花这么多积分,值不值?


产品经理不能只做评测人,而要带着真实任务、自费去使用产品。只有当成本真正落在自己身上时,你才能敏锐地捕捉到用户的三个关键瞬间:付费冲动、想切换、想分享。


认知升级 2:从“产物交付”思维转向“任务闭环”思维


早期,Skywork 按照产物类型划分入口,试图引导用户精准表达需求,评估指标也放在“有没有做出完美的产物”上。


但在终态 Agent 视角下,评估标准应该从关注“产物质量”转向关注“任务推进”。


别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架


为什么?因为 Agent 的能力边界是呈“水波纹效应”动态扩张的。


  • 内圈(当前稳定完成的任务):静态指标已覆盖。
  • 中圈(潜在迁移圈):失败过但用户在持续尝试的任务。
  • 外圈(未来方向性扩展圈):需要新工具和新大模型能力才能完成的任务。


随着模型演进、工具调用加强以及访问权限的拓展,Agent的边界在不断外扩。PM必须比用户更早感知到下一圈层的边界,及时调整评估标准,否则静态的指标度量终将失效。


认知升级 3:功能的成败,在于能否顺利嵌入用户的工作流


我们曾对标行业竞品,在 PPT 生成上同时做了“在线演示”和“兼容导出”两个功能。但在上线初期,80% 的用户选择了直接导出,演示功能几乎无人问津。


调研后发现,用户多是企业员工,他们并不希望别人知道方案是 AI 生成的,更不可能在公司投影仪上直接用 AI 界面进行演示。


这表明:功能的成败,有时不在于功能本身,而在于它能不能顺利嵌入用户当前的工作流。


然而,这种工作流环境也是动态变化的。


2025 年,组织尚未 AI 化,员工倾向于“隐藏AI痕迹”。


2026 年,随着组织加速 AI 化,善用 AI 成为加分项,在线演示功能便会重获其价值。


六维“顶尖实习生”度量框架


基于对 Agent“成长性”、“边界动态性”和“工作流嵌入性”这三大终态特征的理解,我们发现,一个理想的 Agent,其特征表现高度类比于一位“优秀的实习生”。


别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架


传统的度量在评价“任务完成情况”,而优秀的管理者在评价实习生的“工作能


力”。据此,我们提炼出了六维“顶尖实习生”度量框架:


别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架


1. 基础学识:主动识别信息缺口并合理应用


优秀的 Agent 不只是被动执行指令,而是能识别 自己不知道什么,主动补齐关键信息,并在推理中真正用上它。衡量的不是信息量多少,而是信息是否影响了最终判断。


2. 悟性理解力:听懂字面是及格,推理语义背景才是优秀


及格是听懂用户说了什么,优秀是听懂用户没说出来的意思。例如收到"给小朋友科普最近火爆的龙虾"——及格的 Agent 做了份餐桌龙虾 PPT,优秀的 Agent 推理出"OpenClaw"项目并在执行前主动确认。


线索 × 语境 × 推理 = 真正的理解力。


3. 长记忆:记忆必须影响行动,否则只是静态数据库


真正的长记忆需要三步:


  • 记录(偏好、历史、决策依据)
  • 理解(区分稳定偏好与临时上下文)
  • 应用(在下一次任务中主动调用并改变交付结果)


记而不用,等于没记。


4. 任务拆解落地:把模糊目标转化为清晰路径


“命令型需求"大多数 Agent 都能完成,拉开差距的是 “祈愿型需求”(如"帮我做份竞品分析”)。


优秀 Agent 先反推目标,再拆解为:确定范围 → 收集证据 → 对比维度 → 提炼机会 → 输出建议。


5. 自主纠错复盘:纠错以"做对"为目标,而非仅仅"完成"


链路阻塞时,Agent 需要寻找替代路线,但新路线必须服务于用户真实需求。如果生图服务失败,不沟通就盲目路由、花大代价画出一张不合要求的图——任务状态是"完成"了,体验却是极差的。必要时应暂停并请示用户。


6. 边界自知:明确何时请示,何时自行决断


信息不足、权限不足或能力不足时,Agent 应明确承认不确定性,而不是编造答案。


判断原则:改动只影响局部细节 → 推断执行并透明告知假设;改动会导致整体方向跑偏 → 停下来获得用户授权。


总结:Agent 度量的“三个不要”


在定义和迭代 Agent 产品时,PM 需要牢记以下三点:


  • 不要过度依赖单一指标:完成率好看不等于 Agent 好用,单指标只能解释局部;
  • 不要忽视用户的心理成本:用户点踩的原因可能不是产出质量,而是“这一单不值”,成本感知直接影响复购;
  • 不要用静态指标度量动态能力边界:Agent 能力边界在持续外扩,今天有效的指标,明天可能只能解释次要问题。


把 Agent 当成一个“实习生”去培养。当你不仅关注它单次任务的成败,更愿意信任它、将更复杂的任务交付给它时,你的 Agent 便真正走在了正确的进化轨道上。


现场问答实录


Q1:您在演讲最后提到,AI 未来的发展方向是主动性加上环境感知。我们公司也一直在思考如何让 Agent 更聪明。想请问在天工,对于 Agent 在主动获取信息和环境感知方面,有没有一些最佳的实践探索?


Phoebe:环境感知是我们很早就关注并开始布局的一个方向。我们之所以在产品大盘里推出硬件这条产品线,最核心的原因在于,软件层面的信息获取存在天然的瓶颈。


在最早期的一版产品中,我们让用户上传大量文档,关联笔记本和各种参考材料。后续,我们支持了关联用户的本地电脑文件。但我们发现,所有这些方式都无法避开一个前置条件——需要用户“主动提交”。这个主动提交的动作,其实就是阻碍 Agent 无缝感知环境的一个巨大门槛。


因此,我们推出了智能背夹这类硬件。它贴在手机背面,配有麦克风阵列,能够高保真地记录你所有的会议、通话和日常沟通,并支持声纹识别。当它是开启状态时,只要你听到了什么,它就能同步采集并回传到云端 Agent 中。后续,我们还会推出带有视觉摄像头的挂件设备。


硬件的本质,是帮 Agent 去“看你所看,听你所听”,以此来自动、隐式地补全上下文。


至于主动性,我个人认为,在当前的算力与 Token 成本下,主动性功能在产品化落地上面临很大挑战。因为 Agent 执行任何主动动作都需要消耗Token(也就是成本)。除非这个主动动作的准确率能达到 99.9% 以上,否则对用户而言,频繁的主动打扰大概率会变成一种高成本的噪音。只有当未来整体算力与调用成本降到极低水平时,AI 的主动性才会迎来真正的爆发。


Q2:天工这款超级智能体产品,在定位上是 To C 还是 To B 的?另外,如果未来 AI PC 等本地算力能够支持本地处理,用户是在本地 PC 端使用更多,还是依然会更倾向于云端?


Phoebe:我们这款超级智能体产品核心定位是面向 C 端用户的,特别是目前定位在“超级个体”和“自由职业者”等高频需要生产力工具的群体,帮助他们进行日常办公、写作、研究和全栈式任务的处理。


关于本地 PC 处理与云端处理的选择,这其实代表了两种不同用户群体的诉求。


目前,我们依然更看好云端的端到端闭环。原因在于,超级个体和移动办公人群的核心诉求是“随时随地、多端无缝地让任务持续运行”。如果依赖本地运行,首要面临的物理限制就是设备的待机与网络环境。比如我在执行一些需要长达数小时运行的复杂工作流时,我不能要求我的本地电脑一直开着、不能锁屏。


云端沙盒能够完美解决设备离线、网络中断等物理限制,让用户在手机、平板、电脑等不同终端上都能实时同步并控制任务进度。因此,尽管本地 AI PC 能够分担部分端侧感知和轻量推理的任务,但复杂的长链路 Agent 任务,其终态依然会是在云端沙盒中闭环运行。


Q3:当 Agent 收集的环境数据和上下文越来越多、维度越来越复杂时,如何能够保证高效、准确的知识检索?你们在底层是如何组织和索引这些海量非结构化数据的?


Phoebe:在海量环境数据的组织上,行业目前的演进趋势已经逐渐明确:未来的知识库形态,可能不再是简单地堆砌和上传原始的非结构化文件,而是走向知识的“解构与重构”。


我们非常认同的一个理念是,未来面向 Agent 的知识库,其底层应该是以“大模型可读”的结构化网络形式存在的,例如将数据提炼为更紧凑的、带有丰富语义关联的索引网络(如 Graph RAG 或高维向量索引体系)。


信息在被捕获的第一时间,就会通过后台的常驻 Agent 进行自动清洗、打标、关联和摘要化,转化为结构化的记忆片段。


这样,当 Agent 需要调用某项记忆时,它不需要在冗长的大文本中进行盲目搜索,而是可以直接根据语义关联网精准定位到目标数据块。数据量大本身并不是技术瓶颈,核心在于你的信息架构层是否能实现高度的结构化与语义关联。


文章来自于"CSDN",作者 "Phoebe"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

5
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

添加客服微信openai178,进AITNT官方交流群