传统的业务指标,正在让 AI Agent 产品经理陷入“打地鼠”式的优化困境。
在大模型与 Agent 框架高频迭代的当下,如何定义一个 Agent“好不好”?
在由 CSDN 与奇点智能研究院举办的 2026 奇点智能产品大会上,昆仑万维天工 AI 高级产品总监 Phoebe 带来了她的实战思考。

Phoebe 在奇点智能产品大会分享现场
她指出,当前的 Agent 处境更像是一个“顶尖实习生”,而非真正的“员工”。
Phoebe 基于天工 Skywork 的迭代实战,系统拆解了 Agent 在度量上的“三角困境”,分享了团队踩过的交付质量、速度、成本等三大深坑,并首次公开了六维“顶尖实习生”度量框架,为行业提供了一份硬核的 Agent 产品感知与评估指南。
做过 Agent 产品的 PM,手头大概都攥着一堆指标:任务完成率、任务耗时、用户赞踩、Token 效率、成功步长、正确率……

截图自 Phoebe PPT
但在实际业务中,你会发现单一指标往往是割裂且彼此冲突的:
在这种状态下,团队很容易陷入“打地鼠”式的循环优化:
究其原因,是因为短期指标只描述了 Agent 的当下截面,却没有告诉我们,它最终应该去往哪里。
我们需要一个能够描述 Agent “终态”的参照系。
在天工 Skywork 从 2025 年 5 月发布至今的迭代过程中,
Phoebe 分享了他们
经历了三次关键的认知转折。
认知升级 1:别把一次性需求,当成 Agent 的舒适区
在 Skywork 上线初期,产品策略非常传统:通过赠送大量新用户积分、提供低额会员来降低门槛,期望用户在深入使用后转化为大额会员。
但数据揭示了一个让我们困惑的规律:新用户大多只购买小额 SKU,且呈现出“候鸟式”特征(有需求时订阅,没需求时退订,过段时间又回来)。
这说明,用户只是把 Agent 当成临时工具,来解决一次性需求,双方并未建立起持续的“雇佣关系”。
事实上,一次性需求(如写单篇报告、做单个 PPT)目标明确、交付边界清晰,但它很难发挥 Agent 的核心价值(上下文沉淀、偏好记忆等),极易被后续的模型升级所内化,产品难以建立起差异化壁垒。
Agent 的真正潜力,在于服务“成长型任务”——即围绕长期项目持续推进、能够产生“复利”的任务。
随着用户持续使用,信息积累产生效应,后续的解释与返工成本不断下降,同时,Agent 越来越懂用户,收益增长与成本下降之间形成正向的“剪刀差”。
在优化过程中,Phoebe 他们曾发现有 20% 的用户在给出质量好、速度快的评价后,依然会选择点踩,但点完踩之后他们还会跑去充值。
分析后发现,用户点踩的不是质量,而是“积分消耗”。在用户的实际感知里,每一次任务都有一个性价比感知:

产品团队往往容易陷入自我感动的盲区(产物质量高、任务效率快就是好产品),但用户在算账:这个产出虽然好,但花这么多积分,值不值?
产品经理不能只做评测人,而要带着真实任务、自费去使用产品。只有当成本真正落在自己身上时,你才能敏锐地捕捉到用户的三个关键瞬间:付费冲动、想切换、想分享。
认知升级 2:从“产物交付”思维转向“任务闭环”思维
早期,Skywork 按照产物类型划分入口,试图引导用户精准表达需求,评估指标也放在“有没有做出完美的产物”上。
但在终态 Agent 视角下,评估标准应该从关注“产物质量”转向关注“任务推进”。

为什么?因为 Agent 的能力边界是呈“水波纹效应”动态扩张的。
随着模型演进、工具调用加强以及访问权限的拓展,Agent的边界在不断外扩。PM必须比用户更早感知到下一圈层的边界,及时调整评估标准,否则静态的指标度量终将失效。
认知升级 3:功能的成败,在于能否顺利嵌入用户的工作流
我们曾对标行业竞品,在 PPT 生成上同时做了“在线演示”和“兼容导出”两个功能。但在上线初期,80% 的用户选择了直接导出,演示功能几乎无人问津。
调研后发现,用户多是企业员工,他们并不希望别人知道方案是 AI 生成的,更不可能在公司投影仪上直接用 AI 界面进行演示。
这表明:功能的成败,有时不在于功能本身,而在于它能不能顺利嵌入用户当前的工作流。
然而,这种工作流环境也是动态变化的。
2025 年,组织尚未 AI 化,员工倾向于“隐藏AI痕迹”。
2026 年,随着组织加速 AI 化,善用 AI 成为加分项,在线演示功能便会重获其价值。
基于对 Agent“成长性”、“边界动态性”和“工作流嵌入性”这三大终态特征的理解,我们发现,一个理想的 Agent,其特征表现高度类比于一位“优秀的实习生”。

传统的度量在评价“任务完成情况”,而优秀的管理者在评价实习生的“工作能
力”。据此,我们提炼出了六维“顶尖实习生”度量框架:

1. 基础学识:主动识别信息缺口并合理应用
优秀的 Agent 不只是被动执行指令,而是能识别 自己不知道什么,主动补齐关键信息,并在推理中真正用上它。衡量的不是信息量多少,而是信息是否影响了最终判断。
2. 悟性理解力:听懂字面是及格,推理语义背景才是优秀
及格是听懂用户说了什么,优秀是听懂用户没说出来的意思。例如收到"给小朋友科普最近火爆的龙虾"——及格的 Agent 做了份餐桌龙虾 PPT,优秀的 Agent 推理出"OpenClaw"项目并在执行前主动确认。
线索 × 语境 × 推理 = 真正的理解力。
3. 长记忆:记忆必须影响行动,否则只是静态数据库
真正的长记忆需要三步:
记而不用,等于没记。
4. 任务拆解落地:把模糊目标转化为清晰路径
“命令型需求"大多数 Agent 都能完成,拉开差距的是 “祈愿型需求”(如"帮我做份竞品分析”)。
优秀 Agent 先反推目标,再拆解为:确定范围 → 收集证据 → 对比维度 → 提炼机会 → 输出建议。
5. 自主纠错复盘:纠错以"做对"为目标,而非仅仅"完成"
链路阻塞时,Agent 需要寻找替代路线,但新路线必须服务于用户真实需求。如果生图服务失败,不沟通就盲目路由、花大代价画出一张不合要求的图——任务状态是"完成"了,体验却是极差的。必要时应暂停并请示用户。
6. 边界自知:明确何时请示,何时自行决断
信息不足、权限不足或能力不足时,Agent 应明确承认不确定性,而不是编造答案。
判断原则:改动只影响局部细节 → 推断执行并透明告知假设;改动会导致整体方向跑偏 → 停下来获得用户授权。
在定义和迭代 Agent 产品时,PM 需要牢记以下三点:
把 Agent 当成一个“实习生”去培养。当你不仅关注它单次任务的成败,更愿意信任它、将更复杂的任务交付给它时,你的 Agent 便真正走在了正确的进化轨道上。
Q1:您在演讲最后提到,AI 未来的发展方向是主动性加上环境感知。我们公司也一直在思考如何让 Agent 更聪明。想请问在天工,对于 Agent 在主动获取信息和环境感知方面,有没有一些最佳的实践探索?
Phoebe:环境感知是我们很早就关注并开始布局的一个方向。我们之所以在产品大盘里推出硬件这条产品线,最核心的原因在于,软件层面的信息获取存在天然的瓶颈。
在最早期的一版产品中,我们让用户上传大量文档,关联笔记本和各种参考材料。后续,我们支持了关联用户的本地电脑文件。但我们发现,所有这些方式都无法避开一个前置条件——需要用户“主动提交”。这个主动提交的动作,其实就是阻碍 Agent 无缝感知环境的一个巨大门槛。
因此,我们推出了智能背夹这类硬件。它贴在手机背面,配有麦克风阵列,能够高保真地记录你所有的会议、通话和日常沟通,并支持声纹识别。当它是开启状态时,只要你听到了什么,它就能同步采集并回传到云端 Agent 中。后续,我们还会推出带有视觉摄像头的挂件设备。
硬件的本质,是帮 Agent 去“看你所看,听你所听”,以此来自动、隐式地补全上下文。
至于主动性,我个人认为,在当前的算力与 Token 成本下,主动性功能在产品化落地上面临很大挑战。因为 Agent 执行任何主动动作都需要消耗Token(也就是成本)。除非这个主动动作的准确率能达到 99.9% 以上,否则对用户而言,频繁的主动打扰大概率会变成一种高成本的噪音。只有当未来整体算力与调用成本降到极低水平时,AI 的主动性才会迎来真正的爆发。
Q2:天工这款超级智能体产品,在定位上是 To C 还是 To B 的?另外,如果未来 AI PC 等本地算力能够支持本地处理,用户是在本地 PC 端使用更多,还是依然会更倾向于云端?
Phoebe:我们这款超级智能体产品核心定位是面向 C 端用户的,特别是目前定位在“超级个体”和“自由职业者”等高频需要生产力工具的群体,帮助他们进行日常办公、写作、研究和全栈式任务的处理。
关于本地 PC 处理与云端处理的选择,这其实代表了两种不同用户群体的诉求。
目前,我们依然更看好云端的端到端闭环。原因在于,超级个体和移动办公人群的核心诉求是“随时随地、多端无缝地让任务持续运行”。如果依赖本地运行,首要面临的物理限制就是设备的待机与网络环境。比如我在执行一些需要长达数小时运行的复杂工作流时,我不能要求我的本地电脑一直开着、不能锁屏。
云端沙盒能够完美解决设备离线、网络中断等物理限制,让用户在手机、平板、电脑等不同终端上都能实时同步并控制任务进度。因此,尽管本地 AI PC 能够分担部分端侧感知和轻量推理的任务,但复杂的长链路 Agent 任务,其终态依然会是在云端沙盒中闭环运行。
Q3:当 Agent 收集的环境数据和上下文越来越多、维度越来越复杂时,如何能够保证高效、准确的知识检索?你们在底层是如何组织和索引这些海量非结构化数据的?
Phoebe:在海量环境数据的组织上,行业目前的演进趋势已经逐渐明确:未来的知识库形态,可能不再是简单地堆砌和上传原始的非结构化文件,而是走向知识的“解构与重构”。
我们非常认同的一个理念是,未来面向 Agent 的知识库,其底层应该是以“大模型可读”的结构化网络形式存在的,例如将数据提炼为更紧凑的、带有丰富语义关联的索引网络(如 Graph RAG 或高维向量索引体系)。
信息在被捕获的第一时间,就会通过后台的常驻 Agent 进行自动清洗、打标、关联和摘要化,转化为结构化的记忆片段。
这样,当 Agent 需要调用某项记忆时,它不需要在冗长的大文本中进行盲目搜索,而是可以直接根据语义关联网精准定位到目标数据块。数据量大本身并不是技术瓶颈,核心在于你的信息架构层是否能实现高度的结构化与语义关联。
文章来自于"CSDN",作者 "Phoebe"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI