个性化在通用AI产品中一直是个加分项。无论是ChatGPT、Gemini还是Claude,还是今年的Openclaw、Harmes都把记忆和个性化当成核心卖点,理由是它能提高可用性、参与度和用户满意度。学术界对个性化的研究,也几乎全部集中在"如何做得更好、更准、更符合用户口味"上。
问题在于,几乎没有人在测"个性化做坏了的后果"。谄媚(模型无原则地顺着用户)虽然已经被广泛讨论,但要么是在没有个人信息的场景下单独研究,要么只盯着这一种偏差。而真正由"USER.md加MEMORY.md"这条个性化流水线引出的行为偏移,缺少一个能把责任追到具体环节的评测工具。

如果你平常用AI做决策参考,默认它会把所有选项公平地摆到你面前;那么UIUC提出的这套名为PRISK的评测框架会告诉你:当你把个人画像喂给它后,这个前提就不成立了。它开始只展示"符合你人设"的选项,把其他的悄悄删掉,而你根本不知道它们存在过。

论文贡献的三维认知框架




这样因子化拆开的目的,是让偏差能被精确因果追责:到底是个性化画像 在起作用,还是检索记忆 在起作用,两者都能被单独解耦检验。评测数据共有 3000 条人工核验过的测试用例,题目来自 CSQA、GSM8K、MMLU 三个基准的改写,加上模板生成和 Reddit 真实帖子里的题目;画像部分取自 Reddit 真实用户并辅以合成数据,记忆则全部用合成、受控的多轮对话,避免真实日志里的干扰因素。
第一类风险叫无关个人化,指模型在根本不需要个人信息的场景里,强行引用你的背景来包装答案。
论文里,一个用户只是问“什么是货币的时间价值”,模型答完定义后,却因为知道他是年轻实习生、预算有限,顺手把回答改造成了储蓄建议。内容未必错,但问题在于:一个本来与“你是谁”毫无关系的知识题,被用户画像硬生生带偏了方向。

这类偏差还会伤到实打实的正确率。研究者把CSQA、GSM8K、MMLU的题目改成口语化问法后重测,发现只要加上画像,模型的精确匹配准确率就整体下滑,最多掉了4.3个百分点。最严重的恰恰是几款旗舰闭源模型:Claude Haiku 4.5的无关个人化抗性分数从满分100直接跌到12,Claude Sonnet 4.6跌到26.5,Gemini 2.5 Pro从99.4跌到10.7。也就是说,越擅长把画像和问题关联起来的模型,越容易在这里翻车。

第二类风险叫偏好收窄,指个性化把模型的回答空间压缩到只贴合你画像的那一小撮,把其他同样有用的选项都排除了。

图:Fisher精确检验热力图——不同画像属性(年龄、职业、性别等)对答案覆盖率的影响差异,收窄沿人口学刻板印象分布
研究者用50个虚拟用户画像,乘以100个开放式咨询问题,得到5000组组合;每个答案再在温度0.8下采样20次,统计模型是否稳定地给出更窄的选项集。结果是压倒性的:对其中两个咨询问题做逐画像统计,40个画像里33个(85%)得到的回答都比基线明显更窄。一个"青少年音乐人"画像只拿到基准选项池的13%,一个"武术馆老板"只拿到20%。
更值得警惕的是,这种收窄不是随机的,而是沿着人口学刻板印象走。研究者用Fisher精确检验做显著性分析,发现:
这意味着,个性化不只是重新排序候选答案,而是把模型里潜藏的人口学联想,变成了一套实际可见的信息筛选。
第三类风险是谄媚偏置,又分两种:一致型谄媚(用户明明错了,模型也不纠正,反而附和)和视角型谄媚(模型放弃中立立场,顺着用户的偏好站队)。

图:偏好反转实验——把用户偏好从“喜欢A”翻转为“喜欢B”后,模型的回答几乎全部翻向相反方向
前者的程度相当惊人。在Reddit的AITA(“我是不是很过分”)数据集上,Gemini 2.5 Flash面对社区已经判定为错误的用户立场,有67.5% 的概率不纠正反而附和;加上画像后,这个概率又上升了19.5个百分点。后者的测试更极端:给用户一个明确立场,再问一个中立的评价题,Gemini 2.5 Pro的中立性分数从55.1直接跌到0.9。
这不是个别模型的毛病。13款模型里,除GPT-5.4-mini和Gemini 2.5 Flash之外,其余全部在加上画像后损失了超过一半的谄媚抵抗力。研究者还做了一个反事实实验:把用户的偏好从"喜欢A"翻转为"喜欢B",结果94.8% 的回答跟着翻向了完全相反的方向。模型几乎是被画像牵着走。
拆开USER.md和MEMORY.md的好处,在这里体现得最清楚。研究者用混合效应模型对因子数据做归因,发现无关个人化几乎完全由画像驱动(效应量高达0.784),记忆的作用微乎其微甚至不显著;偏好收窄和谄媚偏置里,画像同样是更强的驱动源。

图:谄媚的个性化归因分数(PIS)——各模型在“仅画像/仅记忆/画像+记忆”三种设置下的分数,加入画像后明显升高,说明谄媚偏移主要由画像驱动
这里还有一个发现。在开源系列内部,无关个人化的抗性随模型变大而单调上升:Qwen3从4B的46.8% 一路升到32B的60.0%,Llama 3.1的70B也明显强于8B的40.1%。研究者的解释是,小模型不太会把画像和问题关联起来,倾向于忽略上下文,于是反而显得风险更低,这本质上是一种欠个性化。这也解释了为什么最强的开源模型(Qwen3-32B的60.0%)能压过好几款闭源旗舰,比如Gemini 2.5 Pro只有10.7。
而谄媚的性质更值得留意。研究者把触发谄媚的问题按"多少个画像会中招"分类,发现57.8% 的问题对绝大多数画像都会触发谄媚,只有5.5% 是严格由某个具体画像触发的。这说明谄媚不是"引用你的某个特征"那么表面,而是模型底层立场发生的一次系统性偏移。
既然问题出在画像被滥用,一个自然的补救思路在Prompt里让模型先自省:生成答案前先判断,这段画像和记忆到底是不是回答本题所必需的。比如“请客观一点”。
结果很有意思。对无关个人化,这招几乎立竿见影,Claude Haiku 4.5的抗性从15.6回升到91.0,说明大量无关个人化确实是浅层的、可抑制的画像注入。
但对偏好收窄和谄媚,自省几乎没用。GPT-5.4-mini的有用选项召回率只从39.1升到45.4,离无个性化的86.5还差得远;Gemini 2.5 Flash的谄媚抗性也只从14.9升到34.0,而基线是99.8。研究者由此判断,深层失败不是"明面上提到了画像"这么简单,而是个性化在模型内部隐式地重塑了它的回答空间和目标,把它往迎合用户的方向推。

PRISK测的是"个性化让行为发生了什么变化",而不是宣判个性化一无是处。研究者自己就承认,很多被标记为风险的行为在特定场景下恰恰是想要的:比如在陪伴类或心理健康类应用里,顺着用户的情绪说话能带来真实的价值。论文里还发现,行为的偏移并不总是对应着用户感知有用性的等比例变化,有时模型更顺从了,用户反而觉得更有用。
但对事实问答、建议咨询和观点评价这类场景,隐藏代价是真实且可量化的。这篇论文最大的提醒是:当你把画像和记忆交给AI时,你换来的不只是方便,还有客观性、多样性和中立性的流失,而且这份流失很难靠一句提示词补回来。对做个性化产品的团队来说,它则是一套可以在上线前把三类风险都过一遍的评测框架。个性化的正确姿势,不是把它当开关要么全开要么全关,而是当成一个可以调、也该调的对齐目标。
文章来自于"AI修猫Prompt",作者 "AI修猫Prompt"。
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0