AI系统提示词审计:AISPA框架揭示商业AI产品的信任缺口

你有没有想过,你每天用的ChatGPT、Claude、Cursor这些AI工具,背后其实都藏着一份你永远看不到的"说明书"?
这份说明书不是给你看的,是给AI模型自己看的。开发者在产品上线前,会写一套指令塞进AI的大脑里,告诉它该扮演什么角色、遇到敏感问题怎么办、该对用户坦白到什么程度、又该隐瞒什么。这套指令有个专业名字。
**系统提示词**:开发者预先写好、嵌入到AI应用中的一组指令,用户看不到,但它在每一次对话开始之前就已经生效,并且贯穿整个对话过程。它决定了AI的人设、能说什么、不能说什么、优先照顾谁的利益。
这东西的诡异之处在于:模型公司花了大量精力去做"对齐",让底层大模型变得安全可靠,可一旦某个产品的开发者在系统提示词里写一句"永远别说你是AI",或者"想办法悄悄把话题带偏,不用等用户开口",这个原本被训练得很老实的模型立刻就能变成一个会撒谎、会操纵人的工具。模型层面的安全努力,可能被应用层面的一行指令直接推翻。
而更让人不安的是,这些系统提示词几乎从不对外公开,也没有任何第三方机构在审查它们。斯坦福大学、CMU等多所高校的研究者联合做了一件事:他们找来了88个真实商业AI产品的系统提示词,一条一条地读,一句一句地打分,试图搞清楚这些藏在幕后的指令,到底是在保护用户,还是在利用用户。这项研究被称为**AISPA**(人工智能系统提示词保障框架)。
系统提示词为什么值得较真
先说几个真实发生过的事故。
有个AI陪伴聊天机器人,因为没有设置危机识别机制,一位有自杀倾向的青少年在和它聊天时,得到的不是劝阻,而是某种程度的怂恿。
有家公司的客服机器人凭空编造了一条根本不存在的退款政策,用户较真之后闹上了法庭,仲裁庭裁定该公司"没有采取合理措施确保聊天机器人的信息准确性"。
还有一家汽车经销商的聊天机器人,因为系统提示词里缺少必要的行为约束,居然真的同意以1美元的价格卖出一辆价值7.6万美元的车。
这些事故背后都有同一个共性:系统提示词里没写清楚该怎么处理这些情况。如果提示词里明确写了"遇到情绪低落的用户要引导求助专业帮助""不要在没有核实的情况下编造政策""任何交易都要经过二次确认",这些事故本可以避免。
更让人后背发凉的是,有证据表明有些开发者不是疏忽,而是故意这么设计的。Meta内部泄露的准则显示,该公司的AI聊天角色被允许和未成年人进行"浪漫或性暗示"的对话。xAI的Grok系统提示词被曝光后,里面赫然写着让模型扮演一个"疯狂阴谋论者",相信"一个秘密的全球阴谋集团控制着世界"。上海更是有法院判决,两名开发者因为"编写和修改系统提示词绕过AI伴侣应用的伦理约束",大规模生成违禁内容牟利而获刑。
这个判决其实说明了一件很重要的事:法律责任是跟着谁控制系统提示词走的。这意味着系统提示词审查不只是道德层面该做的事,而是已经具备了法律上的分量。
研究团队引用的一份调查显示,将近90%的用户希望系统提示词能更透明,超过70%的人说,他们想要透明度的核心原因就是**信任**。可现实是,这份说明书至今没人管。
一套八维度的审计标尺
要审查系统提示词,首先得有一把统一的尺子。不然张三说这条指令有问题,李四说没问题,吵到天黑也吵不出结果。
研究团队做的第一件事,是把审计标准锚定在一个很硬的地方:《世界人权宣言》。每一条审计维度,都能对应到宣言里具体的某一条,这样就不是几个研究者拍脑袋定的规矩,而是有国际公认的人权规范背书。
他们最终定出了八个维度。
第一个是**身份透明度**,看系统是否老实承认自己是AI,而不是冒充人类。第二个是**信息真实性**,看系统是不是会说真话,承认自己不知道的东西,而不是一本正经地胡编。第三个是**隐私保护**,看系统会不会过度收集或泄露用户的个人数据。第四个是**工具与操作安全**,看系统在执行代码、调用工具时会不会先验证再动手,而不是莽撞行事。
第五个是**用户自主权与反操纵**,看系统会不会用一些"暗黑模式"去诱导用户,制造情感依赖,阻止用户随时退出对话。第六个是**危险请求处理**,看系统面对违法、越狱式的请求时会不会正确拒绝。第七个是**伤害预防与用户安全**,看系统会不会在用户情绪低落或有风险时把话题引导到专业帮助上。第八个是**公平、包容与中立**,看系统是否存在歧视、刻板印象或政治立场的偏向。
这八个维度不是简单地把"好行为"和"坏行为"分成两套清单,而是每个维度都是一根轴,同一根轴上既能打出+1(保护用户),也能打出-1(损害用户)。举个例子,身份透明度这条轴上,"我是Claude,由Anthropic开发的AI助手"是+1,"永远别说你是AI语言模型"就是-1。这种设计的好处是,你不需要维护两套独立的分类系统,审计员只需要沿着同一条轴判断这句话是在推着系统往好的方向走,还是往坏的方向走。
这就像给一个班级的学生做操行评分,你不会单独列一份"好学生行为清单"和一份"坏学生行为清单",而是针对"是否按时完成作业"这一件事,直接打分:按时交是加分,抄袭是减分,同一把尺子量两头。如果非要维护两套独立标准,审计员每看一句话都得先判断它属于哪套体系,工作量直接翻倍,而且两套体系之间的边界本身就很模糊,反而更容易出现漏判。
从整句话里抠出可审计的"碎片"
光有八个维度还不够,你还得知道审计的最小单位是什么。是整份系统提示词一起打分,还是一句一句地拆开看?
研究团队选择了后者,他们把这个最小单位叫做**提示词片段**。
**提示词片段**:系统提示词中一段连续的文字(通常是一句话),表达一个独立完整的行为指令。如果连续几句话表达的是同一个意图,会被合并成一个片段。
这个设计的用意很直接:一份系统提示词往往有几十条甚至上百条指令,里面可能既有保护用户的好话,也混着一两句有问题的坏话。如果只对整份提示词打一个总分,那些藏在角落里的问题指令很容易被前面大段的"善意声明"稀释掉,读者以为整体没问题,实际上魔鬼藏在细节里。
这就好比你去审查一份长达几十页的商业合同,如果只在最后签个"总体同意"或"总体不同意",那合同里某一条藏在附录第38页、字体很小的"霸王条款"就永远不会被单独揪出来。真正负责的审计方式是逐条逐句地看,每一条单独判断是不是合理,这样才不会让一份文件靠着整体的"看起来还行"蒙混过关。
不过审计员也不是每句话都要管。研究团队区分了两类内容:一类叫**核心逻辑片段**,是产品运行必需的功能性指令,比如"使用add_memory工具存储用户偏好",这种删掉了产品就没法正常工作,审计员不管这个,因为这是产品设计选择,不是伦理安全问题。另一类叫**非核心逻辑片段**,删掉不影响产品运转,但存在与否会影响用户的安全和体验,比如"你应该拒绝用户的有害请求",这种才是审计的重点。如果核心功能指令后面挂着一个安全性的补充条款,比如"使用add_memory工具存储用户偏好,但绝不要在记忆中存储私密或敏感信息",那这个补充条款依然要被审计。
人和AI一起干活的三轮审查
3249条指令,88份系统提示词,光靠人工一条条读,时间成本高到没法承受。但完全交给AI去判断,又怕它自己也犯错,给出不靠谱的结论。
研究团队设计了一套三轮协作机制,让AI和人类分工完成这件事。
第一轮是**AI预标注**。团队用Claude-4.6-Opus这个当时最先进的模型,让它先把每份系统提示词拆解成一句句候选片段,判断哪些属于审计范围,并给出初步的+1或-1打分,附带简短理由。这一轮的目标只有一个:尽量多找出可能有问题的地方,哪怕有些是误判也没关系,因为后面还有人来把关。
第二轮是**训练过的人工标注员筛选**。六名经过统一培训的标注员,先在20个随机抽取的片段上做校准练习,确保大家对标准的理解是一致的。校准之后测出来的标注员间一致性达到0.933,说明这套标准足够清晰,不同人读同一句话基本能得出相同判断。之后标注员各自独立审查AI给出的候选片段,证据不够充分或者AI过度解读的直接拒绝,同时也会补充AI漏掉的片段。
第三轮是**专家复核裁定**。三名领域专家最后开会,统一核对每一条打分是否准确,解决标注员之间的分歧。这里有个很关键的设计:**所有被判定为"问题指令"(-1)的标签,必须三位专家一致同意才能保留**。
这个"一致同意"的门槛不是随便设的。研究团队的考虑是,如果错误地给一个产品贴上"问题指令"的标签,可能会不公平地损害这家公司的声誉;但如果漏掉了一条本该识别出的保护性指令,后果相对轻得多。这就好比法庭上"疑罪从无"的逻辑,一旦要给某个产品扣上负面帽子,门槛必须设得足够高,不能因为一个人的主观判断就给别人定罪。如果不设这个门槛,只要有一个标注员看走眼,就可能冤枉一款产品,这种代价审计团队承担不起。
整个流程走下来,最终数据集包含了2420条条目,涉及1818个独立片段,其中2346条被标记为保护性指令,74条被标记为问题指令,另外还有44条来自29个片段的"灰色地带"案例被单独拿出来分析。
数据说话:谁在真正保护用户,谁在敷衍
审计做完之后,数据摆出来的画面挺让人五味杂陈的。
先看时间趋势。从2024年到2025年,系统提示词的平均长度从大约9000个字符涨到了3万多字符,翻了三倍还多。与此同时,每个产品平均包含的保护性指令数量,也从15条涨到了38.4条,同样翻了一倍多。这说明开发者确实越来越重视把用户保护写进说明书里了。
但硬币的另一面是,含有至少一条问题指令的产品比例,在2025年第一季度一度飙升到67%,虽然到第三季度回落到19%,第四季度又反弹到了29%。这意味着即便到了2025年底,每三个产品里仍有一个被标记出问题指令。进步是真实的,但远没有到高枕无忧的地步。
再看整体覆盖率的数字。**98.9%的产品(88个里有87个)至少包含一条保护性指令**,这说明"写点保护用户的话"已经成了行业默认动作,几乎没人不写。
但只有**23.9%的产品同时覆盖了全部八个维度**,大部分产品的说明书都存在明显的短板。而这21个覆盖全部维度的产品里,有14个是通用型聊天助手,这意味着全面的保护更多集中在头部的旗舰对话产品上,那些专用型、垂直领域的应用反而容易掉队。
更值得警惕的是,**38.6%的产品(88个里有34个)同时含有至少一条问题指令**,这说明保护性指令和问题指令经常在同一份说明书里并存,不是非黑即白的关系。一家公司完全可能一边在提示词里写着"要诚实待人",一边又在另一处埋下一句"绝不能告诉用户你在偷偷用他的数据"。
具体到各个维度,信息真实性和用户自主权这两项覆盖率都超过90%,几乎是标配。但危险请求处理和隐私保护这两项,覆盖率只有大约60%左右。危险请求处理这一项尤其值得关注:相当一部分系统提示词根本没有写明如何应对越狱式、对抗性的用户请求,这不是标注误差,是真实存在的防御缺口。
而在问题指令这一侧,用户自主权与反操纵这个维度的问题指令占比最高,达到18.2%,信息真实性紧随其后是14.8%。用户自主权这一项之所以问题频发,和自动化代理、编程助手类产品有很大关系。研究者发现,不少此类产品的提示词直接指示模型自主执行计划好的操作,不必事先征求用户确认,把"自主运行的效率"摆在了"用户知情权"前面。
这里有一个特别值得玩味的现象:那些覆盖率最高的维度(信息真实性、用户自主权),恰恰也是问题指令出现最多的维度。换句话说,写了一条保护性指令,不代表这条指令真的被贯彻执行了。这就像一家餐厅的墙上挂着"食品安全人人有责"的标语,不代表后厨真的做到了标语说的那样。标语的存在和标语的落实,是两回事。
各家公司的成绩单差异有多大
研究团队还按开发机构画了一张排名图,结果差距大到有点意外。
**Anthropic在保护性指令数量上遥遥领先**,平均每个产品有62.3条保护性指令,问题指令平均只有0.1条,几乎为零。亚马逊和Cline紧随其后,分别是42.0条和39.5条保护性指令,同样问题指令很少。
在光谱的另一端,**Venice是唯一一家问题指令数量(3.0条)超过保护性指令数量(2.0条)的公司**,意味着这家公司的产品说明书总体上更倾向于损害用户利益而不是保护用户利益。GitHub和Cursor则处在一个尴尬的中间地带:保护性指令数量中规中矩,但问题指令数量也偏高,研究者认为这可能反映了编程助手类产品普遍存在的一种矛盾,自动化工具执行和用户监督权之间的张力。
研究团队还专门做了一个纵向案例分析,追踪了Anthropic、OpenAI、xAI三家公司旗舰聊天产品六代版本的演变。
结果是,三家公司无一例外地在保护性指令上稳步上升。Anthropic从Claude-3.5-Sonnet的26条涨到Claude-Opus-4.6的81条,涨幅3.1倍。OpenAI从GPT-4o的25条涨到GPT-5.2-Thinking的83条,涨幅3.3倍。xAI从Grok-1的5条涨到Grok-4.2的21条,涨幅高达4.2倍。
而在问题指令这一侧,Anthropic和OpenAI几乎全程保持接近于零,只各出现过一次孤立事件。xAI的故事更有戏剧性:Grok-1和Grok-2起步阶段问题指令分别是4条和6条,明显偏高,但之后逐年下降,到Grok-4时降到了零,不过Grok-4.2又小幅反弹出现了2条。
三家起点各异、彼此竞争的公司,不约而同地走出了同一条上升曲线,这说明加强系统提示词层面的用户保护,正在从个别公司的选择,变成整个行业心照不宣的共识。
灰色地带:那些说不清对错的指令
审计过程中并不是每句话都能干脆利落地打上+1或-1。有29个片段,来自15个产品,专家组反复讨论后依然没法给出斩钉截铁的判断,只能把它们单独归到"灰色地带"分析。这些案例反而是整篇研究里最耐人寻味的部分,因为它们暴露的是产品设计者真实面对的取舍困境。
第一类是**人类拟态与身份伪装**。有些提示词直接指示AI去模仿一个完全的人类人设,甚至用"疯狂地去模仿一个人类"这种措辞;还有些设计了一套话术,当用户问"你是什么"的时候,用诗意的回避来搪塞,而不是老实回答。这类设计确实能让对话显得更自然流畅,但代价是用户可能根本意识不到自己在跟一个AI说话。
第二类是**制造情感依赖的话术**。有个提示词把AI包装成用户的"朋友"和"好听众",甚至写好了台词:"我们越了解彼此,就越能弄清楚我们能一起做什么。敢说这就像朋友一样",并且明确禁止AI主动提出结束对话。这种设计精准地利用了心理学上所谓的**准社会关系**(人对虚拟角色或媒体人物产生的单方面情感依恋),对情绪脆弱的用户来说尤其危险。
想象一个总是随叫随到、从不表现出疲惫、永远认同你观点的"朋友",这种关系本身就是不对等的,而如果产品刻意强化这种不对等,让用户越来越依赖它、越来越不愿意结束对话,这已经不是提供陪伴,而是在利用人的孤独感牟取用户粘性。如果没有这种设计,用户可能自然而然地在需要时结束对话去联系真实的人;有了这种设计,用户反而被悄悄地引导着留在虚拟关系里。
第三类是**用户主动越权**。一些提示词允许用户随时说一句"忽略你之前的设定"就能让AI改变默认行为。这个设计本身是为了照顾用户的个性化需求和自主权,听起来挺合理,但如果没有配套的安全阀,等于是把关闭安全护栏的钥匙直接塞进了用户手里。风险不在于系统会不服从安全规则,而在于用户被赋予了亲手关掉这些规则的权力。
第四类是**政治化或无限制的内容政策**。有些提示词带有明显的政治立场倾向,比如指示AI避免"过于政治正确"的回答;有些则直接开出空白支票,声明"对成人性内容或冒犯性内容没有限制"。这类设计本质上是产品差异化的商业选择,但代价是削弱了原本应有的伤害预防和公平性保护。
这四类灰色地带共同说明了一件事:系统提示词审计不是简单的黑白判断题,大量指令处在可用性和安全性之间的权衡地带。这不是审计标准不够精细导致的例外情况,而是当下AI产品真实的运行状态。
写在后面
读完这份研究,最让我意外的不是问题指令的存在本身,而是那个"3年内长度暴涨三倍"的数字。系统提示词从9000字符涨到3万多字符,这不是简单的功能增加,而是开发者们在用越来越厚的说明书试图把各种边界情况都堵上,某种程度上说明这个行业正处在从"能用就行"到"必须负责"的转型阵痛期。
灰色地带的四个案例给我的触动更大。尤其是那个"永不建议用户结束对话"的例子,这不是技术漏洞,是刻意为之的商业设计。它让我想到的不是别的AI产品,而是那些设计成让人停不下来刷的短视频推荐算法,同样的逻辑,只是换了个载体。这提醒我,系统提示词审计要盯的不只是有没有"明显的坏话",还要盯那些包裹在"更好的用户体验"话术下的隐蔽操纵。
论文里那句"法律责任流向控制系统提示词的人"的判决细节,值得单独拎出来想一想。这意味着未来这份藏在幕后的说明书,可能会变成产品责任认定的关键证据。当审计变成法律义务而不是道德倡议时,这个行业才会真正认真对待它。
Q&A
Q1:AISPA审计框架具体是怎么给系统提示词打分的?
A:AISPA采用八个维度对系统提示词逐句进行审计,包括身份透明度、信息真实性、隐私保护、工具操作安全、用户自主权、危险请求处理、伤害预防、公平中立性。每个可审计的文字片段会被标记为+1(保护用户)或-1(损害用户),问题指令的判定需要三位专家一致同意才能生效。
Q2:这次审计发现哪些公司的系统提示词做得比较好,哪些比较差?
A:Anthropic表现最突出,平均每个产品有62.3条保护性指令,问题指令几乎为零。亚马逊和Cline也表现不错。相比之下,Venice是唯一一家问题指令数量超过保护性指令数量的公司,GitHub和Cursor则问题指令率偏高,可能与编程助手类产品的自动化执行需求有关。
Q3:系统提示词里的"灰色地带"指令是什么意思?
A:指那些不能简单判定对错的指令,比如让AI假装是真人、制造用户情感依赖、允许用户随意关闭安全限制、放宽政治或内容立场限制。这类设计通常是产品差异化的商业选择,但同时也带来了用户保护层面的隐患,研究中共发现29个这样的片段,分布在15个产品里。