OpenAI 于 2026 年 8 月 19 日在一篇题为《Offering Zero Data Retention for frontier models》的安全博客中,预告了一项名为 Private Safety Processing(私有安全处理,简称 PSP)的新架构。它的目标只有一个:在企业的多次对话中识别出滥用模式,同时不保留任何用户内容,也不让 OpenAI 员工看到原始提示词与模型回复。
单轮审查为何不够
传统的安全过滤大多逐条请求判断。一条有害的提示或回复,单独看往往能被拦下;但真正危险的滥用常常分散在多次交互里。OpenAI 在公告中举例:攻击者会把恶意意图拆进一连串看似无害的提问,反复试探护栏,跨多个账号协同,或把威胁伪装成常规研究。在智能体(agentic)场景里,模型还可能在一次长任务中逐渐偏离用户本意、在被要求停止后仍继续行动。这些问题,单轮评分根本看不见。
PSP 怎么工作
PSP 的核心思路是把”是否发生滥用”的信号,与”说了什么”的内容分离开。在启用零数据保留(Zero Data Retention,简称 ZDR)的部署中,客户内容始终存放在客户自己控制的基础设施上;OpenAI 也在开发一种由自己托管、但用客户掌握的密钥加密的选项,使得 OpenAI 人员拿不到可解密的副本。
当系统侦测到可疑行为时,OpenAI 一侧收到的不是原始内容,而是一则范围极窄的”安全信号”——只说明涉及的活动的类别与严重程度,例如”疑似与武器相关的滥用”,不含任何提示词、回复或客户数据。OpenAI 可据此判断是否采取处置,但工作人员不会直接看到被标记的内容。客户则能用自有系统自行核查告警,并在申诉处置或配合已确认的滥用调查时,自愿上传相关内容。
OpenAI 称这一设计遵循”职责分离”原则:客户控制的基础设施或密钥限制了服务方的访问,而自动化遥测在不暴露完整内容的前提下完成滥用检测。
与 Anthropic 的相反选择
这一公告被普遍解读为对 Anthropic 的直接回应。Anthropic 对其最高能力级别的”Covered Models”(涵盖 Claude Console、Claude Code Enterprise、Amazon Bedrock、Google Cloud Agent Platform 与 Microsoft Foundry)采取了相反做法:保留提示词与输出 30 天,以便分类器跨多次请求观察模式,同时承诺不用这些数据训练,并对人工访问做防篡改日志记录。两家的技术判断其实一致——单轮审核已不够用,真正要抓的是一段”轨迹”而非一条”消息”——分歧只在字节由谁保管。这也是企业采购前沿模型时必须面对的新决策。
仍待九月揭晓的细节
PSP 目前正与早期客户测试,技术白皮书计划于 2026 年 9 月发布。公告中还有一处明确例外:被标记为疑似儿童性虐待材料的图片,即便在零数据保留下,仍会按美国法律要求留存以供人工复核与上报。
对金融、医疗、法律、关键基础设施等受监管行业,PSP 有望缓解”既要部署前沿能力、又要满足数据最小化与第三方访问限制”的矛盾。但 OpenAI 尚未公开跨交互关联的范围、信号粒度、密钥管理、可审计性、误报处理与申诉机制等具体设计。在白皮书发布、外部审计完成之前,PSP 仍是一套有前景、但尚未被验证的框架。








