人工智能公司乐于展示自家的使用数据,但一项独立研究指出,厂商报告只呈现了他们想让人看到的一面。
厂商报告之外的空白
Anthropic 与 OpenAI 会定期发布关于 Claude、ChatGPT 使用情况的报告。斯坦福大学可信人工智能研究实验室(STAIR)博士生 Anka Reuel 表示:“目前没有任何独立来源可以佐证这些数据。”Reuel 是“AI 观测台”(AI Observatory)项目的联合负责人,该项目试图填补这一空白。
AI 观测台是一个公开平台,汇总并分析了经用户同意、从七个现有数据集中收集的 Claude、Gemini 等主流模型的真实对话,目标是为研究者和政策制定者提供独立信息,以评估生成式人工智能的实际用法。
近半数对话被“工作”滤掉
最广为人知、被引用最多的厂商数据之一,是 Anthropic 经济指数。顾名思义,它聚焦于 Claude 在工作与生产力场景下的用途,会把无关内容过滤掉。AI 观测台的研究者用 Anthropic 自己的方法处理数据集,发现近一半(48%)的对话本会被过滤掉。
这些被归入“非工作”的对话,更可能涉及健康与人际关系(占比 44.2%,而 Anthropic 原分析中为 31.2%)、成人或违规内容(7.9% 对 2.1%)、骚扰与仇恨言论(27.5% 对 5.66%),以及性相关内容(16.7% 对 2.4%)。OpenAI 在 2025 年关于 ChatGPT 的报告中同样发现,消费端使用场景里只有 30% 与工作相关。
不同模型,用法大不同
研究还显示,模型之间、甚至同一模型的不同版本之间,用法都存在明显差异。Grok 与 Gemini 更常被用于信息检索,其中 Grok 尤其集中在新闻与政治类提问,但也更易聚集不实信息。人们更倾向用 Anthropic 写代码,用 Gemini 进行社交与角色扮演,用 ChatGPT 辅助写作业。
时间维度上,规模最大的数据集之一 WildChat 中的对话随时间变得更长、更琐碎,闲聊增多,而人工智能主动“表明自己是聊天机器人”的频率下降,暗示陪伴式用法在上升。被标记为敏感的对话则变少,说明平台护栏总体在加强。
版本差异同样明显:在 GPT-3.5 驱动下,ChatGPT 对话更短;换成 GPT-4o 后更长、更具反复性——后者正以引发情感依赖著称。
样本仍远小于厂商
AI 观测台汇集了 2023 至 2025 年间、5000 名用户与 52 个模型产生的 24521 段对话、共 85633 个对话轮次。相较之下,Anthropic 经济指数基于 100 万段 Claude 对话,OpenAI 的报告分析了 150 万段 ChatGPT 对话。
由于数据来自自愿提供,研究也承认其对敏感用法的刻画可能偏低。但项目负责人 Reuel 强调,在缺乏独立核查的情况下,任何基于厂商数据做重大判断的人,都是在“毫无依据地行事,只盯着厂商讲述的叙事,却不知道真实发生了什么”。







