开发者实锤:OpenAI的广告正在跨站收集你行为信息

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
开发者实锤:OpenAI的广告正在跨站收集你行为信息
8700点击    2026-09-21 17:17

让人担心的事情,还是发生了。


随着我们越来越习惯把问题交给 AI,聊天记录、工作内容、兴趣偏好,甚至一些原本只属于自己的细节,也在不断进入模型的视野。


但更坏的是,开发者已经实锤,OpenAI 还可能通过一些不那么显眼的方式,获取你在其他网站上的浏览行为。也就是说,即使你没有在 ChatGPT 里说出口,你在网页上的一些动作,也在成为它了解你的另一条线索。


这件事一经披露,已经冲上 HackerNews 热榜第三。


开发者实锤:OpenAI的广告正在跨站收集你行为信息


安全研究者 buchodi 近日发布了一份详细的技术调查报告,逆向了 OpenAI 广告平台(内部代号「bazaar」)的完整追踪链路。结论是,OpenAI 在 ChatGPT 中植入了一枚名为 __obi 的 cookie,它能在用户访问安装了 OpenAI 广告像素的第三方网站时,将浏览行为关联回用户的 ChatGPT 账号。


开发者实锤:OpenAI的广告正在跨站收集你行为信息


  • 博客链接:https://www.buchodi.com/chatgpt-now-knows-what-you-do-on-other-websites-via-ad-collector/


一颗 cookie 的旅程


整个追踪机制分三步完成。


第一步,当用户打开 ChatGPT 时,客户端生成 16 字节的随机标识符,并通过 POST /backend-api/bazaar/obi/sync-token 接口获取一个 RS256 签名的 JWT。这个 token 把随机标识符和用户账号绑定在一起,有效期 60 秒。


第二步,客户端将 JWT 跨站发送到 bzr.openai.com/v1/obi/sync,服务器返回一个 cookie:__obi。该 cookie 设置了 SameSite=None; Secure,有效期一年。这意味着它被明确设计为可以在跨站请求中发送。


第三步,当用户访问安装了 OpenAI 广告像素的商业网站时,浏览器会自动把 __obi 带在请求中发回 OpenAI 服务器。研究者在实际抓包中发现了三类请求都携带了该 cookie,其中最值得注意的一类是:浏览器加载广告像素 SDK 的 <script src> 请求本身就会附带 cookie,甚至在 OpenAI 的任何代码执行之前,标识符就已经被传回了。


简单来说:你只要打开一个安装了 OpenAI 广告代码的网页,OpenAI 就已经知道是你来了。


追踪不止于身份识别。OpenAI 的广告像素 SDK 还会主动从广告主页面上收集用户信息。


研究者观察到的流量中,SDK 通过四个渠道采集数据,OpenAI 自己用标签做了区分:in(广告主主动传入的数据)、fm(从表单字段抓取的数据)、ht(页面渲染文本中抓取的数据)、以及 js(从标签管理器数据层获取的数据)。其中,SDK 自动抓取的数据量远超广告主主动提供的:在观察到的流量中,前者产生了 685 个事件,后者仅 255 个。


SDK 的数据层拦截尤其激进。当前版本会从中提取邮箱和电话号码。而在 8 月 27 日之前的 0.1.31 版本中,它还会抓取用户姓名和地理位置。邮箱、电话、姓名在传输前会经过 SHA-256 哈希处理。但国家、地区、城市和邮编是明文发送的。邮编是被采集最多的表单字段,在 28 个网站上产生了 100 次采集事件。


URL 在发送前被截断为域名加路径,不含查询参数。但研究者在 23929 条观察记录中发现,路径本身就已经暴露了敏感信息,包括一个医疗状况页面、一个债务解决方案流程页面和一个诉讼受理表单。


研究者在自己的设备上做了完整复现,并用两种独立的抓包方法交叉验证,同时对数月间的流量进行了分析,覆盖 936 个不同的广告主像素和 1029 个主机名


在研究者自己的手机上,一个 __obi 值被从 12 个商业网站发送到了 OpenAI 服务器,涉及 13 个不同的像素 ID。这些网站包括宠物电商 Chewy、家居平台 Wayfair、二手书商 ThriftBooks、活动平台 Eventbrite、生鲜订阅 HelloFresh、在线教育平台 Coursera 和票务网站 SeatGeek。所有请求都返回了 202 状态码,意味着服务器确认接收。


在更大范围的流量样本中,30 个不同的 __obi 值里有 12 个出现在了多个广告主的请求中,其中一个值被 10 个不同的广告主发送过。


此外,研究者解码了 932 个同步 token,其中 736 个携带 subject_type: account_user(已登录用户),196 个携带 anonymous(匿名用户)。但匿名标识符和账号标识符一样稳定:每台设备一个,至少持续 27 天不变。


这意味着即使用户没有登录 ChatGPT,OpenAI 仍然可以通过这个匿名但稳定的标识符,持续追踪他们在安装了广告像素的网站上的行为。


OpenAI 与广告数据


研究者自己也指出:Meta 多年前就建立了结构上完全相同的系统。登录账号、第三方 cookie、像素触发、站外行为回溯到用户画像。这套机制是标准的广告技术。


前所未有的是,这套系统运行在一个 AI 聊天产品上。


人们告诉 AI 的事情,是他们不会发在社交网络上的。而这些 AI 产品正在越来越多地代替用户执行操作。


这也是为什么 OpenAI 的广告追踪问题引发了远超传统 adtech 的争议。今年 5 月 1 日,OpenAI 更新隐私政策,宣布开始使用 cookie 在其他网站推广自家产品。5 月 13 日,加州用户对 OpenAI 提起集体诉讼,指控其在 ChatGPT.com 中嵌入了 Meta Pixel 和 Google Analytics,将用户的对话主题、哈希邮箱和设备标识符发送给了 Meta 和 Google。


而这次的机制方向完全相反:OpenAI 自己就是那个广告巨头。它建立了自己的追踪基础设施,让广告主的网站把用户数据送回 OpenAI。


今年 2 月 9 日,ChatGPT 广告正式面向美国免费用户和 Go 级用户上线,每千次展示约 60 美元,最低投放门槛 20 万美元。到了 5 月,OpenAI 将广告系统扩展到了欧洲 31 个国家,广告主数量已达数万。据 Wired 报道,免费用户的营销 cookie 已被默认开启。


对于一个我们每天主动告诉它大量信息、并且正在逐渐替我们访问整个互联网的 AI 来说,了解的更多,就是好事吗?


文章来自于"机器之心",作者 "冷猫"。

AI转型,免费服务,就找AITNT