OpenAI也为数据犯难！公司承认使用爬虫自我设限难消公众怀疑

发布日期：2023-09-14 15:34 点击次数：74

　　①OpenAI近日承认，其推出了名为GPTBot的网络爬虫机器人，用于抓取和收集数据用于大模型训练；

　　②OpenAI表示，GPTBot将严格遵守任何付费墙的规则，不会抓取需要付费的信息，并且也不会收集能追踪到个人身份的数据；

　　③这似乎并不能挽回公众对这家大模型头号公司的信任。

　　数据、算力、算法，被视作生成式AI的三个核心要素，很难说哪个更重要。

　　但是，对于OpenAI这类明星公司来说，算力基本上是一个经济问题，大公司凭借“钞能力”囤积了大量昂贵的硬件，数据稀缺问题才更让其头疼，“不光彩”的数据获取方式总让它们陷入道德危机。

　　以OpenAI为例，其抓取公开数据训练AI模型的行为早就备受争议。据国外科技媒体Insider最新报道，OpenAI近日承认，其推出了名为GPTBot的网络爬虫机器人，用于抓取和收集数据用于大模型训练。

　　▌OpenAI被怀疑是“数据小偷”

　　网络爬虫，是一种模拟人（网络用户）的行为，自动浏览、收集网络信息的计算机程序。网络爬虫可以将自己所访问的数据保存下来，数据抓取者对这些数据进行分析等加工再利用，推测出互联网用户的偏好，再顺势推送给与之匹配的用户群体。

　　目前还不清楚OpenAI的爬虫机器人在网上潜伏了多久，有些人怀疑OpenAI已经秘密收集每个人的在线数据长达数月或数年。

　　面对这样的“指控”，OpenAI积极自辩，该公司表示，GPTBot将严格遵守任何付费墙的规则，不会抓取需要付费的信息，并且也不会收集能追踪到个人身份的数据。

　　此外，OpenAI上线了一种阻止GPTbot的方法，用户可以修改其robots.txt文件，或者屏蔽其IP地址，拒绝爬虫的造访。该公司最近还宣布与美联社达成一项协议，OpenAI将付费购买AI训练数据所需的美联社内容。

　　▌消失的信任

　　爬虫技术作为一种数据搜集的手段，本身并没有合法与非法之分。但OpenAI主动为其爬虫工具设限的举动，似乎并不能挽回公众对这家大模型头号公司的信任。

　　老牌科幻杂志《克拉克世界》的主编、雨果奖得主尼尔克拉克（Neil Clarke）表示：“OpenAI和其他大模型公司一再用行动证明，他们不尊重作者、艺术家和其他创意人士的权利，他们的产品很大程度上基于他人受版权保护的作品。”

　　他还举例，CCBot是Common Crawl组织运营的另一种爬虫机器人，目前Common Crawl是人工智能模型训练数据的主要供应商，“据我所知，没有人成功让Common Crawl删除数据，”克拉克说，“我尝试过，没有得到任何回应。”

　　另一方面，在与大公司拉扯时，普通人大多时候处于弱势。正如克拉克所说，既然OpenAI愿意为（美联社）等大公司的数据付费，为什么它不为其他人的信息付费呢？“我就此询问了OpenAI，但没有得到回复。”

　　不过克拉克本身就站在OpenAI的对立面，其一手创办的《克拉克世界》正面临AI生成内容泛滥成灾的局面。克拉克曾指出，在ChatGPT于去年底开放后，AI生成的垃圾投稿激增，而检测这类作品的成本高昂，该杂志一度暂停征稿。

　　▌结语

　　此前，OpenAI已经因版权问题被多方状告，既有克拉克森律所推动的集体诉讼，也有保罗崔布雷（Paul Tremblay）和莫纳阿瓦德（Mona Awad）等畅销书作家在内的名人实名起诉。

　　随着生成式AI技术的进一步迭代，类似的纠纷只会多不会少。

　　大公司更容易成为众矢之的，即使它们敢于承担责任，但要做到数据获取完全合规，并不容易。由于参数量巨大，大模型需要借助分布式计算和云服务等技术来进行训练和部署，又增加了数据被窃取、篡改、滥用或泄露的风险。

　　如何平衡个人隐私保护和鼓励技术创新，如何找到企业生存与合规生产间的最优路径，已经是每个致力于生成式AI事业的公司绕不开的问题。

OpenAI也为数据犯难！公司承认使用爬虫 自我设限难消公众怀疑