OpenAI主动公开自家爬虫，只为撇清窃取数据之嫌-花粉乐享

> 乐学堂 > > OpenAI主动公开自家爬虫，只为撇清窃取数据之嫌

OpenAI主动公开自家爬虫，只为撇清窃取数据之嫌

来源：三易生活

2023-08-10 20:43:21

472

管理

AI大模型需要海量的数据来“喂养”这一点，已经是毋庸置疑的事情，而ChatGPT之所以表现得如此优秀，背后是OpenAI拿出了超过1750亿个参数。更多的数据几乎就等于更强的性能，也使得数据的价值在大数据时代之后又一次被放在了聚光灯下。那么，AI大模型所需的数据又从何而来呢？

根据OpenAI方面的说法，GPTBot遵守网站提供的robots.txt协议，同时会过滤掉付费才能访问的内容。并且基于OpenAI的相关策略，如果网页中包含个人身份信息或其他违规内容，GPTBot也会删除这部分网页。据悉，GPTBot使用的网段为40.83.2.64/28，网站管理员可以使用nslookup命令来判断这一爬虫的真伪，如果想禁止GPTBot抓取内容，则可以在robots.txt中写入指令，爬虫在检测到该指令后就会按指令要求操作。

robots.txt也被称为robots协议，这是一种存放于网站根目录下的ASCII编码文本文件，它的唯一作用就是告诉网络爬虫，网站中的哪些内容是不对爬虫开放、哪些内容又可以被爬取。而robots协议则是控制网站被搜索内容的一种策略，该文件通常会放在网站的根目录里，在网站域名的后面加上/robots.txt，就可以直接访问该网站的robots协议协议页面。

以淘宝网的robots.txt为例，这个电商网站的robots协议就非常简单，“User-agent”主要作用是会告诉网站服务器，访问者是通过什么工具来请求的，后面的“Baiduspider”就是大名鼎鼎的百度搜索引擎爬虫，最后的“Disallow: /”按照robots协议的规则，是禁止被描述的百度爬虫访问。

没错，百度搜索引擎被淘宝在2008年9月时屏蔽，靠的就是这简简单单的几行代码，让淘宝在战略层面掌握了市场竞争的主动权，避免了流量被百度搜索引擎拿走，也避免了平台内的商家要给百度竞价排名付费的可能，更是间接催生了淘宝的站内竞价排名体系。

robots协议其实本质上来说就是运营方写的一份规则书，它的书写非常简单、逻辑也很直白，诸如允许什么搜索引擎的爬虫访问什么内容都可以清晰的写出来。但需要注意的是，robots协议本身只是一个“君子协议”，是一个搜索引擎和网站之间的共识，它并没有任何法律效力的、也没有任何的技术约束，单纯只是一个道德层面的约束。换句话来说，robots协议在技术层面其实是完全对抗不了爬虫的。

尽管robots协议对于非法爬虫毫无约束力，但是对于重视商誉的公司来说反而具有效力。毕竟以百度的技术力想要强行获取淘宝的数据并不难，但就是这简单的四行代码，就愣是让百度的爬虫在过去十余年里对淘宝“秋毫无犯”。同理，这次OpenAI也是用主动公开自家爬虫的IP地址网段，就是以品牌形象为担保，将自家爬虫的一切行为摆在台面上。

毕竟对于OpenAI方面而言，这也是其在面临窃取数据非议时，最简单、最直接证明自己确实合规的措施。而OpenAI这样对于数据有海量需求、高技术力、且追求“盈利上限”的公司，一边是合规获取海量数据带来的高昂成本，一边是寻求外部资金支持需要拿出更好的预期，要自证清白确实也不太容易。

花粉社群VIP加油站

1

赏礼

赏钱

0

免责声明：本文仅代表作者个人观点，与花粉乐分享无关。其原创性以及文中陈述文字和内容未经本网证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。
凡本网注明 “来源：XXX（非花粉乐分享）”的作品，均转载自其它媒体，转载目的在于传递更多信息，并不代表本网赞同其观点和对其真实性负责。
如因作品内容、版权和其它问题需要同本网联系的，请在一周内进行，以便我们及时处理。
QQ：2443165046 邮箱：info@hflfx.com

吊打Midjourney！OpenAI秘密内测新平台

2023-08-10 20:47

“养”17万个QQ号专为“裸聊”诈骗上海警方摧毁专业养号、贩号“黑灰产”团伙

2023-08-10 20:38