防火墙穿透、缓存、负载均衡、TLS终止、内容分发、API网关、企业出站流量、基于地理位置的精准数据采集,以及日益增多的AI检索源头流量。1994年4月CERN的一篇论文中记载了该技术的首次应用,当时是为了让位于防火墙后方的员工能够访问外部网络。
代理服务器与万维网同龄:关于其实际功能的简史
1994年4月,一位来自欧洲核子研究组织(CERN)的工程师和一位来自英特尔(Intel)的工程师发表了首篇描述万维网代理的论文(卢奥托宁和阿尔蒂斯,全球万维网代理服务器(, 1994)。当时万维网本身才诞生三年。代理服务器并非事后强行附加到互联网上的权宜之计,而是与互联网同步诞生的。
这段历史值得了解,因为这三十年来,这份工作几乎没有发生什么变化。代理 这是一种代表另一方发出请求并将结果返回的机器。自1994年以来的一切——缓存层次结构、内容分发网络、企业网关,以及当今为人工智能系统提供数据的设备网络——都是这一理念在越来越大的规模上得到应用的结果。
要点总结
- 1994年4月,欧洲核子研究组织(CERN)发布了首篇关于Web代理的论文,该论文当时已将防火墙穿越和缓存视为一项统一任务(Luotonen和Altis,1994)。
- SOCKS 今年迎来了三十四周年。它仍然是一个受支持的协议。
- Cloudflare 于 2026 年 7 月 1 日报告称,截至 2026 年 6 月,超过 50% 的互联网流量来自非人类来源。
- 反向代理、内容分发网络(CDN)、负载均衡器和API网关,其实是同一种机制,只是名称不同。
Web代理到底是从哪里来的?
1994年4月,欧洲核子研究组织(CERN)的阿里·卢奥托宁和英特尔公司的凯文·阿尔蒂斯发表了全球万维网代理服务器,描述了一台服务器,它允许封闭子网中的用户通过防火墙访问互联网(W3C 档案库(1994)。该论文后来发表在计算机网络与ISDN系统. 它解决的问题很简单:位于企业防火墙后方的员工无法访问外部网站,因此必须有人充当中间人。
这就是整个思路,而且一直没有改变。代理服务器是一台代表你发出请求的机器。欧洲核子研究组织(CERN)的实现方案,cern_httpd, 能够支持 HTTP、Gopher、WAIS 和 FTP,这足以说明当时是多么早期的时代。
代理服务器最初的使用场景是访问,而非规避。某家公司希望员工能够访问互联网,却无需为每台工作站都在防火墙上开一个口子。代理服务器就是那个“口子”——唯一、受监管且有日志记录的。
这里有一个容易被忽略的要点。1994年的那篇论文将缓存和访问控制视为同一套功能,由同一台设备提供。 我们直到2026年仍在争论的种种问题——谁可以获取什么内容、获取频率如何,以及源服务器是否应承担相关成本——在绝大多数万维网尚未出现时撰写的一篇论文中,就已经清晰可见了。
关于不同网络类型的实际差异,请参见住宅代理与数据中心代理的对比,或者从什么是住宅代理.
早期互联网为何需要代理服务器才能生存?
带宽是限制因素,而缓存代理则是解决之道。Squid 作为一种至今仍被广泛使用的缓存代理,于 1996 年 7 月发布了 1.0.0 版本,该版本由 Duane Wessels 基于科罗拉多大学博尔德分校开发的 Harvest 对象缓存项目分支而来(Squid Web Cache 项目(,检索于2026年8月31日)。
1996年,某所大学按兆字节计费支付网络连接费用。如果四千名学生每人访问同一个主页,该校就需为同一份文档支付四千倍的费用。 缓存代理解决了这一问题。Harvest缓存可以按层次结构排列,并通过互联网缓存协议(ICP)相互通信,因此,当某个校区出现缓存未命中时,可以由邻近的缓存提供服务,而无需向源服务器请求。
正因为有缓存代理,20世纪90年代的网页才得以加载。这既不是安全问题,也不是隐私问题,而是一个经济问题,而如今这一经济因素又重新浮出水面。
1992年,SOCKS 旨在解决什么问题?
SOCKS比那篇关于Web代理的论文早了两年。1992年9月,David Koblas和Michelle R. Koblas发表了SOCKS 在巴尔的摩举行的第三届 USENIX UNIX 安全研讨会上(USENIX会议论文集(, 1992),此后该协议便向公众开放。第5版被标准化为RFC 1928 1996年3月,该文件描述了一个框架,旨在让客户端-服务器应用程序能够“方便且安全地使用网络防火墙的服务”。
请再读一遍这句话。IETF在1996年提出的核心理念是安全与便利,而非匿名性。
这一模式在整个发展历程中都得以延续。下文中的每个里程碑都解决了特定的操作问题,而这些问题至今依然存在:
人们记忆中最深刻的莫过于Tor,而它比其他项目晚了十年才问世。它是这个故事中的第八幕,而非第一幕。
洋葱路由(Onion routing),即Tor的前身,诞生于同一时代,且源自类似的机构环境。 1995年,美国海军研究实验室的大卫·戈德施拉格(David Goldschlag)、迈克尔·里德(Michael Reed)和保罗·西弗森(Paul Syverson)开始探索是否可以在不透露通信双方身份的情况下建立互联网连接。这项研究产生了首批洋葱路由设计和原型,其目的是保护通过公共网络传输的政府通信(Tor 项目的历史(,检索于 2026-08-31)。后来成为“暗网”代名词的这项技术,是由美国海军资助开发的,旨在防止情报通信被轻易追溯到来源。
在日常生活中,代理会出现在哪些地方?
其中大部分。反向代理 这台机器只是方向相反,为网站所有者而非请求者服务,而且你今天访问的几乎每个网站前面都部署着这样一台机器。内容分发网络(CDN)是分布在网络边缘的缓存代理。负载均衡器也是代理。 应用服务器前端的 TLS 终止服务器就是代理。企业出站网关、学校和图书馆的内容过滤器、API 网关、服务网格:这些全都是代理,它们所做的工作与 1994 年 CERN 那台服务器完全一样。
词汇的选择才是有趣之处。当中介为网站所有者服务时,业内称之为“基础设施”,并将其标注在架构图上;当它为发起请求的一方服务时,业内则称之为“代理”。同一台机器,在请求路径中的位置也相同。仅仅是箭头的方向变了,相应的术语也就随之改变。
这一点值得了解,哪怕只是为了让架构图和供应商列表不再听起来像是两种不同的技术。
为什么如今网络比以往任何时候都更需要代理服务器?
因为互联网已不再主要由人类构成。 在2026年7月1日发布的一份报告中,Cloudflare发现,截至2026年6月,互联网流量中超过50%来自非人类,且52%的爬虫请求用于人工智能训练,这一比例较2025年春季的22%有所上升(Cloudflare,“内容独立日”,一周年(2026年7月1日)。
在同一份2026年的报告中,Cloudflare还发现,用户每花一小时在网上搜索信息,其中仅有十五分钟是在开放网络上度过的;此外,一些被爬取最频繁的类别中,人类流量在不到一年的时间里下降了多达40%(Cloudflare(2026年7月1日)。
将这两项发现放在一起对比,问题的全貌便显而易见。机器承担了大部分信息检索工作,人们将大部分时间花在搜索引擎上,而开放网络的阅读量虽创下历史新高,访问量却降至历史最低点。 每一次机器读取都必须源自某处。这是一个间接问题,而如今它已成为核心问题。
现代设备网络是如何构建的?
关于用户同意。Massive最初是一款应用变现产品,用户通过提供部分闲置计算资源来换取高级功能,每个IP地址均通过Massive SDK主动选择加入。 这使得我们在195多个国家/地区拥有超过100万台经过验证的家庭设备,通过了SOC 2审计,符合GDPR要求,并获得AppEsteem认证,且从源头到请求全程具备完整的审计轨迹。运营商可以确定特定请求是由哪位用户的连接发出的。
这并不是一项新义务。欧洲核子研究组织(CERN)的代理服务器会记录通过它的每一条请求,因为系统管理员必须能够对流量负责。设备网络则在更低一层给出了同样的答案:不仅包括请求的内容,还包括通过谁的连接传输的,以及双方就传输条件达成了何种协议。
在这个网络之上,还部署了一层渲染层,它能够从任何公开来源(无论位于何处)返回干净的 HTML 或 Markdown 代码。这正是 1994 年的问题陈述:无论你实际需要从何处访问公共网络,都能实现访问,且输出格式符合 2026 年数据流的预期。
关于设备网络中同意问题的更全面论述,请参见带宽共享中的“同意”表现形式.
正在开发一个需要连接公共网络的项目吗?
同样的工作,规模却大得多
代理在1994年解决了一个实际问题,而在2026年又解决了该问题的升级版,两次的解决原因都是一样的。有人需要访问无法直接访问的资源,因此必须有某种机制居中协调并高效地完成这项任务。
变化在于规模以及发起请求的主体。CERN的设备仅服务于一个位于防火墙后方的实验室。而如今类似的工作,则是从合适的位置,通过设备所有者已同意承载这些流量的设备,发起机器流量——这种流量在互联网上已超过了人类产生的流量。
三十二年过去了,它依然是一台位于中间的机器,代表某人提出请求,并记录下来。
有关经济格局如何变化的更多信息,请参阅AI爬虫屏蔽、按爬取次数付费,以及这对代理商意味着什么.
来源
- 卢奥托宁(Luotonen),A. 和 阿尔蒂斯(Altis),K.,全球万维网代理服务器, 欧洲核子研究组织(CERN)和英特尔,1994年4月。检索于2026年8月31日。https://www.w3.org/History/1994/WWW/Proxies/
- Koblas, D. 和 Koblas, M. R.,SOCKS, 《第三届 UNIX 安全研讨会》,USENIX 协会,巴尔的摩,1992 年 9 月,第 77-83 页。检索于 2026-08-31。https://www.usenix.org/conference/sec92/socks
- IETF,RFC 1928:SOCKS 协议第 5 版,1996年3月。检索于2026年8月31日。https://www.rfc-editor.org/rfc/rfc1928.html
- Squid Web Cache 项目,什么是Squid?. 检索于 2026-08-31。https://wiki.squid-cache.org/SquidFaq/AboutSquid
- Tor 项目,历史. 检索于 2026-08-31.https://www.torproject.org/about/history/
- Cloudflare,“内容独立日”一周年:构建“能动型互联网”的商业模式, 2026年7月1日。检索于2026年8月31日。https://blog.cloudflare.com/agentic-internet-bot-report/
常见问题解答
cern_httpd,详见全球万维网代理服务器 由阿里·卢奥托宁和凯文·阿尔蒂斯于1994年4月开发。该软件使封闭子网中的用户能够通过防火墙访问HTTP、Gopher、WAIS和FTP,并缓存响应,从而避免重复请求两次访问源服务器。
是的。内容分发网络(CDN)是一种分布式缓存反向代理。它履行了1994年CERN论文中描述的两项相同功能:位于请求链路的中间位置,并对结果进行缓存,只不过箭头指向的是网站所有者,而不是请求者。
因为大多数网络流量已不再来自人类。Cloudflare于2026年7月1日发布报告称,截至2026年6月,非人类流量占比已超过50%,其中52%的爬虫请求用于AI训练,这一比例较2025年春季的22%有所上升。 模型训练、检索和代理工作流均以机器级规模进行数据获取。
设备所有者通常会事先表示同意——通常是为了换取某些具体权益,例如应用的付费功能——并且可以随时撤回同意。独立认证(SOC 2、GDPR、AppEsteem)正是区分“声明性政策”与“经审计政策”的关键所在。
