USE CASES
AI 大模型
模型要吃全球的公开语料,产品要在全球都能开箱可用。这两件事都需要你能从任意地区发出一个普通用户的请求。
两类活儿,别用一种 IP
训练侧是抓取:请求量大、每个请求都很短、失败了重试一次就行。这种流量适合轮换住宅池,按量计费,抓完就停。
推理侧是可用性验证:你要确认自家产品在东京、法兰克福、圣保罗的网络里都能打开、延迟能接受、区域限制没误伤。这种要的是固定出口,同一个 IP 反复用,才能把问题归因到网络还是代码。
只抓公开数据,把合规写进流程
我们只支持采集公开可访问的数据。这不是免责声明,是省钱建议:需要登录、需要绕过付费墙的目标,风控强度和维护成本都在另一个量级,用代理硬碰的结果通常是账号和 IP 一起废掉。
- 抓取前读一遍目标站的 robots.txt 和服务条款,把禁止路径写进爬虫的排除规则
- 给采集器带上能联系到你的 User-Agent,出问题时对方能找到人而不是直接封段
- 限速到目标站点扛得住的量级,一个站点被你打慢了,下一轮就没得抓
- 训练语料保留来源 URL 和抓取时间,后面要溯源或者要删除都靠这两个字段
并发怎么定
先用单线程跑通一个请求,记下平均响应时间;再按「目标 QPS x 响应秒数」估算需要多少并发连接。多数公开站点在 5~20 QPS 之间是安全的,超过之后收益递减、封禁概率上升。