NextProxy
← 返回全部场景

USE CASES

爬虫采集

采集失败很少是代码写错了,多半是你从同一个 IP 发了太多请求。分散出口是这件事最便宜的解法。

被拦的三个真实原因

把失败请求按响应码分个类,基本就能定位到是哪一层拦的。

  • 出口 IP 是机房段:ASN 一查就是 IDC,很多站点对这类流量直接降级或者出验证码
  • 同一 IP 频次过高:单位时间请求数超过阈值,触发限流
  • 请求指纹不像浏览器:缺 Accept-Language、TLS 指纹对不上、Header 顺序异常

轮换粒度按目标站定

不是越勤越好。列表页、详情页这种无状态的只读请求,每请求换一个 IP 最省事;一旦流程里有分页游标、购物车、搜索会话,中途换 IP 会让对方认为会话被劫持,反而更容易被打断。

这种带状态的流程要用粘性会话:同一个会话固定一个出口,跑完再换。控制台里可以直接指定会话时长。

成本怎么压下来

住宅代理按流量计费,所以省钱的关键不是压单价,是别下载用不到的字节。

  • 关掉图片、字体、媒体资源的加载,多数采集任务只要 HTML 和 JSON
  • 能用对方的 API 或 sitemap 就不要渲染整页,省下来的是十倍量级
  • 开启 gzip/br 压缩,响应体积通常能降到三成
  • 把重复请求做本地缓存,翻页任务里重复率往往比想象的高