5 分钟入门:用住宅代理爬取网站(Node.js & Python)
零基础学会安装代理 SDK、配置环境、运行代码,第一次成功爬取网站。
准备环境
你需要安装 Node.js(一个让 JavaScript 在电脑上运行的工具)或 Python(另一种编程语言)。如果还没装:去官网下载安装包,一路默认安装即可。同时需要一个代码编辑器,比如 VS Code。
安装代理 SDK
我们使用 Aethyn SDK(一个帮你快速构建代理连接的代码库)。打开终端(命令行),运行以下命令之一:
- Node.js:
npm install proxy-builder-sdk - Python:
pip install proxy-builder-sdk
等待安装完成,没有报错就是成功。
配置并运行第一个爬虫
创建一个新文件(比如 scrape.js 或 scrape.py),复制下面的代码:
Node.js 版本:
const { ProxyBuilder } = require('proxy-builder-sdk');
const pb = new ProxyBuilder({ username: '你的用户名', password: '你的密码' });
const proxy = pb.proxy(); // 每次请求换 IP
const response = await fetch('https://api.ipify.org?format=json', { proxy });
const data = await response.json();
console.log(data); // 打印你的出口 IPPython 版本:
from proxy_builder_sdk import ProxyBuilder
pb = ProxyBuilder(username='你的用户名', password='你的密码')
proxy = pb.proxy() # 每次请求换 IP
import requests
response = requests.get('https://api.ipify.org?format=json', proxies=proxy)
print(response.json()) # 打印你的出口 IP把 你的用户名 和 你的密码 换成你在 Aethyn 注册后获得的凭证(格式类似 aethyn-xxxxx)。也可以设置环境变量 AETHYN_USERNAME 和 AETHYN_PASSWORD,代码会自动读取。
运行文件:node scrape.js 或 python scrape.py。如果看到一串 JSON 输出(比如 {"ip": "123.45.67.89"}),就说明成功了!
下一步:爬取真正的网站
把上面的 URL 换成你想爬的网站(比如 https://example.com),然后加上解析逻辑即可。注意:robots.txt(网站告诉爬虫哪些页面可以访问的文件)和 速率限制(网站限制请求频率的机制)要遵守,只爬取公开数据。如果遇到 403 或 429 错误,换一个代理 IP 再试——proxy() 会自动轮换 IP。
新用户注册 Aethyn 会获得免费流量,无需绑定信用卡,可以零成本跑通以上所有代码。更多文档见 aethyn.io/sdk。
内容来源
DEV Tutorial
发布时间
2026-07-20 01:31